Anthropic publicou um post em 26 de agosto descrevendo um projeto-piloto que deu a parceiros acadêmicos externos acesso a descobertas extraídas de dados de uso do Claude, incluindo laboratórios em Stanford e na University of Oxford. É um passo genuíno — muito pouco do que se sabe sobre como as pessoas realmente usam assistentes de ponta vem de fora das empresas que os operam. Também é consideravelmente mais restrito do que a formulação sugere.
O que os pesquisadores realmente receberam
Não conversas. A Anthropic afirma que os pesquisadores "nunca acessaram conversas brutas, apenas resultados agregados após a mesma revisão jurídica e de privacidade aplicada ao nosso trabalho interno." A unidade de acesso é um agregado revisado produzido pelo próprio sistema de análise da Anthropic em resposta a uma pergunta feita pelo pesquisador. O pesquisador especifica a pergunta; o pipeline da Anthropic produz a resposta; uma etapa de revisão fica entre as duas.
A restrição que mais importa
O trabalho empírico sobre um corpus é iterativo. Você pergunta, vê o formato da resposta, descobre que sua categoria estava errada, redefine-a e pergunta de novo. A Anthropic é explícita ao dizer que isso não estava disponível: "Parceiros externos não podiam fazer isso, já que a revisão de privacidade repetida antes de compartilhar cada conjunto de dados tornaria o estudo inviável." A saída encontrada foi desenvolver e testar perguntas contra WildChat, um conjunto público de conversas, e depois executar a versão final uma única vez sobre dados do Claude. Os pesquisadores refinaram seus instrumentos em um corpus diferente daquele que estavam estudando.
O que a formulação comum interpreta errado
Deste trabalho estão circulando dois números: que mais da metade das conversas envolve a delegação de tarefas relevantes, e que quase três quartos mostram pessoas direcionando o trabalho enquanto o Claude auxilia. Isso soa contraditório — a maior parte do trabalho é delegada, a maior parte é liderada por humanos — e não é, porque os cálculos usam denominadores diferentes. A cifra de delegação é em relação às conversas estudadas; a de direcionamento é em relação ao subconjunto analisado para papéis de colaboração entre humanos e IA. Citá-las lado a lado como se descrevessem a mesma população produz um paradoxo que não existe na fonte. A Anthropic também observa que menos de 5% das categorias e das conversas em cada estudo envolviam conteúdo que violava políticas e foi removido ou alterado, o que limita o quanto o agregado revisado se afasta dos dados subjacentes.
Por que o desenho ainda vale algo
A alternativa ao acesso restrito é nenhum acesso, e a área tem operado com a segunda opção. O que este projeto-piloto não pode sustentar é trabalho causal ou exploratório — qualquer coisa que exija que o pesquisador siga um resultado surpreendente. O que ele pode sustentar é trabalho confirmatório sobre perguntas definidas com antecedência. Isso é uma categoria real, e descrever o arranjo com precisão é a diferença entre tratar esses resultados como achados independentes e tratá-los como achados independentes especificados e produzidos internamente.
