O problema do 'superfrango' da Anthropic

@SebaTheOracle
INGLÊShá 3 dias · 18/07/2026
132K
207
17
9
415

TL;DR

Cody Peterson argumenta que o foco da Anthropic na excelência e segurança de modelos individuais cria um problema de 'superfrango', onde a experiência geral do produto sofre em comparação com rivais mais centrados no usuário, como a OpenAI.

Como o laboratório mais inteligente do mundo acidentalmente enviou o produto errado

Pedi ao modelo público mais capaz da Anthropic para editar um ensaio sobre a Anthropic. Ele nunca teve a chance. Anexei este rascunho e digitei sete palavras inofensivas: "Reescreva, faça isso BRILHAR. Formate para o Twitter." O aplicativo automaticamente mudou a tarefa de Fable 5 para Opus 4.8. Sua explicação foi simples: "As salvaguardas do Fable sinalizaram esta mensagem."

Para ser preciso, isso não foi uma limitação de taxa comum. O Fable não respondeu e se recusou. A salvaguarda da Anthropic interceptou a requisição antes que o modelo selecionado pudesse responder e a encaminhou para outro modelo. A Anthropic explicou que é exatamente assim que o sistema funciona: quando o classificador do Fable bloqueia uma requisição, a requisição é enviada para o Opus 4.8. A empresa também reconheceu que deliberadamente ampliou a margem de segurança do classificador, sabendo que o resultado seria mais falsos positivos em trabalhos benignos. (Anthropic

Não sei por que a salvaguarda foi acionada, e não estou afirmando que a Anthropic censurou críticas. O fato verificável — e suficientemente estranho — é que uma requisição de edição rotineira foi capturada por uma salvaguarda cujo próprio aviso mencionava falsos positivos em trabalho legítimo de codificação, segurança cibernética e biologia. Foi uma abertura quase comicamente perfeita para um ensaio sobre a equipe que criou o que muitos acreditam ser o sistema de IA mais brilhante do planeta.

Este ensaio examina o que acontece quando um sistema fica tão preocupado com o desempenho de suas partes individuais que perde de vista o resultado que o sistema inteiro existe para produzir. O modelo pode ser brilhante, a salvaguarda pode operar exatamente como projetada, e a política de preços pode fazer perfeito sentido para as pessoas que a criaram. O trabalho do usuário ainda pode permanecer inacabado.

Exemplo A:

Cody Peterson - inline image

Pedi ao Fable 5 para editar este artigo. As salvaguardas da Anthropic sinalizaram a requisição e a mudaram para o Opus 4.8.

As Galinhas e Seus Ovos

Em 1982, o geneticista da Purdue, William Muir, iniciou um experimento de reprodução incomum com galinhas poedeiras. Muir queria saber o que aconteceria se a produtividade fosse selecionada ao nível do grupo, em vez do indivíduo. Em vez de reproduzir apenas a partir das aves individuais de maior produção — uma medida de produção individual pura — ele alojou galinhas aparentadas juntas e selecionou grupos familiares inteiros de acordo com seu desempenho coletivo. A gaiola, em vez da galinha isolada, tornou-se a unidade de seleção. (PubMed

Margaret Heffernan mais tarde transformou o programa técnico de reprodução de Muir na famosa história da "supergalinha". Para gestores, sua história se tornou um aviso sinistro: contratar os mais fortes e mais inteligentes nem sempre produz o melhor resultado. Em sua releitura, um grupo de galinhas foi autorizado a permanecer um grupo comum — sem supergalinhas permitidas. Um segundo grupo foi reproduzido repetidamente a partir das galinhas individuais mais produtivas; ela as chama de "as galinhas estrelas". (Purdue Alumnus

Os resultados foram dramáticos. Ao longo de seis gerações, a mortalidade anual no grupo selecionado de Muir caiu de 68% para 8,8%. No mesmo período, a produção subiu de 91 para 237 ovos por galinha alojada — 2,6 vezes sua produção original. Em uma comparação direta posterior realizada em grupos de doze, uma linhagem comercial selecionada para desempenho individual sofreu 89% de mortalidade com 58 semanas de idade. A linhagem selecionada em grupo de Muir sofreu apenas 20% de mortalidade, enquanto o controle não selecionado sofreu 54%. Nesse mesmo ambiente de grupo, o grupo selecionado superou as estrelas comerciais em ovos por galinha alojada, massa de ovos e ovos por galinha por dia. (PubMed

Enquanto isso, o grupo de supergalinhas estava esfarrapado e desgastado. Na versão do experimento que tornou a história famosa, seis das nove galinhas estrelas estavam mortas e as três restantes haviam sido bicadas até ficarem nuas. O grupo havia, quase literalmente, se bicado até a morte. (Purdue Alumnus

A lição nunca foi que a mediocridade vence o talento. A verdadeira lição é que sua produção refletirá o que você recompensa. Selecione apenas para desempenho individual e você pode acidentalmente construir uma equipe mais fraca, porque os traços que permitem a um indivíduo dominar podem reduzir a produtividade de todos ao seu redor. Selecione indivíduos de acordo com o que eles contribuem para o grupo, e qualidades que desaparecem dentro de uma classificação individual — compatibilidade, contenção, confiabilidade e cooperação — de repente se tornam visíveis.

A verdadeira contribuição de uma galinha não é meramente quantos ovos ela consegue produzir. Inclui o que sua presença permite — ou impede — que as outras galinhas produzam. Muir não havia abandonado a produtividade em favor da harmonia. Ele havia descoberto que, em um sistema social, a harmonia é parte da produtividade. A verdadeira unidade de desempenho nunca foi a galinha. Era o galinheiro.

Aprendi uma versão dessa lição dura enquanto administrava minha própria empresa de construção. Por anos, ajuda confiável era tão difícil de encontrar em nosso ofício específico que uma estrela parecia uma salvação. Mas as pessoas que pareciam estrelas muitas vezes vinham com um imposto oculto: exceções extras, gestão extra, moral danificada e atrito que o resto da equipe tinha que absorver.

Eventualmente, parei de perguntar apenas: "Quão bom esta pessoa é no seu ofício?" e comecei a perguntar: "O que acontece com o trabalho de todos os outros quando esta pessoa entra na equipe?" A pessoa que parece mais forte nem sempre é a pessoa que realmente torna a empresa mais forte. Um mestre artesão que atrasa todos os ofícios adjacentes, consome a atenção do encarregado ou afasta pessoas confiáveis pode ser impressionante isoladamente e caro na prática. Um trabalhador mais quieto que torna toda a equipe mais confiável pode contribuir muito mais do que sua produção individual revela.

O Supergalinheiro

A Anthropic realmente montou um grupo extraordinário de galinhas muito inteligentes. Uma análise da SignalFire de 2025, baseada em dados públicos de emprego, estimou que os engenheiros tinham oito vezes mais probabilidade de se mudar da OpenAI para a Anthropic do que o contrário e quase onze vezes mais probabilidade de se mudar para lá da DeepMind. Também estimou que 80% dos funcionários da Anthropic contratados pelo menos dois anos antes permaneciam até o final do segundo ano, em comparação com 78% na DeepMind e 67% na OpenAI. (SignalFire

Esses números não descrevem uma empresa com dificuldades para atrair ou reter talentos. Eles descrevem um ímã para estrelas.

Isso não significa que os funcionários da Anthropic estão se bicando até a morte. Essa seria uma analogia barata, e os números de talento não provam isso. O perigo mais importante é mais sutil. Quando uma empresa pode apontar credivelmente para pesquisadores excepcionais, retenção excepcionalmente alta e modelos de ponta, torna-se fácil tratar a excelência nas partes individuais como prova de que todo o sistema está funcionando.

O experimento de Muir demonstra por que essa inferência não pode ser confiável. O perigo não é o brilho em si. O perigo é medir o desempenho um nível abaixo do necessário.

O Modelo Não é o Produto

A indústria de IA é construída em torno de supergalinhas: pesquisadores famosos, modelos líderes de benchmark, pacotes de compensação enormes e páginas de lançamento cobertas de superlativos. Dentro do laboratório, a hierarquia de bicadas é óbvia. Fora dele, só vemos os ovos.

O Vale do Silício tem um ponto cego claro: sua equipe pode ser extraordinária enquanto o produto que você construiu permanece frustrante, inacessível ou não confiável.

Os usuários do dia a dia não julgam um modelo por sua equipe de galinhas talentosas ou seus benchmarks. Nós só temos o modelo, o aplicativo, as salvaguardas, os limites de uso, os preços, o suporte ao cliente.

Duas Empresas, 74 Minutos de Diferença

Em 17 de julho, a Anthropic respondeu à demanda esmagadora pelo Fable com um compromisso. A partir de 20 de julho, os assinantes Max e Team Premium receberiam o Fable como parte de seus planos, mas com metade dos seus limites normais. Os usuários Pro e Team Standard continuariam a acessar o modelo através de créditos de uso e receberiam um crédito único de $100.

https://x.com/claudeai/status/2078302415804379218

Setenta e quatro minutos depois, Thibault Sottiaux, da OpenAI, anunciou que os limites de uso foram redefinidos para todos os usuários pagantes do Codex e ChatGPT Work.

Estas não eram ofertas economicamente idênticas. A Anthropic estava estabelecendo uma política de acesso contínuo para um modelo excepcionalmente intensivo em computação, enquanto a OpenAI estava concedendo uma redefinição temporária após um lançamento de produto difícil. Essa ressalva é importante. O contraste na postura do produto era, no entanto, difícil de ignorar.

https://x.com/thsottiaux/status/2078320950488297917

A OpenAI não estava agindo de uma posição de perfeição. Recentemente, tinha estragado partes de seu próprio lançamento de desktop e ChatGPT Work, e Sottiaux havia admitido publicamente que a empresa "não acertou tudo perfeitamente". Os usuários encontraram configurações confusas de alta computação, custos de uso opacos e um redesenho que interrompeu fluxos de trabalho familiares. A OpenAI respondeu mudando os padrões, prometendo reparar a interface e redefinindo o uso repetidamente para que os clientes pudessem continuar trabalhando.

Uma organização estava justificando a escassez.

A outra estava fabricando boa vontade.

A OpenAI não é um grupo de galinhas medíocres. Também está repleta de talentos excepcionais e cometeu seus próprios erros sérios de cultura e produto. A diferença significativa neste momento não é inteligência, nem nos modelos nem no galinheiro. É o que o sistema parece recompensar quando a pressão chega.

No seu melhor, a postura atual de produto da OpenAI é implacavelmente comum. Ela começa com a tarefa do usuário: O que esta pessoa está tentando realizar? O que está impedindo-a de terminar? Onde está o atrito, e quão rápido podemos removê-lo? As redefinições não provam que a OpenAI resolveu a cultura de produto, mas demonstram aos usuários um instinto de absorver parte do custo de seus próprios erros, em vez de deixá-los carregar tudo.

A postura de produto da Anthropic muitas vezes comunica algo diferente: Criamos uma inteligência extraordinária, e nossa principal responsabilidade é determinar quanto dela você pode acessar com segurança. Essa pode ser uma postura institucional coerente, mas não é uma postura centrada no cliente. Ovos de ouro são impressionantes, mas não alimentam a família quando o galinheiro não permite que você os colete.

Uma empresa está se organizando cada vez mais em torno da tarefa do usuário. A outra ainda se organiza em torno do risco sistêmico. Ambas as empresas devem se importar com ambas as questões, mas a questão que perguntam primeiro molda o produto que eventualmente constroem. A diferença não aparece apenas nas declarações de missão. Ela aparece no roteamento, nos limites, nos preços, na comunicação e na disposição de reparar a confiança quando o sistema falha.

O Galinheiro Inteiro

Cultura não é o que uma empresa diz sobre si mesma. Cultura é o que seus sistemas repetidamente tornam fácil — e o que eles repetidamente tornam difícil.

A Anthropic não precisa de menos pessoas brilhantes. Ela precisa de uma definição mais ampla de sucesso, que inclua não apenas a inteligência do modelo e a força da salvaguarda, mas também o acesso, a confiabilidade, a transparência e a confiança. Do lado do cliente, a medida final é surpreendentemente simples: Posso depender deste sistema inteiro para terminar o trabalho?

Muir não tornou suas galinhas menos produtivas. Ele mudou o nível em que a produtividade era medida e descobriu que o desempenho coletivo continha informações que uma contagem individual de ovos não conseguia capturar. As aves selecionadas para desempenho de grupo tornaram-se mais saudáveis e mais produtivas porque a interação destrutiva não era mais invisível para a métrica. Cooperação não é uma alternativa sentimental à produção. É uma das condições que tornaram maior produção possível.

A corrida de modelos de ponta está entrando no mesmo estágio. Quando apenas um laboratório pode produzir inteligência extraordinária, o modelo mais inteligente pode parecer indistinguível do melhor produto. Uma vez que vários laboratórios podem produzir inteligência extraordinária, a vantagem competitiva se desloca para fora, para o sistema inteiro.

O modelo mais inteligente do mundo não é mais automaticamente o melhor produto ou o melhor ajuste ao mercado. Claude pode ser a maior e mais inteligente galinha da IA, mas ninguém fora do galinheiro classifica as galinhas. Nós estamos apenas contando os ovos.

Fontes

William M. Muir, "Group Selection for Adaptation to Multiple-Hen Cages," Poultry Science (1996).

https://pubmed.ncbi.nlm.nih.gov/8786932/

William M. Muir, "Incorporation of Competitive Effects in Breeding Programs," Purdue University.

https://web.ics.purdue.edu/~bmuir/papers/muir%20group%20selection%20genetics%20final%20v2.pdf

Margaret Heffernan, A Bigger Prize.

https://www.hachettebookgroup.com/titles/margaret-heffernan/a-bigger-prize/9781610392914/

Margaret Heffernan, "Is the Professional Pecking Order Doing More Harm Than Good?," NPR/TED Radio Hour.

https://www.northcountrypublicradio.org/news/npr/443412777/is-the-professional-pecking-order-doing-more-harm-than-good

SignalFire, "The State of Tech Talent Report — 2025."

https://www.signalfire.com/blog/signalfire-state-of-talent-report-2025

Anthropic, "Claude Fable 5 and Claude Mythos 5."

https://www.anthropic.com/news/claude-fable-5-mythos-5

Divulgação de IA: Desenvolvi o argumento e escrevi o rascunho original a partir da minha própria experiência, depois usei o ChatGPT para ajudar a pesquisar, reestruturar e redigir partes do ensaio. Revisei e editei o texto final e assumo a responsabilidade por suas afirmações e conclusões.

**Curioso Sobre o Que Estou Construindo?

Uma IA que cita suas fontes:**

Conheça Sebastian →

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais