Cómo el laboratorio más inteligente del mundo envió accidentalmente el producto equivocado
Le pedí al modelo público más capaz de Anthropic que editara un ensayo sobre Anthropic. Nunca tuvo la oportunidad. Adjunté este borrador y escribí siete palabras inofensivas: "Redacta, haz que esto DESTAQUE. Formatea para Twitter." La aplicación cambió automáticamente la tarea de Fable 5 a Opus 4.8. Su explicación fue simple: "Las salvaguardas de Fable marcaron este mensaje."
Para ser precisos, esto no fue una limitación de velocidad ordinaria. Fable no respondió y se negó. La salvaguarda de Anthropic interceptó la solicitud antes de que el modelo seleccionado pudiera responder y la redirigió a otro modelo. Anthropic ha explicado que así es exactamente como funciona el sistema: cuando el clasificador de Fable bloquea una solicitud, esta se envía a Opus 4.8. La compañía también ha reconocido que amplió deliberadamente el margen de seguridad del clasificador, sabiendo que el resultado sería más falsos positivos en trabajos benignos. (Anthropic
No sé por qué se activó la salvaguarda, y no estoy diciendo que Anthropic haya censurado críticas. El hecho verificable—y lo suficientemente extraño—es que una solicitud de edición rutinaria fue atrapada por una salvaguarda cuya propia advertencia mencionaba falsos positivos en trabajos legítimos de programación, ciberseguridad y biología. Fue una apertura casi cómicamente perfecta para un ensayo sobre el equipo que creó lo que muchos consideran el sistema de IA más brillante del planeta.
Este ensayo examina lo que sucede cuando un sistema se obsesiona tanto con el rendimiento de sus partes individuales que pierde de vista el resultado para el que existe todo el sistema. El modelo puede ser brillante, la salvaguarda puede operar exactamente como fue diseñada, y la política de precios puede tener perfecto sentido para quienes la crearon. El trabajo del usuario aún puede quedar inconcluso.
Exhibit A:

Le pedí a Fable 5 que editara este artículo. Las salvaguardas de Anthropic marcaron la solicitud y la cambiaron a Opus 4.8.
Las Gallinas y Sus Huevos
En 1982, el genetista de Purdue William Muir inició un inusual experimento de cría con gallinas ponedoras. Muir quería saber qué sucedería si la productividad se seleccionara a nivel del grupo en lugar del individuo. En lugar de criar únicamente a partir de las aves individuales más productivas—una medida de producción individual pura—alojó gallinas emparentadas juntas y seleccionó grupos familiares enteros según su desempeño colectivo. La jaula, en lugar de la gallina aislada, se convirtió en la unidad de selección. (PubMed
Margaret Heffernan convirtió después el programa técnico de cría de Muir en la famosa historia de la "supergallina". Para los gerentes, su relato se convirtió en una advertencia ominosa: contratar a los más fuertes y más inteligentes no siempre produce el mejor resultado. En su versión, un grupo de gallinas se mantuvo como un grupo ordinario—sin supergallinas permitidas. Un segundo grupo fue criado repetidamente a partir de las gallinas individuales más productivas; ella las llama "las gallinas estelares". (Purdue Alumnus
Los resultados fueron dramáticos. A lo largo de seis generaciones, la mortalidad anual en el grupo seleccionado por Muir cayó del 68 por ciento al 8.8 por ciento. En el mismo período, la producción aumentó de 91 a 237 huevos por gallina alojada—2.6 veces su producción original. En una comparación directa posterior realizada en grupos de doce, una línea comercial criada para rendimiento individual sufrió un 89 por ciento de mortalidad a las 58 semanas de edad. La línea seleccionada por grupo de Muir sufrió solo un 20 por ciento de mortalidad, mientras que el control no seleccionado sufrió un 54 por ciento. En ese mismo entorno grupal, el grupo seleccionado por grupo superó a las estrellas comerciales en huevos por gallina alojada, masa de huevo y huevos por gallina por día. (PubMed
Mientras tanto, el grupo de supergallinas estaba desaliñado y desgastado. En la versión del experimento que hizo famosa la historia, seis de las nueve gallinas estelares habían muerto y las tres restantes habían sido desplumadas a picotazos. El grupo se había, casi literalmente, picoteado hasta la muerte. (Purdue Alumnus
La lección nunca fue que la mediocridad vence al talento. La verdadera lección es que tu producción reflejará lo que recompenses. Si seleccionas solo por rendimiento individual, puedes construir accidentalmente un equipo más débil, porque los rasgos que permiten a un individuo dominar pueden reducir la productividad de todos los que lo rodean. Si seleccionas individuos según lo que aportan al grupo, cualidades que desaparecen dentro de una clasificación individual—compatibilidad, moderación, confiabilidad y cooperación—de repente se vuelven visibles.
La verdadera contribución de una gallina no es solo cuántos huevos puede producir. Incluye lo que su presencia permite—o impide—que las otras gallinas produzcan. Muir no había abandonado la productividad en favor de la armonía. Había descubierto que, en un sistema social, la armonía es parte de la productividad. La verdadera unidad de rendimiento nunca fue la gallina. Era el gallinero.
Aprendí una versión de esta dura lección mientras dirigía mi propia empresa de construcción. Durante años, la ayuda confiable era tan difícil de encontrar en nuestro oficio particular que una estrella parecía una salvación. Pero las personas que parecían estrellas demasiado a menudo venían con un impuesto oculto: excepciones extra, gestión extra, moral dañada y fricción que el resto del equipo tenía que absorber.
Eventualmente, dejé de preguntar solo: "¿Qué tan buena es esta persona en su oficio?" y comencé a preguntar: "¿Qué le sucede al trabajo de los demás cuando esta persona se une al equipo?" La persona que parece más fuerte no siempre es quien realmente hace más fuerte a la empresa. Un maestro artesano que ralentiza cada oficio adyacente, consume la atención del capataz o ahuyenta a personas confiables puede ser impresionante en aislamiento y costoso en la práctica. Un trabajador más tranquilo que hace que todo el equipo sea más confiable puede contribuir mucho más de lo que revela su producción individual.
El Supergallinero
Anthropic realmente ha reunido un grupo extraordinario de gallinas muy inteligentes. Un análisis de SignalFire de 2025, basado en datos de empleo público, estimó que los ingenieros tenían ocho veces más probabilidades de moverse de OpenAI a Anthropic que al revés y casi once veces más probabilidades de mudarse allí desde DeepMind. También estimó que el 80 por ciento de los empleados de Anthropic contratados al menos dos años antes permanecían hasta el final de su segundo año, en comparación con el 78 por ciento en DeepMind y el 67 por ciento en OpenAI. (SignalFire
Esas cifras no describen una empresa que lucha por atraer o retener talento. Describen un imán para estrellas.
Eso no significa que los empleados de Anthropic se estén picoteando hasta la muerte. Sería una analogía barata, y las cifras de talento no lo prueban. El peligro más importante es más sutil. Cuando una empresa puede señalar de manera creíble a investigadores excepcionales, una retención inusualmente alta y modelos líderes en la frontera, se vuelve fácil tratar la excelencia en las partes individuales como prueba de que todo el sistema está funcionando.
El experimento de Muir demuestra por qué esa inferencia no es confiable. El peligro no es el brillo en sí mismo. El peligro es medir el rendimiento un nivel demasiado bajo.
El Modelo No Es El Producto
La industria de la IA está construida alrededor de supergallinas: investigadores famosos, modelos líderes en benchmarks, paquetes de compensación enormes y páginas de lanzamiento cubiertas de superlativos. Dentro del laboratorio, la jerarquía es obvia. Fuera de él, solo vemos los huevos.
Silicon Valley tiene un punto ciego claro: tu equipo puede ser extraordinario mientras el producto que has construido sigue siendo frustrante, inaccesible o poco confiable.
Los usuarios cotidianos no juzgan un modelo por su equipo de gallinas talentosas o sus benchmarks. Solo tenemos el modelo, la aplicación, las salvaguardas, los límites de uso, los precios, la atención al cliente.
Dos Empresas, 74 Minutos de Diferencia
El 17 de julio, Anthropic respondió a la abrumadora demanda de Fable con un compromiso. A partir del 20 de julio, los suscriptores de Max y Team Premium recibirían Fable como parte de sus planes, pero con la mitad de sus límites normales. Los usuarios de Pro y Team Standard continuarían accediendo al modelo a través de créditos de uso y recibirían un crédito único de $100.
https://x.com/claudeai/status/2078302415804379218
Setenta y cuatro minutos después, Thibault Sottiaux de OpenAI anunció que los límites de uso se habían restablecido para todos los usuarios de pago de Codex y ChatGPT Work.
Estas no eran ofertas económicamente idénticas. Anthropic estaba estableciendo una política de acceso continuo para un modelo inusualmente intensivo en cómputo, mientras que OpenAI estaba otorgando un restablecimiento temporal después de un lanzamiento de producto difícil. Ese matiz importa. El contraste en la postura del producto era, sin embargo, difícil de pasar por alto.
https://x.com/thsottiaux/status/2078320950488297917
OpenAI no actuaba desde una posición de perfección. Recientemente había estropeado partes de su propio lanzamiento de escritorio y ChatGPT Work, y Sottiaux había admitido públicamente que la empresa "no hizo todo perfectamente". Los usuarios se habían encontrado con configuraciones de alto cómputo confusas, costos de uso opacos y un rediseño que interrumpió flujos de trabajo familiares. OpenAI respondió cambiando los valores predeterminados, prometiendo reparar la interfaz y restableciendo el uso repetidamente para que los clientes pudieran seguir trabajando.
Una organización estaba justificando la escasez.
La otra estaba generando buena voluntad.
OpenAI no es un grupo de gallinas mediocres. También está repleto de talento excepcional, y ha cometido serios errores culturales y de producto propios. La diferencia significativa en este momento no es la inteligencia, ni en los modelos ni en el gallinero. Es lo que el sistema parece recompensar cuando llega la presión.
En su mejor momento, la postura actual del producto de OpenAI es implacablemente ordinaria. Comienza con la tarea del usuario: ¿Qué está tratando de lograr esta persona? ¿Qué le impide terminar? ¿Dónde está la fricción y qué tan rápido podemos eliminarla? Los restablecimientos no prueban que OpenAI haya resuelto la cultura de producto, pero demuestran a los usuarios un instinto para absorber parte del costo de sus propios errores en lugar de dejar que ellos carguen con todo.
La postura del producto de Anthropic demasiado a menudo comunica algo diferente: Hemos creado una inteligencia extraordinaria, y nuestra responsabilidad principal es determinar cuánto de ella puedes acceder de manera segura. Puede ser una postura institucional coherente, pero no está centrada en el cliente. Los huevos de oro son impresionantes, pero no alimentan a la familia cuando el gallinero no te deja recogerlos.
Una empresa se organiza cada vez más en torno a la tarea del usuario. La otra aún se organiza en torno al riesgo sistémico. Ambas empresas deben preocuparse por ambas preguntas, pero la pregunta que hacen primero moldea el producto que finalmente construyen. La diferencia no aparece solo en las declaraciones de misión. Aparece en el enrutamiento, los límites, los precios, la comunicación y la voluntad de reparar la confianza cuando el sistema falla.
El Gallinero Completo
La cultura no es lo que una empresa dice de sí misma. La cultura es lo que sus sistemas hacen repetidamente fácil—y lo que hacen repetidamente difícil.
Anthropic no necesita menos personas brillantes. Necesita una definición más amplia de éxito, una que incluya no solo la inteligencia del modelo y la solidez de las salvaguardas, sino también el acceso, la confiabilidad, la transparencia y la confianza. Desde el lado del cliente, la medida final es sorprendentemente simple: ¿Puedo depender de todo este sistema para terminar el trabajo?
Muir no hizo que sus gallinas fueran menos productivas. Cambió el nivel al que se medía la productividad y descubrió que el rendimiento colectivo contenía información que un conteo de huevos individual no podía capturar. Las aves seleccionadas para el rendimiento grupal se volvieron más saludables y productivas porque la interacción destructiva ya no era invisible para la métrica. La cooperación no es una alternativa sentimental a la producción. Es una de las condiciones que hicieron posible una mayor producción.
La carrera de modelos de frontera está entrando en la misma etapa. Cuando solo un laboratorio puede producir inteligencia extraordinaria, el modelo más inteligente puede parecer indistinguible del mejor producto. Una vez que varios laboratorios pueden producir inteligencia extraordinaria, la ventaja competitiva se desplaza hacia afuera, hacia todo el sistema.
El modelo más inteligente del mundo ya no es automáticamente el mejor producto o el mejor ajuste al mercado. Claude puede ser la gallina más grande y más inteligente de la IA, pero nadie fuera del gallinero califica a las gallinas. Solo estamos contando los huevos.
—
Fuentes
William M. Muir, "Group Selection for Adaptation to Multiple-Hen Cages," Poultry Science (1996).
https://pubmed.ncbi.nlm.nih.gov/8786932/
William M. Muir, "Incorporation of Competitive Effects in Breeding Programs," Purdue University.
https://web.ics.purdue.edu/~bmuir/papers/muir%20group%20selection%20genetics%20final%20v2.pdf
Margaret Heffernan, A Bigger Prize.
https://www.hachettebookgroup.com/titles/margaret-heffernan/a-bigger-prize/9781610392914/
Margaret Heffernan, "Is the Professional Pecking Order Doing More Harm Than Good?," NPR/TED Radio Hour.
SignalFire, "The State of Tech Talent Report — 2025."
https://www.signalfire.com/blog/signalfire-state-of-talent-report-2025
Anthropic, "Claude Fable 5 and Claude Mythos 5."
https://www.anthropic.com/news/claude-fable-5-mythos-5
—
Divulgación de IA: Desarrollé el argumento y escribí el borrador original desde mi propia experiencia, luego usé ChatGPT para ayudar a investigar, reestructurar y redactar partes del ensayo. Revisé y corregí el texto final y asumo la responsabilidad de sus afirmaciones y conclusiones.
**¿Tienes Curiosidad por lo que estoy Construyendo?
Una IA que cita sus fuentes:**





