El problema del «superpollo» de Anthropic

@SebaTheOracle
INGLÉShace 3 días · 18 jul 2026
132K
207
17
9
415

TL;DR

Cody Peterson sostiene que el enfoque de Anthropic en la excelencia y seguridad de sus modelos individuales crea un problema de «superpollo», donde la experiencia general del producto se ve afectada en comparación con rivales más centrados en el usuario, como OpenAI.

Cómo el laboratorio más inteligente del mundo envió accidentalmente el producto equivocado

Le pedí al modelo público más capaz de Anthropic que editara un ensayo sobre Anthropic. Nunca tuvo la oportunidad. Adjunté este borrador y escribí siete palabras inocuas: "Reescribe haz que esto destaque. Formato para Twitter." La aplicación cambió automáticamente la tarea de Fable 5 a Opus 4.8. Su explicación fue simple: "Las salvaguardas de Fable marcaron este mensaje".

Para ser precisos, esto no era una limitación de velocidad común. Fable no respondió ni se negó. La salvaguarda de Anthropic interceptó la solicitud antes de que el modelo seleccionado pudiera responder y la redirigió a otro modelo. Anthropic ha explicado que así es exactamente como funciona el sistema: cuando el clasificador de Fable bloquea una solicitud, esta se envía a Opus 4.8. La compañía también ha reconocido que aumentó deliberadamente el margen de seguridad del clasificador, sabiendo que el resultado serían más falsos positivos en trabajos benignos. (Anthropic

No sé por qué se activó la salvaguarda, y no estoy afirmando que Anthropic censurara las críticas. El hecho verificable —y lo suficientemente extraño— es que una solicitud rutinaria de edición fue atrapada por una salvaguarda cuya propia advertencia mencionaba falsos positivos en programación legítima, ciberseguridad y trabajo biológico. Era una apertura casi cómicamente perfecta para un ensayo sobre el equipo que creó lo que muchos consideran el sistema de inteligencia artificial más brillante del planeta.

Este ensayo examina lo que sucede cuando un sistema se preocupa tanto por el rendimiento de sus partes individuales que pierde de vista el resultado que el sistema completo existe para producir. El modelo puede ser brillante, la salvaguarda puede operar exactamente como fue diseñada, y la política de precios puede tener sentido perfecto para quienes la crearon. El trabajo del usuario puede seguir sin terminar.

Prueba A:

Cody Peterson - inline image

Le pedí a Fable 5 que editara este artículo. Las salvaguardas de Anthropic marcaron la solicitud y la cambiaron a Opus 4.8.

Las gallinas y sus huevos

En 1982, el genetista de Purdue William Muir inició un inusual experimento de cría con gallinas ponedoras. Muir quería saber qué sucedería si la productividad se seleccionara a nivel del grupo en lugar del individuo. En lugar de criar solo a partir de las aves individuales más productivas —una medida de producción puramente individual—, alojó gallinas emparentadas juntas y seleccionó grupos familiares completos según su rendimiento colectivo. La jaula, en lugar de la gallina aislada, se convirtió en la unidad de selección. (PubMed

Margaret Heffernan convirtió más tarde el programa técnico de cría de Muir en la famosa historia de las "superchickens". Para los gerentes, su relato se convirtió en una advertencia siniestra: contratar a los más fuertes y más inteligentes no siempre produce el mejor resultado. En su versión, un grupo de gallinas pudo seguir siendo un grupo común —sin superchickens permitidas—. Un segundo grupo fue criado repetidamente a partir de las gallinas individuales más productivas; ella las llama "las gallinas estelares". (Purdue Alumnus

Los resultados fueron dramáticos. A lo largo de seis generaciones, la mortalidad anual en el grupo seleccionado de Muir cayó del 68% al 8.8%. En el mismo período, la producción aumentó de 91 a 237 huevos por gallina alojada —2.6 veces su producción original. En una comparación directa posterior realizada en grupos de doce, una línea comercial criada para rendimiento individual sufrió un 89% de mortalidad a las 58 semanas de edad. La línea seleccionada por grupo de Muir sufrió solo un 20% de mortalidad, mientras que el control no seleccionado sufrió un 54%. En ese mismo entorno de grupo, el grupo seleccionado superó a las estrellas comerciales en huevos por gallina alojada, masa de huevos y huevos por gallina por día. (PubMed

Mientras tanto, el grupo de superchickens estaba desgastado y agotado. En la versión del experimento que hizo famosa la historia, seis de las nueve gallinas estelares habían muerto y las tres restantes habían sido desplumadas hasta quedar desnudas. El grupo se había, casi literalmente, picoteado hasta la muerte. (Purdue Alumnus

La lección nunca fue que la mediocridad supera al talento. La verdadera lección es que tu producción reflejará lo que recompenses. Selecciona solo por rendimiento individual y podrías construir accidentalmente un equipo más débil, porque los rasgos que permiten a un individuo dominar pueden reducir la productividad de todos los que lo rodean. Selecciona individuos según lo que contribuyen al grupo, y cualidades que desaparecen dentro de una clasificación individual —compatibilidad, moderación, fiabilidad y cooperación— de repente se vuelven visibles.

La verdadera contribución de una gallina no es solo cuántos huevos puede producir. Incluye lo que su presencia permite —o impide— que otras gallinas produzcan. Muir no había abandonado la productividad en favor de la armonía. Había descubierto que, en un sistema social, la armonía es parte de la productividad. La verdadera unidad de rendimiento nunca fue la gallina. Era el gallinero.

Aprendí una versión de esta dura lección mientras dirigía mi propia empresa de construcción. Durante años, encontrar ayuda confiable en nuestro oficio particular era tan difícil que una estrella parecía una salvación. Pero las personas que parecían estrellas demasiado a menudo venían con un impuesto oculto: excepciones adicionales, gestión extra, moral dañada y fricción que el resto del equipo tenía que absorber.

Eventualmente, dejé de preguntar solo "¿Qué tan buena es esta persona en su oficio?" y empecé a preguntar "¿Qué sucede con el trabajo de los demás cuando esta persona se une al equipo?" La persona que parece más fuerte no siempre es la que realmente hace más fuerte a la empresa. Un maestro artesano que ralentiza cada oficio adyacente, consume la atención del capataz o ahuyenta a personas confiables puede ser impresionante en aislamiento y costoso en la práctica. Un trabajador más tranquilo que hace que todo el equipo sea más confiable puede contribuir mucho más de lo que su producción individual revela.

El supergallinero

Anthropic realmente ha reunido un grupo extraordinario de gallinas muy inteligentes. Un análisis de SignalFire de 2025, basado en datos públicos de empleo, estimó que los ingenieros tenían ocho veces más probabilidades de mudarse de OpenAI a Anthropic que al revés, y casi once veces más probabilidades de mudarse allí desde DeepMind. También estimó que el 80% de los empleados de Anthropic contratados al menos dos años antes permanecían hasta el final de su segundo año, en comparación con el 78% en DeepMind y el 67% en OpenAI. (SignalFire

Esos números no describen una empresa que lucha por atraer o retener talento. Describen un imán para estrellas.

Eso no significa que los empleados de Anthropic se estén picoteando hasta la muerte. Sería una analogía barata, y los números de talento no lo prueban. El peligro más importante es más sutil. Cuando una empresa puede señalar de manera creíble a investigadores excepcionales, una retención inusualmente alta y modelos líderes en la frontera, se vuelve fácil tratar la excelencia en las partes individuales como prueba de que todo el sistema funciona.

El experimento de Muir demuestra por qué esa inferencia no es confiable. El peligro no es el brillo en sí mismo. El peligro es medir el rendimiento un nivel demasiado bajo.

El modelo no es el producto

La industria de la IA está construida alrededor de superchickens: investigadores famosos, modelos líderes en benchmarks, paquetes de compensación enormes y páginas de lanzamiento cubiertas de superlativos. Dentro del laboratorio, el orden jerárquico es obvio. Fuera de él, solo vemos los huevos.

Silicon Valley tiene un punto ciego claro: tu equipo puede ser extraordinario mientras el producto que has construido sigue siendo frustrante, inaccesible o poco fiable.

Los usuarios del día a día no juzgan un modelo por su equipo de gallinas talentosas o sus benchmarks. Solo tenemos el modelo, la aplicación, las salvaguardas, los límites de uso, los precios, la atención al cliente.

Dos empresas, 74 minutos de diferencia

El 17 de julio, Anthropic respondió a la abrumadora demanda de Fable con un compromiso. A partir del 20 de julio, los suscriptores de Max y Team Premium recibirían Fable como parte de sus planes, pero con la mitad de sus límites normales. Los usuarios de Pro y Team Standard continuarían accediendo al modelo a través de créditos de uso y recibirían un crédito único de $100.

https://x.com/claudeai/status/2078302415804379218

Setenta y cuatro minutos después, Thibault Sottiaux de OpenAI anunció que los límites de uso se habían restablecido para todos los usuarios de pago de Codex y ChatGPT Work.

Estas no eran ofertas económicamente idénticas. Anthropic estaba estableciendo una política de acceso continuo para un modelo inusualmente intensivo en cómputo, mientras que OpenAI otorgaba un reinicio temporal después de un difícil lanzamiento de producto. Ese matiz importa. El contraste en la postura del producto era, sin embargo, difícil de pasar por alto.

https://x.com/thsottiaux/status/2078320950488297917

OpenAI no actuaba desde una posición de perfección. Recientemente había estropeado partes de su propio lanzamiento de escritorio y ChatGPT Work, y Sottiaux había admitido públicamente que la empresa "no hizo todo bien". Los usuarios se habían encontrado con configuraciones confusas de alto cómputo, costos de uso opacos y un rediseño que interrumpió flujos de trabajo familiares. OpenAI respondió cambiando los valores predeterminados, prometiendo reparar la interfaz y restableciendo el uso repetidamente para que los clientes pudieran seguir trabajando.

Una organización estaba justificando la escasez.

La otra estaba generando buena voluntad.

OpenAI no es un grupo de gallinas mediocres. También está llena de talento excepcional, y ha cometido serios errores culturales y de producto propios. La diferencia significativa en este momento no es la inteligencia, ni en los modelos ni en el gallinero. Es lo que el sistema parece recompensar cuando llega la presión.

En su mejor momento, la postura actual del producto de OpenAI es implacablemente ordinaria. Comienza con la tarea del usuario: ¿Qué está tratando de lograr esta persona? ¿Qué le impide terminar? ¿Dónde está la fricción y qué tan rápido podemos eliminarla? Los reinicios no prueban que OpenAI haya resuelto la cultura de producto, pero demuestran a los usuarios un instinto de absorber parte del costo de sus propios errores en lugar de dejarlos cargar con todo.

La postura de producto de Anthropic demasiado a menudo comunica algo diferente: Hemos creado una inteligencia extraordinaria, y nuestra principal responsabilidad es determinar cuánto de ella puedes acceder de manera segura. Puede ser una postura institucional coherente, pero no está centrada en el cliente. Los huevos de oro son impresionantes, pero no alimentan a la familia cuando el gallinero no te deja recogerlos.

Una empresa se organiza cada vez más en torno a la tarea del usuario. La otra todavía se organiza en torno al riesgo sistémico. Ambas empresas deben preocuparse por ambas cuestiones, pero la pregunta que se hacen primero define el producto que finalmente construyen. La diferencia no aparece solo en las declaraciones de misión. Aparece en el enrutamiento, los límites, los precios, la comunicación y la disposición a reparar la confianza cuando el sistema falla.

El gallinero completo

La cultura no es lo que una empresa dice de sí misma. La cultura es lo que sus sistemas hacen repetidamente fácil —y lo que hacen repetidamente difícil.

Anthropic no necesita menos personas brillantes. Necesita una definición más amplia de éxito, que incluya no solo la inteligencia del modelo y la fortaleza de las salvaguardas, sino también el acceso, la fiabilidad, la transparencia y la confianza. Desde el lado del cliente, la medida final es sorprendentemente simple: ¿Puedo depender de todo este sistema para terminar el trabajo?

Muir no hizo que sus gallinas fueran menos productivas. Cambió el nivel al que se medía la productividad y descubrió que el rendimiento colectivo contenía información que un conteo individual de huevos no podía capturar. Las aves seleccionadas para el rendimiento grupal se volvieron más saludables y productivas porque la interacción destructiva ya no era invisible para la métrica. La cooperación no es una alternativa sentimental a la producción. Es una de las condiciones que hicieron posible una mayor producción.

La carrera de modelos de frontera está entrando en la misma etapa. Cuando solo un laboratorio puede producir inteligencia extraordinaria, el modelo más inteligente puede parecer indistinguible del mejor producto. Una vez que varios laboratorios pueden producir inteligencia extraordinaria, la ventaja competitiva se desplaza hacia afuera, hacia todo el sistema.

El modelo más inteligente del mundo ya no es automáticamente el mejor producto o el mejor ajuste al mercado. Claude puede ser la gallina más grande y más inteligente de la IA, pero nadie fuera del gallinero califica a las gallinas. Solo estamos contando los huevos.

Fuentes

William M. Muir, "Group Selection for Adaptation to Multiple-Hen Cages", Poultry Science (1996).

https://pubmed.ncbi.nlm.nih.gov/8786932/

William M. Muir, "Incorporation of Competitive Effects in Breeding Programs", Purdue University.

https://web.ics.purdue.edu/~bmuir/papers/muir%20group%20selection%20genetics%20final%20v2.pdf

Margaret Heffernan, A Bigger Prize.

https://www.hachettebookgroup.com/titles/margaret-heffernan/a-bigger-prize/9781610392914/

Margaret Heffernan, "Is the Professional Pecking Order Doing More Harm Than Good?", NPR/TED Radio Hour.

https://www.northcountrypublicradio.org/news/npr/443412777/is-the-professional-pecking-order-doing-more-harm-than-good

SignalFire, "The State of Tech Talent Report — 2025".

https://www.signalfire.com/blog/signalfire-state-of-talent-report-2025

Anthropic, "Claude Fable 5 and Claude Mythos 5".

https://www.anthropic.com/news/claude-fable-5-mythos-5

Divulgación de IA: Desarrollé el argumento y escribí el borrador original desde mi propia experiencia, luego usé ChatGPT para ayudar a investigar, reestructurar y redactar partes del ensayo. Revisé y corregí el texto final y asumo la responsabilidad de sus afirmaciones y conclusiones.

**¿Curioso por lo que estoy construyendo?

Una IA que cita sus fuentes:**

Conoce a Sebastian →

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales