Anthropic’in Süper Tavuk Problemi

@SebaTheOracle
İNGILIZCE3 gün önce · 18 Tem 2026
132K
207
17
9
415

TL;DR

Cody Peterson, Anthropic’in bireysel model mükemmeliyetine ve güvenliğe odaklanmasının, OpenAI gibi kullanıcı odaklı rakiplerine kıyasla genel ürün deneyiminin zarar gördüğü bir 'süper tavuk' problemi yarattığını savunuyor.

Dünyanın en zeki laboratuvarı yanlış ürünü nasıl yanlışlıkla gönderdi?

Anthropic'in en yetenekli genel modelinden, Anthropic hakkında bir makaleyi düzenlemesini istedim. Fırsatı bile olmadı. Bu taslağı ekledim ve yedi masum kelime yazdım: "Yeniden yaz, bunu PATLAT. Twitter için formatla." Uygulama, görevi otomatik olarak Fable 5'ten Opus 4.8'e geçirdi. Açıklaması basitti: "Fable'ın güvenlik önlemleri bu mesajı işaretledi."

Kesin olmak gerekirse, bu sıradan bir hız sınırlaması değildi. Fable yanıt vermedi ve reddetmedi. Anthropic'in güvenlik önlemi, seçilen model yanıt vermeden önce talebi durdurdu ve başka bir modele yönlendirdi. Anthropic, sistemin tam olarak böyle çalıştığını açıkladı: Fable'ın sınıflandırıcısı bir talebi engellediğinde, talep Opus 4.8'e gönderilir. Şirket ayrıca, sınıflandırıcının güvenlik marjını bilinçli olarak genişlettiğini ve bunun sonucunda masum çalışmalarda daha fazla yanlış pozitif olacağını bildiğini de kabul etti. (Anthropic

Güvenlik önleminin neden devreye girdiğini bilmiyorum ve Anthropic'in eleştiriyi sansürlediğini iddia etmiyorum. Doğrulanabilir ve yeterince tuhaf olan gerçek şu ki, rutin bir düzenleme talebi, kendi uyarısında meşru kodlama, siber güvenlik ve biyoloji çalışmalarındaki yanlış pozitifleri tartışan bir güvenlik önlemi tarafından yakalandı. Gezegendeki en zeki yapay zeka sistemini yaptığına inanılan ekibi konu alan bir makale için neredeyse komik derecede mükemmel bir girişti.

Bu makale, bir sistemin bireysel parçalarının performansıyla o kadar meşgul hale geldiğinde ne olduğunu inceliyor ki, tüm sistemin var olma amacı olan sonucu gözden kaçırıyor. Model dahi olabilir, güvenlik önlemi tam olarak tasarlandığı gibi çalışabilir ve fiyatlandırma politikası onu yaratanlar için mükemmel bir anlam ifade edebilir. Kullanıcının işi yine de yarım kalabilir.

Kanıt A:

Cody Peterson - inline image

Fable 5'ten bu makaleyi düzenlemesini istedim. Anthropic'in güvenlik önlemleri talebi işaretledi ve Opus 4.8'e geçirdi.

Tavuklar ve Yumurtaları

1982'de Purdue'lu genetikçi William Muir, yumurtlayan tavuklarla alışılmadık bir üreme deneyine başladı. Muir, üretkenliğin birey yerine grup düzeyinde seçilmesi durumunda ne olacağını bilmek istiyordu. En yüksek üretim yapan bireysel tavuklardan (salt bireysel çıktının bir ölçüsü) üreme yapmak yerine, akraba tavukları bir araya getirdi ve tüm aile gruplarını kolektif performanslarına göre seçti. Seçim birimi, izole edilmiş tavuk değil, kafesti. (PubMed

Margaret Heffernan daha sonra Muir'in teknik üreme programını ünlü "süper tavuk" hikayesine dönüştürdü. Yöneticiler için onun hikayesi uğursuz bir uyarı haline geldi: en güçlü ve en zekiyi işe almak her zaman en iyi çıktıyı üretmez. Onun anlatımında, bir tavuk sürüsünün sıradan bir sürü olarak kalmasına izin verildi - süper tavuklara izin verilmedi. İkinci bir grup, en üretken bireysel tavuklardan defalarca çoğaltıldı; ona "yıldız tavuklar" diyor. (Purdue Alumnus

Sonuçlar çarpıcıydı. Altı nesil boyunca, Muir'in grup seçimli sürüsünde yıllık ölüm oranı yüzde 68'den yüzde 8,8'e düştü. Aynı dönemde, üretim, barındırılan tavuk başına 91'den 237 yumurtaya yükseldi - orijinal çıktısının 2,6 katı. Daha sonra on iki kişilik gruplar halinde yapılan bir kafa kafaya karşılaştırmada, bireysel performans için yetiştirilen ticari bir hat, 58 haftalıkken yüzde 89 ölüm oranına maruz kaldı. Muir'in grup seçimli hattı yalnızca yüzde 20 ölüm oranına maruz kalırken, seçilmemiş kontrol yüzde 54 ölüm oranına maruz kaldı. Aynı grup ortamında, grup seçimli sürü, barındırılan tavuk başına yumurta, yumurta kütlesi ve tavuk başına günlük yumurta açısından ticari yıldızlardan daha iyi performans gösterdi. (PubMed

Bu arada, süper tavuk sürüsü perişan ve yıpranmış durumdaydı. Hikayeyi ünlü yapan deney versiyonunda, dokuz yıldız tavuğun altısı ölmüş ve kalan üçü çıplak kalana kadar gagalanmıştı. Sürü, neredeyse kelimenin tam anlamıyla, kendini ölümüne gagalamıştı. (Purdue Alumnus

Ders, sıradanlığın yeteneği yendiği değildi. Gerçek ders, çıktınızın neyi ödüllendirdiğinizi yansıtacağıdır. Yalnızca bireysel performans için seçim yapın ve yanlışlıkla daha zayıf bir ekip kurabilirsiniz, çünkü bir bireyin baskın olmasına izin veren özellikler, etrafındaki herkesin üretkenliğini azaltabilir. Bireyleri gruba katkılarına göre seçin ve bireysel bir sıralama içinde kaybolan nitelikler - uyumluluk, ölçülülük, güvenilirlik ve işbirliği - aniden görünür hale gelir.

Bir tavuğun gerçek katkısı, yalnızca kaç yumurta sıkıştırabildiği değildir. Varlığının diğer tavukların üretmesine izin verdiği - veya engellediği - şeyleri de içerir. Muir, uyum adına üretkenlikten vazgeçmemişti. Sosyal bir sistemde, uyumun üretkenliğin bir parçası olduğunu keşfetmişti. Gerçek performans birimi asla tavuk olmamıştı. Kümes idi.

Bu zor kazanılmış dersin bir versiyonunu kendi inşaat şirketimi yönetirken öğrendim. Yıllarca, kendi sektörümde güvenilir yardım bulmak o kadar zordu ki, bir yıldız oyuncu kurtuluş gibi geliyordu. Ancak yıldız oyuncu gibi görünen insanlar çoğu zaman gizli bir vergiyle geliyordu: ekstra istisnalar, ekstra yönetim, hasar görmüş moral ve ekibin geri kalanının absorbe etmek zorunda kaldığı sürtüşme.

Sonunda, yalnızca "Bu kişi zanaatında ne kadar iyi?" diye sormayı bıraktım ve "Bu kişi ekibe katıldığında herkesin işine ne olur?" diye sormaya başladım. En güçlü görünen kişi, her zaman şirketi gerçekten güçlendiren kişi değildir. Bitişik her ticareti yavaşlatan, ustabaşının dikkatini tüketen veya güvenilir insanları uzaklaştıran bir usta zanaatkar, izole edildiğinde etkileyici ve pratikte pahalı olabilir. Tüm ekibi daha güvenilir kılan daha sessiz bir işçi, bireysel çıktısının gösterdiğinden çok daha fazla katkıda bulunabilir.

Süper Kümes

Anthropic gerçekten de olağanüstü bir zeki tavuk sürüsü topladı. 2025 tarihli bir SignalFire analizi, kamuya açık istihdam verilerine dayanarak, mühendislerin OpenAI'den Anthropic'e geçme olasılığının tersinden sekiz kat daha fazla olduğunu ve DeepMind'dan oraya geçme olasılığının neredeyse on bir kat daha fazla olduğunu tahmin etti. Ayrıca, en az iki yıl önce işe alınan Anthropic çalışanlarının yüzde 80'inin ikinci yıllarının sonuna kadar kaldığını, DeepMind'da bu oranın yüzde 78 ve OpenAI'de yüzde 67 olduğunu tahmin etti. (SignalFire

Bu rakamlar, yetenek çekmekte veya elde tutmakta zorlanan bir şirketi tanımlamıyor. Yıldız oyuncular için bir mıknatısı tanımlıyorlar.

Bu, Anthropic çalışanlarının birbirlerini ölümüne gagaladığı anlamına gelmiyor. Bu ucuz bir benzetme olurdu ve yetenek rakamları bunu kanıtlamıyor. Daha önemli tehlike daha incelikli. Bir şirket, istisnai araştırmacıları, alışılmadık derecede yüksek elde tutma oranını ve sınırda lider modelleri ikna edici bir şekilde gösterebildiğinde, bireysel parçalardaki mükemmelliği tüm sistemin çalıştığının kanıtı olarak görmek kolaylaşır.

Muir'in deneyi, bu çıkarıma neden güvenilemeyeceğini gösteriyor. Tehlike, dehanın kendisi değil. Tehlike, performansı bir seviye çok düşük ölçmektir.

Model, Ürün Değildir

Yapay zeka endüstrisi süper tavuklar üzerine inşa edilmiştir: ünlü araştırmacılar, kıyaslama lideri modeller, devasa tazminat paketleri ve üstünlüklerle kaplı lansman sayfaları. Laboratuvarın içinde, gagalama düzeni bellidir. Dışarıda, yalnızca yumurtaları görürüz.

Silikon Vadisi'nin net bir kör noktası var: ekibiniz olağanüstü olabilir, ancak inşa ettiğiniz ürün sinir bozucu, erişilemez veya güvenilmez kalabilir.

Her gün kullananlar, bir modeli yetenekli tavukları veya kıyaslamalarıyla yargılamaz. Yalnızca modele, uygulamaya, güvenlik önlemlerine, kullanım limitlerine, fiyatlandırmaya, müşteri desteğine sahibiz.

İki Şirket, 74 Dakika Arayla

17 Temmuz'da Anthropic, Fable'ın ezici talebine bir uzlaşmayla yanıt verdi. 20 Temmuz'dan itibaren, Max ve Team Premium aboneleri, planlarının bir parçası olarak Fable'a erişebilecek, ancak normal limitlerinin yarısı kadar. Pro ve Team Standart kullanıcıları, modele kullanım kredileri aracılığıyla erişmeye devam edecek ve tek seferlik 100$ kredi alacak.

https://x.com/claudeai/status/2078302415804379218

Yetmiş dört dakika sonra, OpenAI'den Thibault Sottiaux, ücretli her Codex ve ChatGPT Work kullanıcısı için kullanım limitlerinin sıfırlandığını duyurdu.

Bunlar ekonomik olarak aynı teklifler değildi. Anthropic, alışılmadık derecede hesaplama yoğun bir model için sürekli bir erişim politikası oluştururken, OpenAI zorlu bir ürün lansmanının ardından geçici bir sıfırlama sağlıyordu. Bu uyarı önemlidir. Buna rağmen, ürün duruşundaki zıtlığı gözden kaçırmak zordu.

https://x.com/thsottiaux/status/2078320950488297917

OpenAI mükemmellik pozisyonundan hareket etmiyordu. Kendi masaüstü ve ChatGPT Work lansmanının bazı kısımlarını yakın zamanda berbat etmişti ve Sottiaux, şirketin "her şeyi tam olarak doğru yapmadığını" kamuoyu önünde kabul etmişti. Kullanıcılar, kafa karıştırıcı yüksek hesaplama ayarları, opak kullanım maliyetleri ve tanıdık iş akışlarını bozan bir yeniden tasarımla karşılaşmıştı. OpenAI, varsayılanları değiştirerek, arayüzü onarmayı vaat ederek ve müşterilerin çalışmaya devam edebilmesi için kullanımı defalarca sıfırlayarak yanıt verdi.

Bir kuruluş kıtlığı haklı çıkarıyordu.

Diğeri iyi niyet üretiyordu.

OpenAI, vasat tavuklardan oluşan bir sürü değil. O da istisnai yeteneklerle dolu ve kendi ciddi kültürel ve ürün hatalarını yaptı. Bu andaki anlamlı fark, ne modellerde ne de kümeste zeka değil. Baskı geldiğinde sistemin neyi ödüllendiriyor gibi göründüğüdür.

OpenAI'ın mevcut ürün duruşu, en iyi halinde, amansız bir şekilde sıradandır. Kullanıcının göreviyle başlar: Bu kişi neyi başarmaya çalışıyor? Bitirmesini engelleyen şey nedir? Sürtüşme nerede ve onu ne kadar çabuk kaldırabiliriz? Sıfırlamalar, OpenAI'ın ürün kültürünü çözdüğünü kanıtlamaz, ancak kullanıcılara, kendi hatalarının maliyetinin bir kısmını üstlenme ve hepsini kullanıcılara yüklememe içgüdüsü olduğunu gösterir.

Anthropic'in ürün duruşu çoğu zaman farklı bir şey iletir: Olağanüstü bir zeka yarattık ve asıl sorumluluğumuz, buna ne kadarının güvenle erişebileceğinizi belirlemektir. Bu tutarlı bir kurumsal duruş olabilir, ancak müşteri merkezli bir duruş değildir. Altın yumurtalar etkileyicidir, ancak kümes onları toplamanıza izin vermezse aileyi doyurmazlar.

Bir şirket giderek artan bir şekilde kendini kullanıcının görevi etrafında organize ediyor. Diğeri hala kendini sistemik risk etrafında organize ediyor. Her iki şirket de her iki sorunla ilgilenmek zorundadır, ancak önce sordukları soru, sonunda inşa ettikleri ürünü şekillendirir. Fark, yalnızca misyon beyanlarında görülmez. Yönlendirmede, limitlerde, fiyatlandırmada, iletişimde ve sistem başarısız olduğunda güveni onarma isteğinde görülür.

Bütün Kümes

Kültür, bir şirketin kendisi hakkında söylediği şey değildir. Kültür, sistemlerinin tekrar tekrar kolaylaştırdığı ve tekrar tekrar zorlaştırdığı şeydir.

Anthropic'in daha az parlak insana ihtiyacı yok. Daha geniş bir başarı tanımına ihtiyacı var; yalnızca model zekasını ve güvenlik önlemi gücünü değil, aynı zamanda erişimi, güvenilirliği, şeffaflığı ve güveni de içeren. Müşteri tarafından, nihai ölçü şaşırtıcı derecede basittir: Tüm bu sisteme işi bitirmek için güvenebilir miyim?

Muir, tavuklarını daha az üretken yapmadı. Üretkenliğin ölçüldüğü seviyeyi değiştirdi ve kolektif performansın, bireysel bir yumurta sayısının yakalayamayacağı bilgiler içerdiğini keşfetti. Grup performansı için seçilen kuşlar daha sağlıklı ve daha üretken hale geldi çünkü yıkıcı etkileşim artık metrik için görünmez değildi. İşbirliği, çıktıya duygusal bir alternatif değildir. Daha fazla çıktıyı mümkün kılan koşullardan biridir.

Sınır model yarışı aynı aşamaya giriyor. Yalnızca bir laboratuvar olağanüstü zeka üretebildiğinde, en zeki model en iyi üründen ayırt edilemez görünebilir. Birkaç laboratuvar olağanüstü zeka üretebildiğinde, rekabet avantajı tüm sisteme doğru dışarıya kayar.

Dünyanın en zeki modeli, artık otomatik olarak en iyi ürün veya en iyi pazar uyumu değil. Claude, yapay zekadaki en büyük ve en zeki tavuk olabilir, ancak kümes dışında kimse tavukları derecelendirmez. Biz sadece yumurtaları sayıyoruz.

Kaynaklar

William M. Muir, "Group Selection for Adaptation to Multiple-Hen Cages," Poultry Science (1996).

https://pubmed.ncbi.nlm.nih.gov/8786932/

William M. Muir, "Incorporation of Competitive Effects in Breeding Programs," Purdue University.

https://web.ics.purdue.edu/~bmuir/papers/muir%20group%20selection%20genetics%20final%20v2.pdf

Margaret Heffernan, A Bigger Prize.

https://www.hachettebookgroup.com/titles/margaret-heffernan/a-bigger-prize/9781610392914/

Margaret Heffernan, "Is the Professional Pecking Order Doing More Harm Than Good?," NPR/TED Radio Hour.

https://www.northcountrypublicradio.org/news/npr/443412777/is-the-professional-pecking-order-doing-more-harm-than-good

SignalFire, "The State of Tech Talent Report — 2025."

https://www.signalfire.com/blog/signalfire-state-of-talent-report-2025

Anthropic, "Claude Fable 5 and Claude Mythos 5."

https://www.anthropic.com/news/claude-fable-5-mythos-5

Yapay zeka açıklaması: Argümanı geliştirdim ve orijinal taslağı kendi deneyimlerime dayanarak yazdım, ardından makalenin bazı kısımlarını araştırmak, yeniden yapılandırmak ve yeniden yazmak için ChatGPT'yi kullandım. Nihai metni gözden geçirdim ve revize ettim ve iddiaları ve sonuçları için sorumluluk alıyorum.

**Ne İnşa Ettiğimi Merak Ediyor musunuz?

Kaynaklarını gösteren bir yapay zeka:**

Sebastian ile Tanışın →

YouMind’da yeniden üret

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet