Kimi K3 için 0. gün API'si nasıl oluşturulur

@philipkiely
İNGILIZCE2 gün önce · 27 Tem 2026
316K
468
47
12
874

TL;DR

Bu teknik derinlemesine inceleme, Baseten'in Kimi K3 için 0. gün API'sini kullanıma sunarken izlediği beş aşamayı; donanım ölçeklendirme, çıkarım motoru optimizasyonu ve 2,8T parametreli model için performans ayarlamalarını kapsayacak şekilde ele alıyor.

Baseten, Kimi K3 için Model API'lerimizde sıfırıncı gün desteği sunuyor. Moonshot AI'ye erken erişim için Kimi K3 ağırlıklarını bizimle paylaştığı için ve geliştirme süreci boyunca iş birliği yapan Inferact ile RadixArk ekiplerine teşekkür ederiz.

Philip Kiely - inline image

Kimi K3, görüntü girişi ve tam 1 milyon token bağlam penceresiyle bugün Baseten Model API'lerinde kullanılabilir.

Kimi K3, yeni bir açık öncü modeldir. 2.8 trilyon parametreyle, önceki açık modellerin çoğundan çok daha büyüktür ve yüksek performanslı bir çıkarım API'si oluşturma konusunda bir dizi zorluk ortaya çıkarır. Yeni mimari teknikler, Kimi K3'ün önceki açık öncü modellerin trilyon parametre eşiğinin ötesine geçmesini sağlar:

  • Kimi Delta Dikkati (KDA) ve Dikkat Artıkları (AttnRes), Kimi Mimarisi için ölçeklenebilir bir omurga olarak.
  • 896 uzmandan yalnızca 16'sının aynı anda aktif olduğu, Stable LatentMoE kullanılarak düzenlenen son derece seyrek uzmanlar.
  • Görüntü girişlerini işlemek ve görsel bilgileri gizli uzaya haritalamak için yeni bir görüntü kodlayıcı.

Bu makale, Kimi K3'ün yeni model mimarisini ve devasa ağırlıklarını lansman gününde ölçekte çalıştırmak için gereken teknik çalışmayı açıklamaktadır.

Dönüm Noktası 1: Bir token oluşturun

Moonshot AI ekibinden Kimi K3 ağırlıklarına erken erişim sağladıktan sonra ilk önceliğimiz, modeli basitçe çalışır hale getirmekti.

Kimi K3'ün ilk token'larını oluşturmak için gerekenler:

  • Donanım sağlama: Kimi K3'ün boyutu göz önüne alındığında, modeli NVIDIA GB300 NVL72 sistemlerinde çalıştırmaya karar verdik.
  • Ağırlıkları yükleme: MXFP4'te Kimi K3 ağırlıkları 1.4 TB'ın üzerinde veridir.
  • Bir çıkarım motorunu çalıştırma: vLLM ve SGLang'ın arkasındaki ekiplerle, Kimi K3 için çıkarım motorlarının yayın öncesi sürümlerini çalıştırmak için çalıştık.

Çoğu zaman, sıfırıncı gün API'leri oluştururken, erken bir adım, performansı ve NVIDIA Blackwell ile çıkarım yığınımızla uyumluluğu artırmak için ağırlıkları NVFP4'e taşımaktır. Ancak Kimi K3, MXFP8 aktivasyonlarıyla birlikte yerel MXFP4 ağırlıkları kullanır ve bu ağırlıkları doğrudan kullanabildik.

Ağırlıkları elimize aldıktan sonra, Inferact ile vLLM ve RadixArk ile SGLang üzerinde yakın bir şekilde çalıştık. Kimi K3'ü Baseten Çıkarım Yığını'nda çalıştırmadan önce, önde gelen açık kaynaklı çıkarım motorlarıyla iş birliği içinde bir referans noktası oluşturmamız gerekiyordu.

Bir çıkarım motoruna bir model için destek eklemek önemsiz değildir. Temel modelleme kodunu, KDA gibi yeni mimariler için optimize edilmiş çekirdekleri uygulamayı ve tokenizasyondan araç çağırmaya kadar her şeyde Kimi K3 için ön uç uyumluluğu oluşturmayı gerektirir.

vLLM'nin NVIDIA Blackwell GPU'ları için erken erişim görüntüsü, temel özellik tamamlığını oluşturmamıza, ilk değerlendirmeleri geçmemize ve bir temel performans hedefi belirlememize yardımcı oldu. KDA, AttnRes ve Stable LatentMoE gibi Kimi K3 mimari özelliklerini barındırmaya yönelik bu çalışma, üzerine inşa edebileceğimiz sağlam bir temel oluşturdu. Ayrıca, Kimi K3 için vLLM çıkarım motorunun kapsamlı bir şekilde doğrulamasını yaptık ve çalışmamıza dayanarak açık kaynaklı motora katkılarda bulunduk.

SGLang'ın erken erişim görüntüsü, Kimi K3'ün hızlı ve güvenilir bir şekilde sunulması için bir referans sağladı. SGLang, görüntü-dil modelleri için güçlü bir desteğe sahiptir ve Kimi K3 de bir istisna değildir. RadixArk ekibiyle, ön uç uyumluluğu ve çekirdek optimizasyonuna odaklandık ve mühendislik ekibimiz, sürüm hazırlığını desteklemek için araç çağırma ve yapılandırılmış çıktılar etrafındaki ön uç hatalarına yönelik düzeltmeler sağladı.

Önizleme dönemi boyunca bizimle yan yana çalışan Inferact ve RadixArk ekiplerine teşekkür ederiz. Bu çalışma, hem Kimi K3 API'miz için temel bir temel hem de açık kaynak topluluğuna geri katkıda bulunma fırsatı sağladı.

Dönüm Noktası 2: Çıkarım motorunu doğrulayın

Kimi K3, şimdiye kadarki en akıllı açık modeldir. Bu zekayı çıkarım sırasında gerçekten sunmak çok önemlidir.

Philip Kiely - inline image

Kimi K3 kıyaslamaları, doğru araç çağrılarına ve yüksek kaliteli model çıktılarına bağlı olan aracı görevlerde güçlü bir performans gösterir.

Kalite doğrulaması, farklı titizlik seviyelerinde gerçekleşebilir. Modeli bilinen bir yönlendirmeyle çağırmak veya gsm8k ya da BFCL gibi hafif bir kıyaslama çalıştırmak ve sonuçların hata payı içinde olup olmadığını kontrol etmek gibi basit akıl kontrolleri, geliştirme süreci sırasında işlerin rayından çıkmadığından emin olmak için kullanışlı kontrol noktalarıdır. Ancak halka açık bir API yayınlamak, daha titiz bir kıyaslama gerektirir.

Moonshot AI ekibi, çıkarım sağlayıcılarının model ağırlıklarının doğru ve yüksek doğrulukta sunulmasını sağlamaya yardımcı olan Kimi Vendor Verifier'ı işletmektedir. Kimi Vendor Verifier'ı geçmek, API geliştirmemizde önemli bir erken dönüm noktasıydı ve geliştirme süreci boyunca son derece yararlı bir araç oldu.

Modelleri sunarken pek çok hata yapma fırsatı vardır. Popüler anlatı, nicelemenin tüm kalite sorunlarının kökü olduğu yönünde olsa da, pratikte bu doğru değildir. Özellikle araç çağırma ve diğer yapılandırılmış model davranışlarıyla ilgili kalite sorunlarının çoğu, çıkarım sunucusunun ön ucundan kaynaklanır.

Philip Kiely - inline image

Ön uç, çıkarım motorunun önünde oturur ve girdileri ve çıktıları işler.

Ön uç, çıkarım döngüsünün önünde CPU'da çalışan belirleyici koddur. Girdileri kabul etmek ve çıktıları döndürmekten sorumludur. Ön uç şunları yapmalıdır:

  • API'yi çalıştırmalı ve doğrulamalı
  • Yönlendirmeleri tokenize etmeli ve çıktıları detokenize etmeli
  • Sohbet şablonunu oluşturmalı
  • Akıl yürütme ve araç çağrılarını ayrıştırmalı
  • Çıktıyı ChatCompletions, mesajlar veya başka bir standarda biçimlendirmeli

Bu görevler modelden modele ince bir şekilde farklılık gösterir ve sıfırıncı gün desteği için hızlı bir şekilde inşa ederken hatalar ve performans düşüşleri getirmek çok yaygındır. Kimi Vendor Verifier gibi sağlam kontroller, hem çıkarım döngüsü hem de API yüzeyi boyunca modelin yüksek derecede doğrulukla sunulmasını sağlamak için araç çağırma gibi yaygın hata modlarında performansı değerlendirir.

API'yi geliştirmeye devam ederken, sonraki dönüm noktalarında performans optimizasyonlarının doğruluğu düşürecek hatalar getirmediğinden emin olmak için Kimi Vendor Verifier'ı kullandık.

Dönüm Noktası 3: Doğru yapılandırmayı bulun

Çıkarım motorları, performansı farklı modellere, donanıma, trafik şekillerine ve gecikme/verim ödünleşimlerine göre ayarlamak için çok çeşitli yapılandırma seçenekleri sunar. Bu seçenekler ve aralarındaki etkileşimler karmaşıktır.

Doğru yapılandırmayı keşfetmek için, Tensor Paralelliği (TP) ve Uzman Paralelliği (EP) ayarları, Dikkat Veri Paralelliği (ADP) değiştirme, toplu iş boyutlandırma, spekülatif kod çözücü taslak uzunlukları, doğrusal katman önbelleğe alma aralıkları, yönlendirme parametreleri ve çıkarım motoru ayarları gibi çeşitli seçenekler üzerinde tarama yaparız.

Philip Kiely - inline image

Tensor Paralelliği ve Uzman Paralelliği, büyük modelleri birden çok GPU'ya böler.

Kimi K3'ü çalıştırmak, devasa model ağırlıklarını VRAM'e sığdırmak için sekiz adet NVIDIA GB300 GPU gerektirir. Ancak, sekizli düğümler halinde gelen diğer birçok NVIDIA GPU'sunun aksine, GB300'ler dörtlü düğümler halinde gelir. Bu başlangıçta paralellik stratejilerini sınırlıyor gibi görünse de – Tensor Paralelliği geleneksel olarak düğümler arasında mümkün değildir çünkü yavaş ara bağlantılar maliyetli tümü-azalt işlemlerini çıkarım için bir darboğaz haline getirir – GB300 NVL72 sistemi, düğümler arasında yeterince hızlı bir ara bağlantıya sahiptir, böylece düğümler arasında Tensor Paralelliği ve Uzman Paralelliği ile çıkarım çalıştırabiliriz.

Bu yapılandırma kararları, çıkarım motoru seçiminin aşağı akışındadır. Mühendisler, vLLM, SGLang ve kendi dahili motorumuzu yapılandırmak için paralel olarak çalıştılar, bulguları paylaştılar ve öğrenimleri kendi dahili çıkarım motorumuza uygularken aynı zamanda açık kaynaklı motorlara PR'lar gönderdiler.

Dönüm Noktası 4: Performansı optimize edin

Bir model optimize edilmiş bir yapılandırmada çalışır hale geldiğinde, gecikmeyi, verimi veya bunların bir kombinasyonunu önemli ölçüde iyileştirebilecek çok sayıda çıkarım mühendisliği tekniği vardır. Model API'leri için genellikle şunlara bakarız:

  • Spekülasyon: Birden çok token'ı tahmin etmek ve ardından bunları ileri geçişin bir parçası olarak doğrulamak için küçük bir taslak model kullanmak. Bu kayıpsız optimizasyon, kullanıcı başına TPS'yi (saniye başına token) kod çözme üzerinde iyileştirir.
  • Ayrıştırma: Ön doldurma ve kod çözmeyi ayrı çalışanlara taşıyın. Bu, kaynaklar için rekabeti önler, daha hedefli yapılandırmaya izin verir ve ön doldurma ve kod çözme hesaplamasının oranını trafiğe uyacak şekilde ayarlanabilir hale getirir.
  • Önbelleğe alma: İstekler arasında KV önbelleği ve KDA durumlarını kaydetmek için bellek ayırmak, giriş dizilerinde paylaşılan ön eklere sahip sonraki isteklerin ön doldurmanın tamamını veya bir kısmını atlamasına izin verir. Bu, İlk Token Geç Süresini (TTFT) ve genel sistem verimini iyileştirir.

Modelin önceki dönüm noktalarından çalışır durumda olması, bu çalışma için bir bağımlılıktır. Örneğin, DSpark, DFlash veya EAGLE-3 gibi bir yöntem kullanarak bir spekülatör modeli eğitmek, beklenen gerçek dünya kullanımına benzeyen bir dizi yönlendirme kullanarak hedef modelden (Kimi K3) gizli durumlar oluşturmayı gerektirir. Bunu yapmak için, modelin makul ölçüde yüksek verimli bir örneğine ihtiyacınız vardır ve çıkarım çalıştırıyor olması gerekir.

Yeni bir performans optimizasyonu tokenizer'daydı. Yıllardır çıkarım mühendisleri tokenizasyon süresini ihmal edilebilir olarak göz ardı edebiliyorlardı. Uzun giriş dizileri ve yüksek KV önbelleği yeniden kullanım oranlarına sahip Kimi K3 gibi bir model için bu aslında değişir ve tokenizasyon, ön doldurma süresi için önemli hale gelebilir, çünkü giriş dizisi bir önbellek isabeti olsun ya da olmasın tokenizasyon gerçekleşmelidir.

Uzun giriş dizileri için tiktoken'den 18 kata kadar daha hızlı olan özel bir tokenizer oluşturduk ve bunu Kimi K3 API'mizle birlikte kullanıma sunduk.

Philip Kiely - inline image

Basetenkenizer, uzun giriş dizileri için Tiktoken'den 18 kata kadar daha hızlıdır.

Performans konusunda hala yapılacak daha çok iş var. Piyasaya sürdüğümüz her modelle, sürümü takip eden haftalarda gecikme ve verim optimizasyonlarına yatırım yapmaya devam ediyoruz. Kimi K3'ün benzeri görülmemiş boyutuyla, her ana çıkarım mühendisliği tekniğinde ve çıkarım yığınının her katmanında daha fazla performans iyileştirmesi için çok geniş bir yüzey alanı vardır.

Dönüm Noktası 5: Ölçekte dağıtın

Kimi K3 için endüstri çapında büyük bir heyecan var. Bu, lansmanda API için büyük bir talep dalgasıyla karşılanacak. Buna göre, yalnızca kullanıcı başına gecikme değil, sistem çapında verim en önemli önceliktir.

Bir GB300 NVL72 sisteminde, bir düğüm 4 ayrı GPU'dur, yani 18 düğüm vardır. Bir örnek olarak, Kimi K3 2 düğüm (8 GPU) kaplar; her NVL72 rafı, modelin 9 kopyasını barındırabilir. Her kümenin birden çok GB300 NVL72 rafı vardır ve daha fazla kapasiteye erişmek için modeli birden çok bölge ve bulut sağlayıcı arasında sunarız.

Philip Kiely - inline image

Her NVL72 sistemi, Kimi K3'ün dokuz kopyasını çalıştırabilir.

Belirli bir kopyanın verimi için en önemli faktör, ön ek önbellek isabet oranıdır. Dağıtımın ölçeği göz önüne alındığında, bu, KV duyarlı yönlendirmeyi altyapıda çözülmesi gereken birincil zorluk haline getirir. Bir kullanıcı daha önce gördüğümüz bir giriş token'ı dizisi gönderdiğinde, bu isteği, ön doldurmayı atlamak için kaydedilmiş KV önbelleğine erişebilen bir kopyaya yönlendirmemiz gerekir.

NVIDIA Dynamo araç seti ile oluşturulan KV duyarlı yönlendirme sistemimiz, tekrarlanan sorgular için sıcak önbelleklere sahip kopyalara trafiği yönlendirebilmemizi sağlar. Kodlama ve çok turlu aracılar, Kimi K3 için yaygın kullanım durumları olduğundan, bu önbellek duyarlı yönlendirme sistemi, kullanıcıların paradan tasarruf etmesi ve yüksek toplam sistem verimini koruması için kritik öneme sahiptir.

Baseten'de Kimi K3 ile oluşturun

Model API'leri aracılığıyla sıfırıncı gün erişimi sunmaktan heyecan duyuyoruz ve bu modelin uygulamasını, performans ve güvenilirlikte en yüksek standartlara ulaşmak için optimize etmeye devam etmeyi dört gözle bekliyoruz.

Moonshot AI ekibinin Kimi K3 duyurusu, çekirdek optimizasyonu ve döngüde görüntü oyun geliştirme gibi kodlama görevleri, araştırma görevleri ve video düzenleme ile bilgi çalışması gibi aracı görevler dahil olmak üzere model için bir dizi ilginç test içerir. 28 Temmuz Salı günü Pasifik Saati ile 11:00'de, Baseten'deki tüm ileri dağıtım mühendisliğini yöneten Joey Zwicker ile birlikte Kimi K3 kullanım durumları hakkında bir yönetici brifingine ev sahipliği yapıyorum.

Kimi K3, bugün Baseten Model API'lerinde mevcuttur. Açık ağırlık zekasında yeni sınıra hoş geldiniz.

Kimi K3 API'mizin arkasındaki sıkı çalışmalarını bu makalede belgelememe izin veren, model performansı, altyapı, kapasite, eğitim, ürün ve ileri dağıtım mühendisliği ekipleri arasında isimlendirilemeyecek kadar çok kişi de dahil olmak üzere birçok mühendise teşekkürler. Ayrıca, iş birliği ve destekleri için Moonshot AI, Inferact ve RadixArk ekiplerine teşekkür ederiz.

YouMind’da yeniden üret

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Üreticiler için

Markdown'ınızı temiz bir 𝕏 makalesine dönüştürün

Kendi uzun yazılarınızı yayımlarken görselleri, tabloları ve kod bloklarını 𝕏 için biçimlendirmek zahmetlidir. YouMind, eksiksiz bir Markdown taslağını temiz ve hemen paylaşılabilir bir 𝕏 makalesine dönüştürür.

Markdown'dan 𝕏'e deneyin

Çözülecek daha fazla kalıp

Son viral makaleler

Daha fazla viral makale keşfet