Економіка корпоративного ШІ — це проблема архітектури

@jainarvind
АНГЛІЙСЬКА2 дні тому · 21 лип. 2026 р.
876K
461
119
127
233

Коротко

Арвінд Джайн пояснює, що ефективність корпоративного ШІ — це архітектурний виклик, а не цінове питання. Зосередившись на контексті та маршрутизації моделей, компанії можуть знизити витрати та підвищити показники успішного виконання завдань.

Ціна токену продовжує падати, а рахунки за корпоративний ШІ зростають. Один запит тепер розгалужується на пошук, виклики інструментів, цикли міркувань і багатокрокове виконання, тому кількість токенів на завдання зростає швидше, ніж падає ціна за токен.

У нещодавньому епізоді All-In @Chamath Паліхапітія описав вартість токенів як "таку, що подвоюється кожні 45 днів" при підвищенні продуктивності "максимум на 5%". У тому ж епізоді @DavidSacks сказав, що підприємства хочуть дешевших і різноманітніших моделей. DoorDash повідомляє, що резервує фронтирну модель для найскладнішої роботи з перевірки коду, направляючи простіші завдання на дешевші моделі, а Decagon, за чутками, надсилає 90% зрілої роботи підтримки клієнтів на відкриті моделі. Це перегукується з тим, що генеральний директор Palo Alto Networks @NikeshArora нещодавно сказав CNBC: ціни на ШІ мають впасти на 90%, перш ніж технологія стане справді корисною для всього підприємства.

Цей розрив — це не проблема ціноутворення токенів. Це проблема архітектури.

Організаціям варто перестати вимірювати вартість за токен і почати вимірювати вартість за успішно виконане завдання. Дешева модель, яка потребує переробок, є дорогою. Потужна модель, використана на правильному кроці, є ефективною. Правильне питання — де дорогий інтелект виправдовує свою ціну. Добра відповідь на це питання — це інженерна дисципліна, і саме тут виникає конкурентна перевага.

Ми почали будувати для цього в @Glean сім років тому, ще до того, як ринок визнав це важливим. Три частини архітектури мають найбільше значення.

Контекст має першорядне значення

Модель сама по собі не розуміє вашу компанію. Вона не знає, які документи актуальні, які проєкти активні, хто за що відповідає або що дозволено бачити конкретному співробітнику. У більшості підприємств ці знання розкидані по десятках систем. Якщо ви не можете зібрати їх з урахуванням дозволів, модель міркує на основі неповної інформації та витрачає токени, щоразу відкриваючи ваш бізнес заново.

У тесті, який ми провели у Claude Cowork, ми зафіксували модель і змінили лише шар контексту, порівнявши індекс Glean зі стандартними MCP-серверами. Відповіді на основі Glean обирали приблизно в 2,5 рази частіше, а стандартні інструменти використовували приблизно на 30% більше токенів для виконання тієї самої роботи. У випадках, коли ці інструменти все ж досягали правильної відповіді, вони спалювали майже вдвічі більше токенів, щоб дійти туди, тому що їм доводилося грубою силою проходити пошук, який мав би обробляти шар контексту. Перевага зростала зі складністю завдань: показник успішності шару контексту Glean зріс з 66% на простих завданнях до 73% на складних, багатокрокових завданнях.

Кращий контекст одночасно підвищує якість і знижує вартість.

Контроль і справжній вибір моделі

Підприємства не можуть стандартизуватися на одній сім'ї моделей. Деякі завдання потребують фронтирної моделі. Багато — ні, і їх можна добре виконати швидшими або дешевшими моделями. Але мало компаній мають можливість постійно оцінювати моделі, керувати доступом до різних провайдерів, розробляти логіку резервування та відстежувати якість, вартість і затримку, коли ринок змінюється щотижня.

Що недооцінюють, так це те, що відкриті моделі більше не є дешевим, слабшим варіантом. Для конкретної високооб'ємної роботи, як-от програмування та агенти, вони тепер наздоганяють або перевершують фронтир за частку вартості. GLM-5.2 опинився приблизно в межах одного пункту від найкращих закритих моделей у довгостроковому програмуванні, працюючи приблизно за шосту частину вартості, а Kimi K3 з'явилася як найбільша відкрита модель за вагою, дебютувавши на першому місці в провідному бенчмарку програмування, випередивши найкращі системи від Anthropic і OpenAI. Це системи фронтирного класу, які, як виявилося, є відкритими, а не бюджетними компромісами. Співзасновник Glean @TonyGentilcore написав більше про те, чому підприємствам варто припинити вважати це неприйнятним.

Через Model Hub компанії Glean клієнти отримують доступ до понад 30 комерційних і відкритих моделей через один керований шар, обираючи, яка модель працює за користувачем, відділом або застосунком, з контролем доступу та аудитом, що застосовуються однаково до кожної. Шар моделі може змінюватися під вами, не змушуючи вас перебудовувати стек над ним. Це перетворює швидкозмінний, комодитизований ринок моделей з ризику на важіль впливу.

Економіка випливає звідси

Зауваження Chamath про те, що вартість випереджає цінність, — це те, з чим кожному фінансовому директору рано чи пізно доведеться зіткнутися. Відповідь не в обмеженні доступу. Вона полягає в маршрутизації роботи. Waldo, наша спеціалізована агентна пошукова модель, побудована на відкритому NVIDIA Nemotron, працює перед фронтирною моделлю для кожного запиту, щоб спланувати пошук і передати чистий контекст, скорочуючи використання токенів приблизно на 25% і затримку приблизно вдвічі при тій самій якості. Потім фронтирна модель виконує лише ту частину, в якій вона унікально хороша. Ефективність токенів, а не їх кількість, — ось метрика, яка має значення.

До чого це нас приводить

Мало компаній будували цей шар так довго і вимірювали його так ретельно, як ми. Віддача для підприємства — це не доступ до найновішої моделі. Це стратегічний вибір: які моделі використовувати, де ШІ з'являється в бізнесі і як балансувати між інтелектом, швидкістю та вартістю, маючи свободу адаптуватися до змін ринку. Моделі продовжуватимуть перестрибувати одна одну. Архітектура навколо них — ось що стає ровом.

Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей