Fireside Weekly: 이번 주 주목해야 할 8가지 대화

@firesidealpha
영어2일 전 · 2026년 7월 25일
148K
32
3
0
71

TL;DR

이번 주 요약본은 NVIDIA의 성장 전망, 맞춤형 AI 반도체로의 전환, 그리고 Devin과 같은 에이전트가 소프트웨어 엔지니어링을 어떻게 변화시키고 있는지 등 8가지 주요 기술 논의를 종합합니다.

시간에 쫓기면서도 최고의 테크·비즈니스 대화에서 배움을 얻고 싶은 빌더와 투자자들을 위한 콘텐츠입니다.

이번 주 발행된 최고의 에피소드 8개를 한 곳에 모아 요약했으며, 각 전체 콘텐츠는 클릭 한 번으로 확인하실 수 있습니다. 매일 새로운 에피소드에 대한 분석과 해설을 받아보시려면 Fireside Alpha를 구독해 주세요.

이번 주 최대 이슈:

  • 젠슨 황은 AI 구축이 완료되기 전까지 반도체 산업이 여전히 5~10배 더 성장해야 한다고 말하며, 버블의 시점을 "언젠가, 오늘은 아니다"라고 못 박았습니다. ▶ Watch · 00:32:01
  • 찰리 카와스 (브로드컴 사장)는 한 고객사가 올해 AI 실리콘 1.5 GW에서 내년 계약된 6.5 GW, 그다음 해에는 10 GW 이상으로 확장 중이라고 밝혔습니다. ▶ Watch · 00:16:40
  • 사신 가지 (시놉시스 CEO)는 AI 칩 설계 수준을 현재 L4로 평가하며, 프론트엔드는 이미 6~8개의 에이전트가 운영 중이라고 말했습니다. 2년 전 "5~6년 남았다"고 예측했지만 틀렸다고 인정했습니다. ▶ Watch · 00:12:56
  • 앤디 혹 (Cerebras 최고전략책임자)은 OpenAI가 Cerebras 컴퓨팅 750메가와트를 구매하기로 합의했으며, OpenAI의 코딩 제품 중 더 빠른 Codex 옵션이 Cerebras에서 구동된다고 밝혔습니다. ▶ Watch · 00:49:58
  • 팻 겔싱어와 SK하이닉스를 포함한 HBM 패널은 예전에는 "4년 중 1년만 좋았던" 메모리 사업이 현재 90%에 가까운 마진을 기록하고 있지만, 여전히 나쁜 메모리라고 평가했습니다. ▶ Watch · 0:03:11
  • SemiAnalysis 데스크는 Anthropic이 이미 수익성을 달성했으며, ARR의 80% 이상이 고마진 API 부문에서 나오고, 3분기 영업이익이 10억 달러를 넘을 가능성이 있다고 분석했습니다.
  • 스콧 우는 Cognition 코드의 90% 이상이 이제 Devin에 의해 커밋되고 있으며, 에이전트가 이미 대부분의 세션을 자체적으로 시작한다고 밝혔습니다. ▶ Watch · 5:31
  • Aria Networks의 만수르 카람은 동일한 100만 토큰이 0.20달러가 될 수도 있고 20달러가 될 수도 있으며, 100배의 차이가 발생한다고 말했습니다. 이를 결정하는 계층은 바로 네트워크입니다. ▶ Watch · 0:03:38

젠슨 황 · Axios

Fireside Alpha - inline image

전체 기사: 젠슨 황, AI 비관론자들에게: 버블은 언젠가 오겠지만, 적어도 향후 5년은 아니다

젠슨 황, NVIDIA 공동 창업자 겸 CEO, Axios "Behind the Curtain"에서 Mike Allen과 포트워스의 새 칩 공장에서 AI 버블이 실제하지만 아직 몇 년은 남았으며, 그전에 무엇이 먼저 구축되어야 하는지 논의했습니다.

반도체 산업은 향후 10년 동안 5~10배 더 커져야 합니다. 황의 추정은 메모리, 스토리지, 광학 인터커넥트, 패키징, TSMC 생산 능력 전반의 부족 현상을 동시에 고려한 것입니다.

"저는 우리 반도체 산업이 지금보다 5~10배는 더 커져야 할 것이라고 생각합니다."

Watch · 00:32:01

버블은 "언젠가" 오겠지만, 향후 5년 안에는 오지 않습니다. Allen은 반도체 업계의 가장 오래된 질문, 즉 이렇게 큰 호황이 불황으로 이어질 수밖에 없는지에 대해 압박했습니다.

"버블은 언젠가 올 것입니다. 다만 오늘은 아닐 뿐입니다. 알다시피, 지금은 구축의 초기 단계에 불과합니다."

Watch · 00:36:21

NVIDIA의 중국 매출은 "오늘날 거의 제로"입니다. 황은 중국 시장이 폐쇄된 상태로 유지되는 한 투자자들에게 어떤 매출도 기대하지 말라고 말했습니다.

"오늘날 우리의 중국 매출은 거의 제로입니다. 그리고 저는 모든 투자자들에게 중국에서의 어떤 매출도 기대하지 말라고 말했습니다."

Watch · 00:06:07

제조업 일자리는 지난 몇 년 동안 약 50% 증가했습니다. 황은 이러한 증가를 토큰을 생성하는 AI 데이터 센터의 물리적 구축과 연결 지었습니다.

"제조업 일자리 수는 지난 몇 년 동안 약 50% 증가했습니다. 왜냐하면 이 컴퓨터들은 토큰, 즉 지능을 생성하는 AI 데이터 센터에 들어가야 하기 때문입니다."

Watch · 00:17:27

일자리를 빼앗는 것은 AI 자체가 아니라 AI를 사용하는 사람입니다. 황의 비관론 반박 논리는 특정 작업을 자동화하는 것과 전체 일자리를 없애는 것을 구분합니다.

"AI가 우리의 모든 일자리를 파괴하지는 않을 것입니다. AI를 사용하는 누군가가 우리의 일자리를 가져갈 것입니다."

Watch · 00:23:41

1천억에서 1조 개의 에이전트가 항상 실행됩니다. 현재 어느 순간에나 컴퓨터를 사용하는 약 1억 명의 인구와 대비됩니다.

"우리는 항상 실행되는 1천억, 1조 개의 에이전트를 갖게 될 것입니다. 똑똑한 에이전트, 덜 똑똑한 에이전트, 전문 에이전트, 슈퍼 에이전트, 모든 종류의 다양한 에이전트가 항상 실행될 것입니다."

Watch · 01:04:54

찰리 카와스 · RAISE Summit

Fireside Alpha - inline image

전체 기사: 브로드컴 (찰리 카와스): 커스텀 실리콘이 어떻게 0에서 1000억 달러로 성장했나

브로드컴 반도체 솔루션 그룹 사장인 찰리 카와스가 RAISE Summit 무대에 올라 블랙록의 Tony Kim에게 커스텀 실리콘이 어떻게 0에서 $1000억으로 성장했는지, 그리고 왜 주요 AI 연구소들이 NVIDIA의 범용 랙을 떠나고 있는지 설명했습니다.

NVIDIA의 범용 랙에는 두 가지 세금, 즉 효율성 세금과 마진 세금이 있습니다. 카와스는 프론티어 연구소가 NVIDIA의 사전 구축된 컴퓨팅 플랫폼을 구매할 때 물려받는 비용 구조를 설명하고 있습니다.

"이 범용 컴퓨팅에는 세금이 따릅니다. 첫 번째 세금은 해당 컴퓨팅 플랫폼의 효율성입니다. 즉, 모든 사람을 위해 만들어진 제품이라는 뜻입니다. 만약 AI 프론티어 모델에 특정 워크로드가 있다면, 그 추가 세금을 부담하게 되는 것입니다. 그리고 또 다른 세금은 거기에 따르는 높은 마진입니다."

Watch · 00:01:56

각 칩 세대는 이전 세대보다 메모리는 3배, 컴퓨팅 성능은 거의 3배 더 강력합니다. 카와스는 연속된 연도의 실제 칩(메모리 큐브 2개와 6개)을 진행자에게 건네면서 이 말을 했습니다.

"작년과 올해를 비교하면, 이제 3배 더 많은 메모리를 얻을 수 있습니다. 여기에는 2개의 메모리 큐브가 있고, 여기에는 6개의 메모리 큐브가 있습니다. 그리고 중간에 있는 컴퓨팅 성능은 거의 3배 더 강력합니다."

Watch · 00:04:09

5대 AI 연구소 중 4곳이 브로드컴과 커스텀 플랫폼을 구축 중입니다. 5대 연구소는 OpenAI, Anthropic, Google, Meta, xAI이며, 카와스의 계산으로는 전 세계 AI 지출의 약 90%를 차지합니다.

"미국의 빅 5, 즉 현재 세계 지출의 약 90%를 차지하는 곳은 OpenAI, Anthropic, Google(Gemini), Meta, xAI입니다... 이 5곳이 말 그대로 시장의 80~90% 이상을 차지합니다. 그리고 이 중 4곳은 NVIDIA 기술이 매우 뛰어나다는 것을 인지하면서도, 랙 수준에서 커스텀된 이 범용 컴퓨팅 플랫폼을 계속 구매할 수는 없다는 사실을 깨달았습니다."

Watch · 00:07:56

공동 설계는 XPU와 전체 랙, 두 가지 수준에서 이루어집니다. 카와스는 연구소가 왜 이 커스텀 실리콘을 선반에서 바로 구매할 수 없는지, 그리고 브로드컴이 오픈 랙을 위해 어디에 힘을 쏟고 있는지 답변하고 있습니다.

"이 오트 쿠튀르(haute couture)에는 두 가지 부분이 있습니다. 하나는 말씀하신 XPU에 대한 심층 공동 설계이고, 다른 하나는 랙 수준입니다. 따라서 우리는 그들의 LLM과 특정 사용 사례를 위해 XPU 수준에서 작업해야 할 뿐만 아니라, 전체 랙이 개방형(open)이 되도록 하는 방법에도 깊이 관여하고 있습니다."

Watch · 00:12:18

한 고객사가 올해 1.5 GW에서 내년 계약된 6.5 GW, 그다음 해에는 10 GW 이상으로 확장 중입니다. AI 인프라의 미래에 대한 질문에 카와스는 칩 수가 아닌 단일 대형 고객사의 전력 소비량으로 답했습니다.

"대형 5개사 중 한 곳의 경우, 올해는 제가 보여드린 칩 중 하나로 약 1.5기가와트를 공급하고 있습니다. 내년에는 아마 5기가와트 이상을 공급할 것이고, 이미 5기가와트는 계약되었습니다... 그다음 해에는 10기가와트가 훨씬 넘을 것이라고 확신합니다."

Watch · 00:16:40

사신 가지 · RAISE Summit

Fireside Alpha - inline image

전체 기사: 시놉시스 (사신 가지): 칩 설계가 "L4" 수준에 도달했으며, 웨이퍼 용량이 한계점이다

시놉시스 CEO 사신 가지가 RAISE Summit 무대에서 AI가 얼마나 빠르게 칩 자체를 설계하고 있으며, 구축 과정에서 어디서 웨이퍼가 부족해지는지에 대해 설명했습니다.

CEO에 따르면, 지구상의 모든 칩은 존재하기 전에 시놉시스를 거칩니다. 시놉시스는 칩 엔지니어가 실리콘을 설계하는 데 사용하는 전자 설계 자동화(EDA) 도구를 판매하며, 현재는 Ansys 인수를 통해 물리학 영역으로 확장했습니다.

"오늘날 시놉시스 없이 설계되는 칩은 없습니다. 따라서 우리는 실리콘 수준에서 그 사용이 필수적이며 보편적입니다."

Watch · 00:01:08

학습(Training)에서 추론(Inference)으로의 전환은 전체 스택의 맞춤화를 강제합니다. 가지는 하나의 범용 AI 칩이 왜 GPU, 브로드컴 스타일의 ASIC, 하이퍼스케일러 고객 소유 도구 등으로 세분화되고 있는지 설명합니다.

"그 추론 효율성에 도달하려면 전체 스택을 살펴봐야 합니다... 그리고 바로 그 지점에서 적절한 효율성, 성능, 비용을 달성하기 위해 실리콘의 맞춤화와 스택 전체에 대한 검토가 모두 필요합니다."

Watch · 00:03:38

데이터 센터 마진은 비용이며, 하이퍼스케일러들은 이를 줄이기 위해 공동 설계를 진행하고 있습니다. 다음 주로 1주년을 맞는 Ansys 인수는 시놉시스가 전자 장치와 함께 열, 유체, 구조 물리학을 모델링할 수 있게 해줍니다.

"데이터 센터를 설계할 때는 일반적으로 많은 마진을 두고 설계하며, 마진은 곧 비용입니다... 많은 하이퍼스케일러와 고급 고객들이 여러 엔지니어링 도메인에 걸친 공동 설계를 통해 이 마진을 줄이려고 노력하고 있습니다."

Watch · 00:07:40

가지가 언급한 자율 칩 설계까지는 5~6년이 남았지만, 그는 지난 2년 동안 계속 틀렸습니다. 시놉시스는 자율주행과 유사하게 설계 자율성을 L1부터 L5까지 등급을 매기며, 현재 업계를 L4로 평가하고 프론트엔드는 이미 6~8개의 에이전트가 운영 중이라고 밝혔습니다.

"만약 2년 전에 저에게 그 질문을 했다면, 아마 5~6년은 남았다고 말했을 것입니다. 그리고 저는 지난 2년 동안 틀렸습니다. 왜냐하면 그 변화가 너무 빠르게 다가오고 있기 때문입니다."

Watch · 00:12:56

로직과 메모리 모두에서 웨이퍼 용량이 한계점이며, 테슬라는 2030년까지 실리콘 부족을 예상합니다. 구축의 제약 조건은 수요가 아닌 물리적인 팹 생산량이며, 가지는 이 제약이 계속해서 압박할 것으로 예상합니다.

"현재 제약 조건은 웨이퍼 용량에 의해 제한되며, 이는 로직 웨이퍼 용량뿐만 아니라 메모리도 마찬가지입니다... 테슬라와 같은 회사가 2030년까지는 전기차에서 로봇공학에 이르는 그들의 야망을 고려할 때, 그들이 상상하는 실리콘 수요를 지원할 충분한 용량이 없을 것이라고 말하는 것을 들을 수 있습니다."

Watch · 00:14:45

앤디 혹 · Cerebras

Fireside Alpha - inline image

전체 기사: Cerebras가 NVIDIA를 무너뜨리려는 계획 (앤디 혹, 최고전략책임자)

Cerebras 최고전략책임자 앤디 혹이 업계가 왜 그래픽용으로 만들어진 칩을 계속 구매하는지, 그리고 하나의 웨이퍼 크기 프로세서를 통째로 남겨둔 방식이 어떻게 OpenAI의 750메가와트 컴퓨팅 딜을 가능하게 했는지 설명합니다.

Cerebras는 하나의 칩을 만들고 웨이퍼를 수백 개로 자르지 않고 통째로 유지합니다. 업계는 일반적으로 웨이퍼를 인쇄한 후 작은 칩으로 자르고, 이를 보드와 데이터 센터를 통해 다시 연결합니다.

"칩, 즉 큰 칩에 가능한 한 많은 컴퓨팅 성능을 집적하고, 컴퓨팅 요소들이 실리콘을 통해 서로 통신하도록 하여 작은 칩들을 여러 개 연결할 필요가 없게 만든다면 어떨까? [...] 마지막 단계를 그냥 하지 않으면 어떨까? 하나의 큰 칩을 만들고 그것을 통째로 유지하면 어떨까?"

Watch · 00:15:13

웨이퍼 스케일 엔진은 거의 100만 개의 코어를 보유하고 있으며, 양산 기계에는 90만 개가 탑재됩니다. 각 코어는 자체 고속 온칩 메모리 뱅크를 갖추고 있으며, 구리와 광섬유 대신 실리콘을 통해 모두 연결됩니다.

"이것이 웨이퍼 스케일 엔진입니다. [...] 하나의 장치에 거의 100만 개의 코어가 있으며, 양산 기계에는 90만 개가 있습니다. 이 코어들은 웨이퍼 전체 표면에 걸쳐 2D 그리드로 배치되어 있으며, 모든 코어가 서로 직접 연결되어 있습니다. [...] 이 설계는 단일 장치에서 클러스터 하나 분량의 AI 컴퓨팅 성능을 제공하며, 기존 칩 설계로는 불가능한 수준의 통신 대역폭과 메모리 대역폭을 말 그대로 3자리수(1000배) 더 높여줍니다."

Watch · 00:15:45

학습(Training)은 비용 센터이고, 추론(Inference)은 현금을 벌어들이는 곳입니다. 혹은 AI 경제를 모델 구축과 최종 사용자 대상 실행으로 나눕니다.

"학습은 비용 센터입니다. 그곳에서 모델을 만들고, 원하는 대로 작동하도록 가르칩니다. 추론은 가치 센터입니다. 모델이 필요한 작업을 수행하거나, 사용자나 최종 사용자에게 가치 있는 일을 하게 되면, 추론이 바로 현금을 벌어들이는 단계입니다."

Watch · 00:21:45

Cerebras는 Gemma 4를 초당 1,500 토큰 속도로 제공하며, 이는 모든 GPU 구현보다 10배 빠릅니다. 회사는 인터뷰 당일 Google 모델을 프리뷰로 공개하고 경쟁사 대비 속도를 언급했습니다.

"우리는 Gemma 4를 초당 1,500 토큰 속도로 제공하고 있습니다. 이는 모든 GPU 구현보다 10배 빠르며, Claude의 Haiku 모델 같은 것보다 15배 빠릅니다. [...] 속도가 곧 소프트웨어 엔지니어 생산성과 직결되는 빠른 코딩 에이전트에 적합합니다."

Watch · 00:23:16

OpenAI는 Cerebras 컴퓨팅 750메가와트를 구매하기로 합의했으며, Codex Spark가 이를 기반으로 실행됩니다. OpenAI 제품 내 더 빠르고 높은 가격의 코딩 옵션은 내부적으로 Cerebras를 사용합니다.

"공개된 거래 조건에 따르면, OpenAI는 자사 애플리케이션을 구동하기 위해 Cerebras로부터 750메가와트의 컴퓨팅 성능을 구매할 예정입니다. 현재 Cerebras를 사용하는 코딩 모델은 Codex Spark이며, 우리는 OpenAI 팀과 협력하여 향후 GPT 프론티어 모델부터 차세대 코딩 모델에 이르기까지 추가 모델을 도입할 계획입니다."

Watch · 00:49:58

Cerebras는 모든 메모리를 칩 내부에 보관하므로 HBM 부족 현상의 영향을 받지 않습니다. GPU가 가중치를 가져오는 고대역폭 메모리는 팹 생산량에 제한을 받으며 명령에 따라 확장할 수 없습니다.

"그 메모리는 팹 제한, 제조 제한의 영향을 받습니다. [...] 마치 다이얼을 돌려서 생산량을 10배 늘릴 수 있는 것이 아닙니다. 따라서 그 메모리는 현재 그러한 유형의 칩에 있어 병목 현상입니다. 우리에게는 그렇지 않습니다. 우리는 모든 메모리를 칩 위에 가지고 있습니다. 바로 여기 있습니다. 그 공급망의 일부가 아닙니다."

Watch · 00:30:41

HBM 패널 · RAISE Summit

Fireside Alpha - inline image

전체 기사: HBM, 90% 마진을 기록하지만 무대 위 모두는 여전히 나쁜 메모리라고 부른다: AI 메모리 병목 현상의 내부

파리 RAISE Summit에서 팻 겔싱어, SK하이닉스 펠로우 호식 김, 투자자 Andrew Homan과 Vijay Shilpiekandula가 HBM이 약 90%의 마진을 기록하는 반면, 무대 위 모든 사람들이 여전히 그것을 나쁜 메모리라고 부르는 이유에 대해 논의했습니다.

HBM은 예전에 4년 중 1년만 좋았던 사업에서 현재 90%에 가까운 마진을 벌어들이고 있습니다. 겔싱어는 인텔을 여러 메모리 사이클 동안 이끌었으며, 현재 Playground Global에서 이 분야에 투자하고 있습니다.

"메모리 사업이 이렇게 좋았던 적은 없었습니다. 우리는 반도체 업계에서 농담삼아, 만약 당신이 메모리 회사라면 4년 중 1년은 좋고 나머지 3년은 형편없다고 말하곤 했습니다." - 팻 겔싱어, Playground Global

Watch · 0:03:11

전 인텔 CEO는 SK하이닉스 펠로우가 한 자리 옆에 있는 자리에서 HBM을 "형편없는 메모리"라고 부릅니다. 겔싱어의 반대 이유는 상업적이 아닌 물리적입니다: DRAM을 쌓으면 열 샌드위치가 만들어지고 대역폭이 메모리와 GPU가 만나는 접점(shorline)에 고정됩니다.

"HBM은 형편없는 메모리입니다. 제 메모리 관련 친구들이 곧 무대에 오를 거라는 걸 알고 있고, 그들의 자식을 못생겼다고 말하는 것이 친구를 사귀고 사람들에게 영향을 미치는 최선의 방법은 아닐 수 있습니다." - 팻 겔싱어, Playground Global

Watch · 0:04:35

SK하이닉스 자체 펠로우는 HBM이 메모리 벽 문제를 해결하지 못할 것이라고 말합니다. 김은 HBM 시장 선두주자인 SK하이닉스에서 시스템 아키텍처 연구를 총괄합니다.

"좋은 메모리이지만 최종 해답은 아닙니다. HBM은 메모리 벽 문제를 해결하지 못할 것입니다. 메모리 벽 문제는 피할 수 없는 AI의 고유한 문제입니다." - 호식 김, SK하이닉스

Watch · 0:12:49

HBM은 팹의 처리량을 시간당 12개의 와플에서 4개로 떨어뜨립니다. Homan은 제조 처리량이 왜 부족 현상을 빠르게 해소하지 못하는지 설명하기 위해 주방에 비유했습니다.

"SK하이닉스는 와플 메이커입니다. 보통 5분 만에 와플 하나를 요리할 수 있는 와플 기계가 있습니다. 그 시나리오에서는 시간당 12개의 와플을 만들 수 있습니다. HBM을 사용하면 이제 와플 하나를 만드는 데 15분이 걸립니다. 따라서 시간당 4개의 와플만 만들 수 있습니다." - Andrew Homan, Maverick Silicon

Watch · 0:19:41

Apple은 제품 라인 전체에 걸쳐 가격을 인상했으며, 지구상에서 가장 정교한 메모리 구매자입니다. HBM은 2026년에 약 7%의 공급 부족 상태에 있으며, Homan은 이 타이트함이 얼마나 지속될지에 대한 가장 명확한 신호를 Cupertino(Apple)에서 찾을 수 있다고 지적했습니다.

"Apple은 제품 라인 전반에 걸쳐 가격을 인상했습니다. 그들은 지구상에서 가장 정교한 메모리 조달 기계이며, 분명히 이러한 상황이 한동안 지속될 것으로 예상하기 때문에 그렇게 행동한 것입니다." - Andrew Homan, Maverick Silicon

Watch · 0:27:50

전 인텔 CEO의 판단에 따르면, 메모리 부족 현상은 앞으로도 몇 년 더 지속됩니다. 겔싱어는 3년 전에 내려진 자본 투자 결정에 의해 이미 고정된 생산 능력을 기준으로 자신의 시간표를 설정했습니다.

"풍요로운 시절은 아직 몇 년 남았습니다. 메모리 부족의 시절은 우리 앞에 아직 몇 년 더 남아 있습니다." - 팻 겔싱어, Playground Global

Watch · 0:29:26

SemiAnalysis Tokenomics · Ep020

Fireside Alpha - inline image

전체 기사: SemiAnalysis Tokenomics: Anthropic은 이미 수익성 (3분기 10억 달러 이상), OpenAI는 간신히 손익분기점 회복

SemiAnalysis Tokenomics 데스크 (Crystal Huang, Max Kan, Joey Brookhart, 진행자 Jordan Nanos)가 한 시간 동안 모델 연구소 마진에 대해 논의합니다: Anthropic이 이미 수익성을 달성한 이유, 구독이 API를 어떻게 보조하는지, 메가와트당 수익이 3분기마다 두 배로 증가하는 현상 등.

Anthropic의 API는 ARR의 80% 이상을 차지하며, 3분기 영업이익은 10억 달러를 초과할 수 있습니다. Joey Brookhart는 비GAAP 기준, 주식 보상 제외 기준으로 손익계산서상의 이익을 분석합니다.

"영업이익은 2분기에 흑자였으며, 3분기에는 10억 달러 이상의 흑자를 기록할 수 있습니다." - Joey Brookhart

Anthropic의 API 총 마진은 85% 이상이며, 20배 구독 요금제는 마이너스 마진을 기록할 수 있습니다. Max Kan이 구독 대 API 마진이 실제로 어디에 있는지 분석합니다.

"API보다 마진이 나쁘다는 것은 잊으세요. 우리는 API가 적어도 Anthropic의 경우 85% 이상일 가능성이 높다고 생각합니다. 이러한 20배 요금제는 일반적으로 마이너스 마진일 수도 있습니다. 따라서 당연히 이 사업체들은 가능한 한 많은 볼륨을 API로 이동시키려고 합니다." - Max Kan

상위 1% 기업은 직원 1인당 연간 10만 달러를 AI에 지출합니다. Joey Brookhart는 Ramp의 카드 데이터를 코딩에 대한 과도한 지출의 ROI 지표로 읽습니다.

"Ramp 데이터에 따르면 상위 1% 기업은 직원 1인당 연간 10만 달러를 AI에 지출합니다. 그리고 그 정도로 지출하는 수준에 도달했다면, 분명히 꽤 좋은 ROI를 얻고 있는 것입니다." - Joey Brookhart

엔터프라이즈 요금제는 구독을 차단하고 마진이 있는 토큰당 과금을 강제합니다. Max Kan은 왜 연구소들이 가장 무거운 사용자들을 API로 유도하는지 설명합니다.

"구독을 사용할 수 있는 사람이라면 누구든지, 그것이 너무 보조금이 많이 지원되기 때문에 반드시 구독을 사용해야 합니다. OpenAI와 Anthropic은 이를 매우 잘 알고 있습니다. 그들이 엔터프라이즈 요금제를 제공할 때는 구독을 사용하도록 허용하지 않습니다. 그들이 마진이 있는 곳이 토큰당 과금이라는 것을 알기 때문에 토큰당 지불을 강제합니다." - Max Kan

데스크의 분석: Elon은 Colossus의 대부분을 시장 가격의 3~4배에 Anthropic에 임대하며, 90일 환수 조항이 포함되어 있습니다. Max Kan은 컴퓨팅 소유자의 관점에서 프론티어 임대 논리를 설명합니다.

"여러분이 프론티어에 도달할 능력이 있음을 증명할 수 있을 만큼의 충분한 컴퓨팅 성능을 남겨드리겠습니다. 그동안 저는 추가 컴퓨팅 성능을 모두 극도로 높은 마진의 시장 가격 3배, 어쩌면 4배의 임대 계약을 통해 수익화할 것입니다. 그리고 모든 계약에 이 90일 환수 조항을 포함시킬 것입니다." - Max Kan

프론티어 연구소의 데이터 예산은 올해 100억 달러를 넘어섰으며, 이는 작년의 약 10배입니다. Max Kan은 모델 성능을 실제로 결정하는 요소, 즉 병목 현상이 raw 컴퓨팅이 아닌 RL 환경에 있다고 설명합니다.

"강화 학습은 오늘날 모델 성능을 향상시키는 데 가장 중요한 스케일링 법칙일 것입니다. 많은 사람들은 모델이 컴퓨터에서 인간이 할 수 있는 모든 것을 할 수 없게 만드는 유일한 장애물이 충분한 RL 환경의 부족이라고 믿습니다." - Max Kan

스콧 우 · RAISE Summit

Fireside Alpha - inline image

전체 기사 (아래 링크): Cognition (스콧 우): 소프트웨어 엔지니어링의 황금 시대g

Scott Wu, Cognition의 CEO이자 Devin AI 소프트웨어 엔지니어 제작자가 RAISE Summit 무대에서 자신의 회사 내 생산성 향상이 엔지니어링 팀을 줄이는 것이 아니라 늘려야 하는 이유라고 주장하고 있습니다.

Cognition 코드의 90% 이상이 현재 Devin에 의해 커밋되고 있습니다. Wu는 내부 차트를 보여주며 에이전트가 성능 저하와 DataDog 오류를 감지해 사람의 개입 없이 자체적으로 세션을 시작하기 시작했다고 언급했습니다.

"Devin이 커밋하는 코드 비율이 90% 이상으로 올라가는 것을 볼 수 있습니다. 우리는 현재 거의 모든 작업에 Devin을 사용하고 있습니다. 더 놀라운 점은 Devin이 실제로 대부분의 Devin 시작 작업도 수행한다는 것입니다."

시청 · 5:31

Cognition은 엔지니어 약 40% 증가로 6개월 만에 10배 더 많은 소프트웨어를 출시했습니다. Wu는 11월부터 4월 말까지를 자신의 회사 실험 기간으로 삼아 팀을 약 45명에서 60명으로 늘렸으며, 그 성과를 인력 증가보다는 모델과 에이전트 덕분으로 돌렸습니다.

"6개월 동안 정확히 무엇이 바뀌었기에 우리가 10배 더 많이 출시하고 10배 더 많은 일을 할 수 있었을까요?"

시청 · 2:36

GPT-3.5는 30초의 비보조 작업을 실행할 수 있었지만, 최신 모델은 16시간 작업을 실행합니다. Wu는 AI가 인간에게 돌아와야 하기 전까지 완료할 수 있는 작업 시간을 측정하는 METR 연구를 언급했습니다.

"차트 중간에 있는 GPT-3.5를 보면, 30초의 작업입니다. 그런데 그건 나쁘지 않은 수준이었어요. 그리고 그게 ChatGPT의 순간이었죠."

시청 · 3:09

2025년 12월 기준, Devin은 천 명당 130명의 엔지니어에 해당하는 대역폭을 제공했습니다. Wu는 추가된 에이전트 역량을 기존 팀에 투입할 수 있는 인력으로 설명한 후, 이후 그 수치가 작업의 89~90%까지 상승했다고 언급했습니다.

"천 명의 소프트웨어 엔지니어로 구성된 팀을 상상해보세요. 그들에게 '130명의 소프트웨어 엔지니어에 해당하는 추가 대역폭을 받아서 무언가를 만들 수 있습니다'라고 말할 수 있다고 생각해보세요. 그걸로 많은 것을 할 수 있습니다."

시청 · 8:55

모든 엔지니어의 생산성은 10배 향상되었고, 구축해야 할 것도 10배 늘어났습니다. Wu의 해고 우려에 대한 답변은, 제대로 작동하는 DMV나 접근 가능한 의료 기록과 같은 의도적으로 평범한 미구축 소프트웨어 예시를 통해 뒷받침되었습니다.

"모든 인간 소프트웨어 엔지니어의 생산성은 10배 향상되었습니다. 하지만 그렇다면, 우리가 구축해야 할 것도 10배 더 많습니다."

시청 · 10:57

Wu는 강연을 하나의 질문으로 마무리했습니다: 무한한 소프트웨어 엔지니어 군단이 있다면 무엇을 하겠는가? 그의 고객사로는 Goldman Sachs, Mercedes-Benz, Lowe's가 있으며, 각 회사는 수만 명의 엔지니어를 투입해도 결코 해결되지 않는 백로그를 처리하고 있습니다.

"무한한 소프트웨어 엔지니어 군단이 있다면 무엇을 하시겠습니까? 여러분 모두 잠시 시간을 내어 그 점에 대해 생각해보시길 바랍니다."

시청 · 1:26

Mansour Karam · RAISE Summit

Fireside Alpha - inline image

RAISE Summit 무대에서 SemiAnalysis의 Dylan Patel과 함께한 Aria Networks의 창립자이자 CEO인 Mansour Karam이 "모든 것을 위한 하나의 범용 클러스터" 시대가 끝나는 이유와 네트워크가 추론 경제성을 결정하는 이유에 대해 설명하고 있습니다.

학습은 비용 센터이고, 서빙은 아파트 단지를 임대하는 것과 더 비슷합니다. Karam은 AI 클러스터를 하드웨어는 공유하지만 경제성은 거의 공유하지 않는 두 가지 비즈니스로 나눕니다.

"학습은 본질적으로 모델을 구축하는 것입니다. 그것은 제품을 만드는 것과 같습니다. 하지만 모델을 서빙할 때의 경제성은 재정 측면에서 아파트 단지를 임대할 때와 훨씬 더 비슷해 보입니다."

시청 · 0:01:34

하나의 워크로드에 클러스터를 특화하면 10배 또는 100배의 차이를 만들 수 있습니다. Karam은 단일 사용 사례를 중심으로 형성되어 각각 하나의 지표에 최적화된 새로운 회사들이 등장할 여지가 있다고 봅니다.

"저는 주어진 사용 사례에 최적화하기 위해 형성되는 새로운 회사들에서 많은 기회를 봅니다. 그리고 그 차이는 최적화하려는 지표에 따라 10배 또는 100배가 될 수 있습니다."

시청 · 0:02:17

백만 개의 토큰 비용은 $0.20에서 $20까지 가능하며, 이는 구축 방식에 따라 100배 차이가 납니다. Karam은 이러한 변동폭을 인프라가 저렴한 고처리량 추론을 위해 구축되었는지, 아니면 다른 목적으로 구축되었는지에 따라 결정된다고 설명합니다.

"백만 개의 토큰에 대해 20센트에서 20달러 사이 어디든 갈 수 있습니다. 이것은 100배 차이입니다. 정말로 고처리량 단순 추론에 최적화하고 싶다면 매우 저렴하게 서빙할 수 있지만, 그에 맞춰 인프라를 구축해야 합니다."

시청 · 0:03:38

Dylan Patel의 핵심: "속도가 해자(moat)입니다." Patel은 갑자기 자금이 빠른 코너로 몰리는 수요 측면의 이유를 제시합니다: 에이전트는 순차적인 시도-확인 루프로 작동하기 때문입니다.

"에이전트는 매우 순차적이고 작업 지향적입니다. 무언가를 시도하고, 확인하고, 맞는지 검사하고, 이 과정을 반복합니다. 결국 매우 느려집니다. 그리고 속도가 해자입니다. 더 빠르게 갈수록, 속도가 해자입니다." Dylan Patel, SemiAnalysis

시청 · 0:07:44

먼지 한 알이 들어간 트랜시버 하나가 클러스터의 모든 사용자를 지연시킵니다. 단일 추론 쿼리는 여러 네트워크를 순차적으로 통과하며, 가장 느린 링크가 모든 사람의 속도를 결정합니다.

"패킷 손실이 있거나, 먼지 한 알이 들어간 트랜시버가 하나라도 있다면... 다른 모든 사람들이 기다려야 하고, 모든 것이 순차적으로 진행됩니다."

시청 · 0:11:00

추론 클러스터 내에서의 1초는 "인간 기준으로는 한 세기와 같습니다." Karam이 Aria를 위해 제안하는 것은 표준적인 1초 단위 모니터링이 놓치는 지연을 포착하기 위한 마이크로초 단위의 텔레메트리입니다.

"추론을 실행하는 AI 클러스터의 맥락에서 1초는 인간 기준으로 한 세기와 같습니다. 1초 동안 많은 일이 일어납니다. 따라서 정말로 필요한 것은 마이크로초 해상도로 이 텔레메트리를 수집하여 지연을 유발할 수 있는 이벤트들을 포착하는 것입니다."

시청 · 0:14:52

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기