През пролетта на 2026 г. AI индустрията беше разтърсена от големи новини: според Reuters Anthropic проучва възможността за проектиране на свои собствени чипове.Тази лаборатория за изкуствен интелект, с годишни приходи над 30 милиарда долара и нарастваща потребителска база за своя модел Claude, сериозно обмисля да се превърне от потребител на изчислителна мощност в дефинираща я.
Източници признават, че плановете все още са в начален етап;компанията все още не е финализирала конкретни планове или е сформирала специален екип.Anthropic може в крайна сметка да избере да закупува само чипове, вместо да ги проектира вътрешно.Но дори възможността говори много.
В момента Anthropic използва както TPU (Tensor Processing Units), проектирани от компанията-майка на Google Alphabet, така и чипове Trainium на Amazon, за да разработи и управлява Claude.Само тази седмица компанията подписа и дългосрочно споразумение с Google и Broadcom – последният е основният поддръжник на дизайна на TPU на Google.Подписването на многомилиардно споразумение за външна поръчка, докато тихо проучва вътрешното развитие, този двустранен подход е зловещо подобен на Meta и Microsoft преди няколко години, като и двете вече имат свои собствени персонализирани чипове.
Оценките на индустрията показват, че проектирането на първокласен AI чип струва приблизително 500 милиона долара, но освен цената, това, което е по-забележително, е сигналът на индустрията зад хода на Anthropic.Когато една чисто моделна компания започне сериозно да обмисля разработването на свой собствен силиций, хардуерната битка за изводи за AI всъщност е навлязла на ново ниво на интензивност.
През последните две години AI индустрията претърпя драматична промяна, като голямо количество търсене на изчислителна мощност бързо се премести от страната на обучението към страната на изводите.
Фазата на обучение, която може да отнеме седмици или дори месеци, изисква мащабни GPU клъстери за паралелни изчисления и доминацията на Nvidia от тази страна е почти непоклатима.Но изводите са различни.Изводът е изчислението в реално време, което се случва всеки път, когато моделът отговори на потребителска заявка;той преследва ниска латентност, висока пропускателна способност и ниска консумация на енергия - цели, които не съответстват напълно на това, в което GPU превъзхождат.
Според прогнозата на Barclays до 2026 г. търсенето на изчислителни изчисления ще представлява повече от 70% от общото търсене на AI изчислителна мощност, 4,5 пъти повече от търсенето на обучение.Може да се каже, че истинската решаваща битка в бъдещия пазар на AI чипове ще бъде в изводите.
Nvidia е изградила десетгодишен ров в края на обучението, но ако този ров не може да продължи до края на извода, цялата структура на индустрията ще бъде изправена пред пренаписване.Поради тази причина Nvidia направи официален ход в края на миналата година, обявявайки неизключително лицензионно споразумение със стартиращата компания за чипове за изкуствен интелект Groq.Джонатан Рос, основател и главен изпълнителен директор на Groq, президентът Сони Мадра и няколко основни инженери впоследствие се присъединиха към Nvidia.Чуждестранните медии цитират вътрешни лица, според които възнаграждението за тази транзакция е приблизително 20 милиарда долара.
Официалната формулировка на Nvidia е предпазлива, като подчертава, че това е само технологичен лиценз плюс придобиване на таланти, а не традиционно придобиване.Но този нетипичен метод за придобиване е доста често срещан в Силициевата долина – той може да избегне тромавите антитръстови прегледи, като същевременно значително въведе целевата технология и основния екип в кошарата.
Историята на Groq първоначално беше доста забележителна.Основателят Рос беше основен член на проекта TPU на Google и беше добре запознат с присъщите ограничения на GPU архитектурата в сценариите за извод: хиляди паралелни изчислителни единици и изключително сложна логика за планиране на паметта.Тези функции са предимства при обучението, но причиняват непредсказуемо трептене на латентността при извода.
Поради тази причина Groq избра напълно различен път: напълно елиминира планировчика на хардуерно ниво и вместо това компилаторът определя пътя на потока на всеки бит данни на етапа на кода, което позволява на чипа да работи като автоматизирана поточна линия с точност до наносекунда.Тази архитектура се нарича LPU или езикова единица за обработка.При тестове за изводи на масови големи модели, неговата скорост на генериране на думи може да бъде повече от десет пъти по-висока от тази на Nvidia GPU, докато консумацията на енергия на токен е само една десета от последната.
С тази изключителна производителност Groq привлече повече от 1,5 милиона потребители разработчици и получи множество кръгове инвестиции от водещи институции като Cisco, Samsung и BlackRock, като оценката веднъж достигна 6,9 милиарда долара.Но това, което го направи успешен, доведе и до неговия крах.Прекалено ослепителното представяне на Groq в изводите го направи най-важната цел, която трябваше да бъде заключена в очите на Jensen Huang.
На пръв поглед придобиването на Groq от Nvidia трябва да допълни техническото му оформление от страна на изводите, но по-дълбоко, това е защитна интеграция.Чрез включването на един от най-силните външни конкуренти в своята екосистема, Nvidia отнема преговорите на второстепенните облачни доставчици и софтуерните компании за изкуствен интелект, които нямат способността да разработват свои собствени чипове.Без Groq като алтернатива, възможностите за тези, които не желаят да бъдат "обложени с данък" от Nvidia, внезапно се стесняват.
Тази отчайваща ситуация обаче може да не продължи дълго.
Всъщност, много преди възхода на Groq, големите облачни гиганти вече са планирали самостоятелно своите собствени пътища за изчислителна мощност.Google има TPU, Amazon има Trainium, а Microsoft има Maia – и трите вътрешни маршрута вече са достигнали зрял етап, когато могат да се продават външно.
TPU от седмо поколение на Google, с кодово име Ironwood, беше официално пуснат и стартиран в края на 2025 г. В сравнение с предишното поколение, неговата производителност с един чип се е увеличила с повече от 4 пъти, а един клъстер може да свърже до 9216 чипа.Google не крие позиционирането си за това поколение продукти: най-рентабилната търговска машина в ерата на изводите.От това, че бяха принудени да се развиват вътрешно поради проблеми с вътрешните изчислителни мощности през 2015 г., до отварянето на внедряването на TPU в собствените центрове за данни на клиентите през 2025 г., Google прекара десет години в шлифоване на спешен проект в стратегическо оръжие.Съобщението на Anthropic, че бъдещото обучение и внедряване на серията Claude ще използва до един милион TPU, допълнително даде авторитетно пазарно одобрение на търговската стойност на Ironwood.
Amazon поема по различен път.AWS отдавна е силно зависим от чипове, разработени вътрешно от нейното дъщерно дружество Annapurna Labs.Серията Trainium е приблизително сравнима с графичните процесори на Nvidia, но се фокусира върху намаляване на разходите за облачна инфраструктура и намаляване на зависимостта от външни доставчици.Неотдавнашното подписване от страна на AWS на многогодишно споразумение за сътрудничество с Cerebras за въвеждане на чипове Wafer-Scale Engine (WSE) на Cerebras в центрове за данни за паралелно внедряване със собствено разработени чипове Trainium е конкретно проявление на тази логика на приоритизиране на вътрешното развитие и допълване с външни доставки.
Целта на AWS е много ясна: използвайте Trainium, за да предприемете нискоскоростни и евтини изводи и използвайте чипове Cerebras, за да заключите клиенти от висок клас, които са изключително чувствителни към латентност и готови да платят премия за скоростта.
За чиповете за изводи, за разлика от чиповете за обучение, които преследват краткосрочна скорост, те обръщат повече внимание на дългосрочната енергийна ефективност.GPU на Nvidia консумира около 700 вата, докато специален чип за изводи с еквивалентна изчислителна мощност може да контролира консумацията на енергия в рамките на 200 вата.За свръхмащабни приложения, които изискват стотици хиляди чипове за изводи, тази празнина може да донесе стотици милиони долари икономии на разходи всяка година.Това е една от основните причини, поради които гиганти в облака като Google, Amazon и Meta се състезават да залагат на специализирани ASIC чипове.
Според последните новини, Meta е постигнала споразумение за сътрудничество с Broadcom за обучение и чипове за изводи от 1Gw, което трябва да донесе нови катализатори на вече „хаотичния“ пазар на чипове за изводи.
Ако вътрешните R&D маршрути на облачните гиганти са дългосрочни залози с достатъчно гаранции за ресурси, тогава съюзът между Intel и SambaNova представлява друг по-реалистичен път за пробив.
През 2026 г. SambaNova обяви пускането на хетерогенно решение за хардуерно извеждане с Intel, възприемайки тристепенна архитектура: GPU за предварително запълване, процесор Intel Xeon 6 като основен CPU за управление и изпълнение и SambaNova RDU за декодиране, специално проектирано за натоварвания на AI на агента.Това решение ще бъде отворено за предприятия, доставчици на облачни услуги и суверенни AI проекти през втората половина на 2026 г.
SambaNova посочи, че чистите GPU системи са добри при паралелизираната връзка за предварително попълване, но в задачите за извод в производствени среди, планирането на инструментите на процесорите и ефективността на декодиране на специалните ускорители за изводи са ключовите променливи, които определят общата скорост и цена.
Неговите тестови данни показват, че скоростта на компилиране на LLVM на процесорите Intel Xeon 6 е повече от 50% по-бърза от тази на сървърните процесори, базирани на архитектура Arm, а производителността на векторната база данни е до 70% по-бърза.Тези два индикатора точно засягат основните пречки в производителността на работния поток на кодовия агент.
Ролята на Intel в това сътрудничество е интригуваща.Веднъж PC хегемон, той беше почти маргинализиран от основното бойно поле на AI чипове в ерата на GPU.Сега, с предимствата на контрола на процесора и планирането на Xeon 6, той си възвръща позициите в решенията за хетерогенни изводи.Софтуерната екосистема на центъра за данни се основава на архитектурата x86, която също така върна Intel в центъра на етапа на ИИ.
Cerebras е друго име, за което си струва да се пише отделно.
Този стартъп, който се фокусира върху чипове с изкуствен интелект в размер на вафли, подаде заявление за IPO през 2024 г. и след това го оттегли, което доведе до широко разпространени съмнения относно перспективите му на капиталовия пазар.Но по-късно OpenAI подписа споразумение за сътрудничество с Cerebras на стойност над $10 милиарда за осигуряване на изчислителна мощност за ChatGPT.Тази новина върна Cerebras обратно в общественото внимание и накара онези институции, които чакаха и видяха, да преразгледат техническата му стойност.През февруари 2026 г. Cerebras завърши нов кръг от финансиране от 1 милиард долара, с общо финансиране от 2,6 милиарда долара и оценка след инвестиция от около 23 милиарда долара.
Основната технология на Cerebras е Wafer-Scale Engine (WSE), която използва цяла пластина като единичен чип, нарушавайки ограниченията на физическото рязане на традиционните чипове и предоставяйки изключително изключителна производителност на латентност при специфични задачи за извод.Според Cerebras скоростта на неговите чипове във връзката за декодиране на извод може да бъде до 25 пъти по-висока от тази на графичните процесори на Nvidia.
Неотдавнашното съобщение на AWS за многогодишно споразумение за сътрудничество с Cerebras за въвеждане на WSE чипове в центрове за данни за изводи за AI бележи ключов преход на идентичността за този стартъп – от финансова история до доставчик на най-голямата облачна платформа в света.
Изборът на Cerebras от AWS се основава на същата логика като тази на OpenAI: за сценарии, изключително чувствителни към скоростта на реакция, като помощ при програмиране и задачи на агенти, всяка милисекунда намаляване на латентността директно съответства на потребителското изживяване и търговската стойност – и това е точно слабостта на GPU.
За Cerebras, тъй като все повече хора използват AI за решаване на все по-трудни проблеми, търсенето на скорост само ще се увеличи.Ако скоростта сама по себе си е стойността на продукта, тогава плащането на премия за скорост е естествено търговско поведение.Тази логика се приема от все повече предприятия.
Зад битката за изчислителната мощност стои преструктурирането на страната на предлагането на инфраструктура.В този смисъл ролята на CoreWeave става все по-незаменима.
През 2025 г. Meta пое инициативата при подписването на споразумение за доставка с CoreWeave, като се съгласи да закупи 14,2 милиарда долара изчислителна мощност с изкуствен интелект до 2031 г.;документи, наскоро подадени в SEC, показват, че Meta е добавила към споразумението, като се е съгласила да закупи допълнителни $21 милиарда изчислителна мощност с изкуствен интелект до 2032 г. Добавянето на това ново споразумение е увеличило неизпълнените поръчки на CoreWeave до $87,8 милиарда, от които само Meta представлява около 40%.
Възходът на CoreWeave е микрокосмос на еволюцията на GPU изчислителната мощност от оскъдна стока към инфраструктура.Като наемател на чиста изчислителна мощност, той не предоставя възможности на модела, а основната поддръжка, която позволява на моделите да работят.Освен трите основни облачни гиганта, предприятията с изкуствен интелект се нуждаят от опция за изчислителна мощност, която не е обвързана с екосистема на платформа – и CoreWeave просто запълва тази празнина.
През 2025 г. CoreWeave постигна продажби от 5,13 милиарда долара, което е увеличение от около 170% спрямо предходната година.Мащабът на неговите центрове за данни се разшири до 43, с използван мощностен капацитет от 850 мегавата.Компанията е оборудвана с приблизително 600 000 графични процесора, главно Nvidia H100 и H200, като делът на серията Blackwell непрекъснато нараства.Договореният общ мощностен капацитет достигна 3500 мегавата, което е повече от четири пъти сегашния използван капацитет.
Логиката на разширяване на CoreWeave обаче е и най-големият структурен натиск.За да покрие разходите за разширяване на центъра за данни, компанията наскоро обяви частно пласиране на облигации на стойност 4,75 милиарда долара.С по-малко от 4 милиарда долара в брой, завършването на капиталови разходи от 30 до 35 милиарда долара през 2026 г. означава, че трябва да разчита на външно финансиране, за да поддържа високоскоростно разширяване.Инвеститорите на CoreWeave очевидно залагат на основната преценка, че търсенето на изчислителна мощност ще продължи да расте с висок темп в дългосрочен план.
Проучването на Anthropic върху вътрешния дизайн на чипове, придобиването на Groq от Nvidia за 20 милиарда долара, десетгодишните усилия на Google да превърне TPU в еталонен продукт, въвеждането на Amazon на Cerebras в собствения си център за данни, за да изгради диференцирано портфолио за изводи, и съюзът на Intel със SambaNova, за да се конкурират за дял в хетерогенния пазар на изводи – тези привидно разпръснати събитиявсички сочат извода като ново бойно поле.
Все повече и повече хора осъзнават, че фокусът на AI се измества от това как да се обучават по-добри модели към това как да се правят изводи за повече заявки на по-ниска цена и по-висока скорост.Тази промяна предизвика масивна трансформация в предишната система за изчислителна мощност, ориентирана към GPU.
Този кръг на състезанието е различен от ранната замяна на процесорите с графични процесори.Това беше еднопосочно смазване на нови продукти над стари.Днешната битка за чипове за изводи е по-скоро като преструктуриране на разделението на труда в рамките на сложна екосистема.Нито една архитектура не може да доминира във всички сценарии и хетерогенните комбинации стават мейнстрийм.Графичните процесори обработват много паралелно предварително попълване, специални чипове за изводи поемат декодирането, процесорите са отговорни за планирането и координацията, с различни фокуси върху облака и краищата и множество играчи, които се състезават във всяка връзка.
Това означава, че изходът далеч не е решен.
За Anthropic проучването на вътрешния дизайн на чипове е активно преследване на автономност на изчислителната мощност и застрахователна полица, за да се предотврати задържането на заложници от доставчици нагоре по веригата.Но дългият цикъл и големите инвестиции в научноизследователска и развойна дейност на чипове означават, че този път няма да е лесен.За Nvidia ровът на CUDA екосистемата все още е дълбок, но все по-очевидната разлика между производителност и цена в края на изводите се превръща в обща цел за пробив за всички потенциални конкуренти.За други технически конкуренти като Groq технологичното лидерство не се превръща непременно в търговски успех и възможността за придобиване непрекъснато нараства.
Бойните линии са начертани, а списъкът на участниците продължава да расте.Това меле с изчислителна мощност на изкуствен интелект току-що навлезе в най-интензивната си глава.