torygreen

vip
Вік 3Рік
Піковий рівень 0
Контент поки що відсутній
Швидкість інференсу починає мати для агентів значно більше значення, ніж просто швидше робити відповіді.
Новий CS-4 від Cerebras заявляє до 30-кратного пришвидшення інференсу порівняно з GPU-системами — понад 4,400 токенів/с на GPT-OSS-120B.
Для агентів ця швидкість перетворюється на додатковий бюджет для міркувань.
За те саме 30-секундне вікно швидша система може дослідити більше шляхів, повторити невдалі спроби, виконати більше перевірок або використати більшу модель, не змушуючи користувача чекати довше.
Тож токенів/с поступово стає чимось більшим, ніж показник затримки.
Це може безпосередн
Переглянути оригінал
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Є момент, коли вертикальні AI-компанії перестають виглядати як клієнти API й починають виглядати як компанії, що створюють моделі.
Harvey перейшла приблизно від 1T -> 14.5T токенів/місяць за шість місяців. Тепер вона проводить посттренування власної юридичної моделі на базі Kimi K3, використовуючи доменно-специфічні завдання, відгуки експертів і власні дані робочих процесів.
Thomson Reuters рухається в тому ж напрямку зі своєю власною юридичною моделлю.
Це видається цілком природною еволюцією.
За низьких обсягів frontier API є очевидним вибором. За 10T+ токенів/місяць вибір моделі починає став
KIMI0,49%
Переглянути оригінал
post-image
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Кодування, можливо, було лише першим агентним ринком, а не найбільшим.
Від лютого кількість щотижневих активних користувачів Codex зросла :
> у 108 разів у юридичній сфері,
> у 41 раз у продажах,
> у 41 раз у рекрутингу
> у 26 разів у маркетингу.
У інженерії зростання склало лише 5 разів.
А до червня агентне використання вже становило 64% від сукупної кількості вихідних токенів Codex + ChatGPT серед корпоративних клієнтів.
Програмне забезпечення, ймовірно, було найпростішим місцем для початку, оскільки робота є структурованою, потребує активного використання інструментів і її відносно легк
Переглянути оригінал
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
LLM мали інтернет, який чекав на них. У втіленого ШІ його немає.
Роботам потрібні величезні обсяги даних про взаємодію з реальним світом, і ACE Robotics оцінює, що весь сектор сьогодні має лише близько 100K корисних годин.
Китай уже намагається створити такий набір даних: навчальні центри купують роботів, дистанційно керують ними під час виконання реальних завдань, збирають траєкторії, а потім передають ці дані виробникам роботів.
Тож деякі ранні розгортання гуманоїдних роботів роблять більше, ніж просто тестують апаратне забезпечення. Вони генерують навчальні дані, які знадобляться наступному
Переглянути оригінал
post-image
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Досить неймовірно, як швидко нарощуються можливості, тоді як бюджет на апаратне забезпечення майже не змінюється.
> Qwen3.5-27B набрала 35 балів на Artificial Analysis у лютому.
> Qwen3.6-27B підняла цей показник до 38 у квітні.
> Qwen3.8-27B тепер має 52 бали, залишаючись фактично в тому самому діапазоні у 27B параметрів.
А її агентні можливості тепер приблизно відповідають моделям, які є значно більшими й набагато дорожчими в обслуговуванні.
Для мене це здається важливішим, ніж чергова перестановка в таблиці лідерів.
Протягом багатьох років кращий ШІ здебільшого означав масштабування апаратн
Переглянути оригінал
post-image
post-image
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Мережеві технології для ШІ починають скидатися на окремий мініцикл капітальних витрат.
@Cisco завершила FY2026 із замовленнями на інфраструктуру ШІ від гіперскейлерів на $9.3B і прогнозує, що дохід від інфраструктури ШІ зросте з ~$4B до $7.5B наступного року. Arista щойно продемонструвала зростання на 37.7% у річному обчисленні — до $3.04B
Мені здається, цікава зміна полягає в тому, куди тепер починає спрямовуватися кожен додатковий долар, витрачений на ШІ.
На першому етапі розгортання головним було якнайшвидше підключити до роботи якомога більше прискорювачів. Коли кластери стають достатньо
CSCO1,32%
Переглянути оригінал
  • Нагородити
  • Прокоментувати
  • 1
  • Поділіться
Кілька років тому на гіпермасштабні компанії припадало близько 16% капітальних витрат S&P 500. Наступного року п’ять із них можуть витратити стільки ж, скільки решта 495 компаній разом.
Microsoft, Amazon, Alphabet, Meta, Oracle
Тепер BofA оцінює витрати п’ятьох у 2027 році приблизно в $1.07T проти близько $1.06T у всіх інших компаній індексу.
Така концентрація починає мати значення далеко за межами GPU.
Штучний інтелект став настільки масштабним, що попит на обчислювальні потужності починає тягнути за собою фізичну економіку. Goldman оцінює, що він уже становить близько 15% інвестицій США в о
MSFT0,00%
AMZN-0,09%
META0,98%
ORCL1,68%
Переглянути оригінал
post-image
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Агентний трафік у вебі зростає настільки швидко, що Cloudflare створила браузер спеціально для ШІ-агентів (Kitesurf).
Агенти фактично успадковують приблизно 30 років дизайнерських рішень у браузерах, створених для людей, які дивляться на екрани, і значна частина цього стає непотрібними накладними витратами, коли одночасно запускаються тисячі сесій.
Вебтрафік, керований ШІ, майже потроївся протягом 2025 року, тоді як трафік від ШІ-агентів і агентних браузерів зріс на 7,851% YoY.
за поточними оцінками, агенти сьогодні генерують приблизно 57% вебзапитів.
Чудово, що Kitesurf прибирає такі речі,
NET0,54%
Переглянути оригінал
post-image
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Дико, що зростаючий дефіцит пам’яті вже починає змінювати ландшафт GPU ще до їхнього постачання.
@nvidia тепер тестує варіанти HBM із меншою кількістю шарів для Rubin Ultra. Початковий дизайн 12-Hi HBM4e міг досягати 14–16 Gbps, тоді як новий оптимізований маршрут HBM4 може вийти на 11–12.
Привабливість полягає в обсягах. Менша кількість шарів DRAM на прискорювач дає змогу розподілити постачання тієї самої кількості пластин між більшою кількістю GPU.
Але модель не стає меншою лише через те, що стек пам’яті став меншим. Щойно їй доводиться розподіляти навантаження між більшою кількістю прискорю
NVDA2,16%
Переглянути оригінал
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Зобов’язання великих технологічних компаній щодо інфраструктури ШІ значно перевищують показники капітальних витрат (capex), які ми зазвичай бачимо. Вони взяли на себе зобов’язання щодо приблизно $1.09 трильйона майбутніх лізингових платежів, переважно за центри обробки даних для ШІ.
Наразі лише близько $285 мільярдів відображаються як лізингові зобов’язання, оскільки багато контрактів не визнаються доти, доки об’єкти не почнуть працювати.
Справжній ризик полягає в невідповідності строків. Деякі договори оренди укладаються на 15–30 років, тоді як чипи, моделі та попит з боку клієнтів можуть змі
Переглянути оригінал
post-image
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Попит дата-центрів на енергію зростає так швидко, що електромережі не встигають, і компанії тепер доставляють газові турбіни вантажівками, щоб обійти цю проблему.
APR Energy щойно розгорнула вісім мобільних установок загальною потужністю 1.1GW, націлених безпосередньо на попит дата-центрів.
Подумайте, що це означає. турбіна на причепі гірша за підключення до електромережі в усіх аспектах, крім одного: її можна запустити за місяці, а не за роки. платити таку надбавку має сенс лише тоді, коли саме очікування вас убиває, а зараз у багатьох штатах США очікування становить 5+ років.
Тож розго
APR7,57%
Переглянути оригінал
post-image
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Запуск DeepSeek V4 Flash 0731 на власному залізі вже реальний, але те, у скільки це обходиться і чи варте воно того, дуже залежить від того, хто ви.
машини, які реально його запускають:
> 256GB M3 Ultra Mac Studio (~$7-9k): тримає збірку в 4-бітному форматі з запасом, чистий один пристрій.
> 512GB M3 Ultra (~$10k+, якщо вдасться знайти): комфортно запускає версію з майже без втрат.
> 2x H200 або 4x A100 сервер: повний чекпойнт на 1M контекст, але тепер ви злегка в грошах рівня datacenter.
технічно він теж працює на 128GB, але лише на важкому 3-бітному стисненні, яке погіршує якість.
отже ~$7-1
DEEPSEEK-4,37%
Переглянути оригінал
post-image
  • Нагородити
  • 1
  • Репост
  • Поділіться
GateUser-3e640a4c:
Це той самий DeepSeek від внутрішніх виробників?
Постачальник чипів. Кредитор інфраструктури. Частковий інвестор у власних клієнтів. Nvidia нині є всіма трьома ролями одразу, і цього місяця рахунок за те, щоб носити всі три капелюхи, сягнув $750B
> $250B для підстрахування оренди OpenAI в Огайо.
> $500B переплетена з SK Group у сфері пам’яті.
> $5B у SSI — компанію без продукту.
> $1B у Naver. Частка в Nebius. Чипи, що надходять на потужності в Техасі, які вона орендує назад собі.
Цикл, який Nvidia фактично створила, полягає в тому, щоб фінансувати клієнта -> клієнт купує чипи Nvidia -> Nvidia обліковує виручку -> Nvidia фінансує наступн
Переглянути оригінал
post-image
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Отже, ми вже перетнули ~$1T у глобальних витратах на capex у центрах обробки даних, прямуючи до $1.7T до 2030 року. Зростання з $455B у 2024 році.
Це майже 4x за шість років. Чотири американські гіперскейлери приблизно подвоюються за цей відрізок. Усе інше — неоклауди, AI-лабораторії, суверенні проєкти — це те, що насправді викривляє криву, зростаючи в середньому приблизно на 39% на рік. До 2030 року Amazon, Google, Meta і Microsoft становлять лише приблизно половину цього.
Два роки тому розгортання було по суті чотирма компаніями. Тепер це ціле поле таких компаній, і нові гроші рухаються до
AMZN-0,09%
META0,98%
MSFT0,00%
Переглянути оригінал
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
2026 рік — не той, на який планували закриті лабораторії, і простір, де закрита фронтирна модель може брати гроші, тепер приблизно на три пункти завширшки після K3 від @Kimi_Moonshot
K3 щойно чисто приземлилась вище Opus 4.8 за можливостями, удвічі менша ціна за задачу, а ваги стануть публічними через кілька днів. Лише Fable 5 та GPT-5.6 Sol досі залишаються над нею. Усе нижче цієї лінії тепер відкрита територія — моделі, які може обслуговувати будь-хто за собівартістю обладнання, без R&D-маржі, щоб її відбити.
Це нова математика для кожного закритого релізу. Зайди вище відкритого фронтиру —
Переглянути оригінал
post-image
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
  • Закріплено