Рекордная производительность: 17 000 токенов в секунду у нового решения от стартапа Taalas
15:09, 20.02.2026
Недавно стартап из Канады Taalas сообщил о своем первом продукте – чип HC1 c Llama 3.1 8B. Особенность подхода компании состоит в том, что модель не загружается в память, а непосредственно впаивается в кремний на этапе производства. Вследствие чего можно достичь рекордного результата в 17 000 токенов в секунду на одного юзера. Такой результат почти в 10 раз быстрее решений на GPU, а также достигается значительная экономия энергии и минимизируется стоимость производства.
Компания Taalas
Стартап основали Любиша Байич бывший директор проектирования интегральных схем в AMD, его жена Лейла Байич (бывший технологический менеджер и инженер в AMD, ATI, Altera), и Драго Игнятович (бывший директор по ASIC-дизайну в AMD).
Основной подход компании можно назвать – тотальной спецификацией. Для каждой модели, компания планирует производить отдельный чип. Микросхема будет состоять приблизительно со 100 слоев и лишь 2 верхние будут кастомизированны нужным образом в них встраивается mask ROM recall fabric. Таким образом можно будет выпускать чип за 2 месяца вместо 6. Также вычисления и память будут объединены на одном кристалле.
На данном этапе такая агрессивная квантизация снижает качество если сравнивать с GPU-бенчмарками. Стартап признает этот факт, потому и позиционирует продукт как бета-сервис. Минимальная гибкость чипа сохраняется из-за возможности дообучения через LaRA-адаптеры и наличие контекстного окна.
Компания привлекла инвестиций на суму $200 млн и планирует вскоре выпустить новый чип среднего размера, а ближе к концу года возможен запуск на платформе HC2 передовой LLM.
Надеемся, статья оказалась полезной - а как вы считаете? Поставьте лайк и подпишитесь на наш блог, чтобы получать больше практических советов и последних новостей о технологиях от HostZealot.