Компания Cerebras представила свой новый ускоритель вычислений для искусственного интеллекта CS-4, который, по словам генерального директора Эндрю Фельдмана, является самой быстрой системой в индустрии. Как сообщает The Decoder, новинка представляет собой полноразмерную серверную стойку, объединяющую в единый узел вычислительные модули, системы питания и охлаждения.
В основе системы по-прежнему лежит 5-нанометровый чип WSE-3 (Wafer Scale Engine), однако инженерам удалось удвоить производительность по сравнению с предыдущей моделью CS-3. Достигнуто это не за счет смены техпроцесса, а путем агрессивного наращивания тактовой частоты, что потребовало пересмотра всей архитектуры питания и теплоотвода внутри стойки.
Технические характеристики впечатляют: теперь в одну стойку помещается три кремниевых пластины вместо двух, что позволяет выдавать до 4 400 токенов в секунду на одного пользователя. По заявлениям разработчиков, это делает систему до 30 раз быстрее традиционных кластеров на базе графических процессоров Nvidia. При этом объем памяти остался прежним — 44 ГБ на каждую пластину.
Архитектурные маневры и модульный подход
В CS-4 дебютировала модульная конструкция под названием Backpack, призванная ускорить сборку и обслуживание этих гигантов. Cerebras также развивает концепцию дезагрегированного инференса (вывода моделей), привлекая в качестве партнеров таких игроков, как AMD и AWS Trainium, что выглядит как попытка создать альтернативную экосистему вокруг своего уникального железа.
Интересно, что аналитики из SemiAnalysis сдержанно оценивают прирост производительности сетевого взаимодействия, считая его незначительным. Тем не менее, оборудование Cerebras уже нашло применение в серьезных проектах: например, OpenAI использует его для работы модели Codex Spark. Более детальные технические подробности ожидаются на предстоящей конференции Hot Chips.
«Удвоение производительности за счет оптимизации обвязки и охлаждения при сохранении старого чипа — это классический инженерный оверклокинг, возведенный в абсолют. Однако фиксация объема памяти на уровне 44 ГБ при резком росте вычислительной мощности создает риск дисбаланса, где сырая скорость будет упираться в узкое горлышко емкости данных. Cerebras строит великолепные гоночные болиды, которым критически не хватает объема бензобака для заездов на сверхдлинные дистанции.»
Глядя на эволюцию систем Cerebras, нельзя не заметить иронию: пока весь мир пытается упаковать больше транзисторов в меньшую площадь, Фельдман и его команда продолжают масштабировать саму площадь, превращая целые кремниевые пластины в единые вычислительные единицы. Это напоминает попытку построить самый быстрый самолет, просто увеличивая количество двигателей на существующем фюзеляже.
Для конечного пользователя и разработчика это означает, что борьба за миллисекунды при генерации текста переходит в плоскость инфраструктурных гигантов. Вопрос лишь в том, насколько эффективно программные стеки смогут утилизировать эту мощь, ведь даже самый быстрый процессор бесполезен, если алгоритм не умеет параллелить задачи с нужной эффективностью.
Оставить комментарий