На недавней конференции Hot Chips компания OpenAI представила результаты тестирования своего первого специализированного чипа для инференса под кодовым названием Jalapeño. Как сообщает The Decoder, новинка демонстрирует впечатляющее превосходство над флагманскими решениями Nvidia серий Blackwell и Rubin по показателям пропускной способности на ватт и задержки генерации токенов.
Разработка OpenAI сосредоточена исключительно на инференсе — процессе исполнения уже обученных моделей, а не их тренировке. Примечательно, что Jalapeño не является узкоспециализированным решением под конкретные алгоритмы компании, а позиционируется как универсальный ускоритель для работы с большими языковыми моделями (LLM), что делает его потенциально опасным конкурентом для коммерческих видеокарт.
Согласно внутренним данным, Jalapeño выполняет в 1,5-1,9 раза больше работы на ватт при пиковых нагрузках и обеспечивает снижение сквозной задержки в 1,7-3,6 раза по сравнению с лучшими системами, доступными на рынке. В сценариях интерактивного взаимодействия, где критична скорость ответа пользователю, производительность чипа оказывается выше в 2,1–4,1 раза, что выглядит как серьезная заявка на передел рынка серверного оборудования.
Технические детали и архитектурные особенности
Для подтверждения амбиций использовался открытый бенчмарк InferenceX от аналитического агентства SemiAnalysis. Испытания проводились на моделях GPT-OSS 120B, Deepseek R1 670B и Kimi K2.5 1T. На модели GPT-OSS чип выдавал около 1400 токенов в секунду на пользователя, а в работе с Deepseek R1 скорость превышала 700 токенов в секунду при одиночном запросе.
Интересно, что таких высот Jalapeño достигает без использования популярных методов оптимизации, таких как спекулятивное декодирование или предсказание нескольких токенов одновременно. Поскольку конкуренты от Nvidia используют эти «костыли» для улучшения цифр в отчетах, у архитектуры OpenAI остается значительный запас для программного ускорения в будущем.
Сравнение с платформой Vera Rubin от Nvidia кажется наиболее корректным, так как оба решения используют память стандарта HBM4. Даже в этом случае Jalapeño генерирует больше токенов на мегаватт энергии. Впрочем, при расчете совокупной стоимости владения (TCO) в пересчете на один токен, обе системы пока демонстрируют примерно равные экономические показатели.
Успех Jalapeño ставит под сомнение незыблемость экосистемы CUDA, доказывая, что вертикальная интеграция софта и железа важнее универсальных библиотек. Однако инженерные образцы — это не серийное производство, и пока OpenAI не решит вопрос с масштабированием выпуска на мощностях Broadcom, Nvidia может спать спокойно, прикрываясь огромным парком уже внедренных систем. Этот чип — отличный демонстратор силы, но рынок захватывают не бенчмарками, а поставками.
Хронология разработки и стратегия OpenAI
Путь от идеи до кремния занял у команды на удивление мало времени. Хронология проекта выглядит следующим образом:
- Середина 2024 года: старт проектирования совместно с инженерами Broadcom.
- Ноябрь 2025 года: передача финальных чертежей на фабрику для производства (tape-out).
- Август 2026 года: публичная демонстрация первых результатов работы инженерных образцов.
Весь цикл занял 16 месяцев, но активная фаза проектирования уложилась в 9 месяцев. Ускорить процесс помогло использование собственных ИИ-моделей: старые поколения помогали в дизайне архитектуры чипа, а новые — в написании кода и оптимизации прошивок. Это создает любопытный замкнутый цикл, где интеллект буквально воспроизводит свое материальное воплощение.
Финансовый директор OpenAI Сара Фриар подчеркивает, что Jalapeño — это лишь часть стратегии по созданию «полного стека» технологий, включающего дата-центры, модели и устройства. Несмотря на внутреннюю разработку, компания не планирует разрывать отношения с Nvidia, AMD или AWS, сохраняя баланс между сотрудничеством и конкуренцией в мире, где вычислительных мощностей всегда не хватает.
Оставить комментарий