В мире искусственного интеллекта долгое время доминировала установка «больше — значит лучше», но стартап PrismML, основанный выходцами из Калифорнийского технологического института, намерен доказать обратное. Компания делает ставку на то, что высокопроизводительные системы рассуждения не обязаны занимать серверные стойки. Как сообщает TechCrunch, разработчики представили технологию, позволяющую запускать продвинутые LLM непосредственно на персональных компьютерах и смартфонах без потери качества.
В минувший четверг компания выпустила модель Bonsai 2 27B. Это сжатая версия открытой модели Qwen3.8 27B от Alibaba, объем которой удалось уменьшить до 5,9 ГБ. По сути, это десятикратное сокращение требований к памяти по сравнению с оригиналом. Такое достижение делает реальностью запуск серьезного ИИ на флагманских мобильных устройствах, что подтверждается слухами о переговорах стартапа с Apple, хотя генеральный директор Бабак Хассиби предпочел оставить эти догадки без комментариев.
Математика сжатия: тернарные веса и сохранение интеллекта
Секрет PrismML кроется в работе с весами модели — параметрами, в которых хранится накопленный опыт нейросети. В стандартных условиях каждый вес требует 16 бит. Команда Хассиби внедрила метод «тернарных» весов, упрощая значения до трех вариантов: +1, -1 или 0. Это кардинально снижает объем хранимых данных, при этом Bonsai 2 сохраняет 98% производительности исходной модели по совокупным бенчмаркам.
История развития проекта демонстрирует уверенный прогресс:
- В марте была выпущена первая версия Bonsai, набравшая 95% от баллов оригинала;
- Первая модель получила более 11 миллионов загрузок;
- Текущая версия Bonsai 2 почти вплотную приблизилась к паритету с несжатым исходником;
- В планах компании на ближайшие месяцы — сжатие моделей с сотнями миллиардов параметров.
Интересно наблюдать за тем, как Хассиби оспаривает скепсис относительно потерь при компрессии. По его словам, чем крупнее модель изначально, тем легче сохранить её «интеллект» при сжатии, так как в огромных массивах данных больше пространства для оптимизации без ущерба для логики рассуждений.
Локальный запуск моделей на устройствах — это долгожданный уход от диктатуры облачных вычислений. Пользователь получает приватность, отсутствие задержек сети и экономию на подписках. Однако магия «тернарных весов» может столкнуться с суровой реальностью специфического «железа», которое не всегда эффективно обрабатывает нестандартную точность данных, что рискует превратить теоретическую компактность в медленную работу на практике. Отрасли пора перестать измерять успех только объемом памяти и начать смотреть на реальную скорость вывода в руках пользователя.
Будущее ИИ в кармане
Советник стартапа Ион Стойка, сооснователь Databricks, подчеркивает, что эта технология меняет саму парадигму использования ИИ. Когда вычисления переносятся с удаленных серверов в карман пользователя, интеллект становится по-настоящему персональным и бесплатным в эксплуатации, так как ресурс уже оплачен при покупке гаджета.
PrismML не единственные на этом поле — конкуренты вроде Multiverse Computing также активно работают над сжатием. Однако именно акцент на сохранении точности при экстремальном уменьшении веса выделяет проект калифорнийских ученых. Если их прогнозы сбудутся, следующая волна развития ИИ будет связана не с ростом дата-центров, а с эффективностью алгоритмов, способных работать автономно и приватно.
Оставить комментарий