GPU

Новости

Mesh LLM

Проект Mesh LLM позволяет интегрировать локальные GPU в единую вычислительную сеть

Проект Mesh LLM позволяет объединять мощности локальных видеокарт в распределенную сеть для запуска ИИ-моделей, предлагая альтернативу централизованным облачным сервисам.

Nonuniform Tensor Parallelism

NVIDIA может обучать LLM без пауз при помощи NTP — неравномерного тензорного параллелизма

NVIDIA представила технологию NTP, позволяющую динамически менять степень тензорного параллелизма для предотвращения простоев при обучении больших языковых моделей.

NVIDIA Tesla V100 запускает LLM

Старый серверный чип NVIDIA Tesla V100 удивляет в тестах на инференсе LLM

Энтузиасты адаптировали серверную NVIDIA Tesla V100 для домашнего ПК, достигнув скорости в 130 токенов в секунду, что выше показателей современных RTX 3060.

Unsloth дообучает LLM

Unsloth представил библиотеку, позволяющую дообучать LLM даже на домашнем компьютере

Стартап Unsloth представил кастомные ядра CUDA, которые позволяют дообучать крупные языковые модели вроде Qwen3.6-27B на обычных игровых видеокартах с 24 ГБ памяти.

Kubernetes prefill и decode

Разделение инференса LLM: как Kubernetes адаптируют под специфику стадий prefill и decode

Переход от монолитного инференса к разделению стадий prefill и decode позволяет оптимизировать использование GPU, но требует сложной оркестрации в Kubernetes.

Доминирование Nvidia заканчивается

Доминирование Nvidia на рынке обучения ИИ не гарантирует успех в эру инференса

Индустрия ИИ переходит от обучения моделей к инференсу, что ставит под угрозу монополию Nvidia и требует новых архитектурных решений.