В официальном техническом отчете исследователи продемонстрировали новый подход к распределению вычислительных графов между несколькими узлами акселераторов.
По результатам серии независимых бенчмарков, задержка генерации первого токена сократилась на 40%, а совокупное потребление электроэнергии в пиковых нагрузках упало на четверть.
Архитектура использует гибридный пайплайнинг с динамическим квантованием промежуточных тензоров внимания. Это исключает классические простои GPU при обмене данными через NVLink и InfiniBand.
Решение уже доступно для открытого тестирования и интегрируется со стандартными библиотеками vLLM и TensorRT-LLM.
