Кстати, узнали тут в кулуарах ICLR, что NVIDIA готовит полностью диффузионную LLM на примерно 100B параметров в линейке Nemotron. Представители компании говорят, что качество сопоставимо с авторегрессионными моделями, а за один форвард-пасс демаскирует довольно большие чанки токенов.
В теории это значит, что стоимость инференса для decode-heavy-сценариев — например, кодогенерации или ризонинга — может кратно подешеветь. Но только в том случае, если NVIDIA действительно смогла получить хорошее качество и декодировать хотя бы 6-10 токенов за итерацию. Поживём — увидим, новая модель должна выйти уже вот-вот.
2026-05-06 12:01 UTC
3 405 просмотров · 46 реакций
Открыть в Telegram · К списку постов · Ссылка на этот пост