Михаил Базаров Разработка на 1С-Битрикс Михаил Базаров

Форк llama.cpp с MoE Hot-Cache и Qwen3.8-Flash-Next: большие MoE на маленькой видеокарте

Внимание! Все сообщения на форуме проходят модерацию. Ваше сообщение появится после проверки.
Форк llama.cpp с MoE Hot-Cache и Qwen3.8-Flash-Next: большие MoE на маленькой видеокарте

Выложил в открытый репозиторий свой форк llama.cpp, который умеет запускать большие MoE-модели - включая свежую Qwen3.8-Flash-Next на ~125B - на видеокарте в 16 ГБ. Всё за счёт горячего кэша экспертов и небольшой доработки движка. Расскажу, что это такое, зачем это нужно, в чём была проблема с существующим форком и как я её решил.
Форма ответов
 
Текст сообщения*
Перетащите файлы
Ничего не найдено
Загрузить файлы
 

Блог-note Заметки по 1С-Битрикс