Normal view

Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf

С приходом нейросетей теперь можно решать задачи гораздо проще, правда и задачи бы такой не стояло не будь нейросетей и llama.cpp, и huggingface. В общем смысл статьи в том чтобы попытаться математически вычислить теоретическую скорость генерации токенов в программе llama.cpp для моделей на hugginface, просто открыв карточку модели и нажав на закладку (букмарклет).

В интеренете таких калькуляторв довольно много, и в этом калькуляторе нет никаких новых идей, он работает как и все остальные - вычисляет скорость исходя из пропускной способности видеопамяти пользователя. Но как выяснилось просто поделить одно число на другое (вес модели на пропускную способность видеокарты) не совсем правильно, когда я сказал что в реале у меня другая скорость, нейронки стали вводить поправочные коэффициент в виде эффективности видеокарты (60-80%).

Читать далее

Как я увеличил производительность своего сервера для LLM-вычислений почти в два раза и причем здесь six-seven

Мы разобрались, какие типы вычислений реально важны для LLM, почему мой вычислительный кластер на CMP90HX работал хуже чем ожидалось - узнали что вычислительная мощность искусственно ограничена именно на них, и как работает китайская модификация, снимающая это ограничение. Затем проверили всё на практике и получили реальные цифры прироста.

Читать далее
❌