Normal view

Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить.

Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run, три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.

Читать далее

8 open-source AI-проектов, которые могут заменить часть платного софта

Локальный аналог NotebookLM, фильтр от AI-slop, маршрутизатор для сотен LLM-провайдеров, агент для поиска работы, автоматический пентестер и ComfyUI. Посмотрел, что из этого действительно можно использовать, а где «бесплатно» заканчивается после git clone.

Open source не значит бесплатно.

У проекта может не быть подписки, но останутся расходы на API, Claude Code, GPU, сервер, электричество и несколько часов на настройку. Поэтому ниже не будет обещаний «восемь сервисов, за которые больше никогда не придётся платить».

Зато есть восемь любопытных проектов, которые позволяют забрать себе часть привычного AI-стека, изменить его под свои задачи и в некоторых случаях вообще убрать SaaS из цепочки.

Смотреть подборку

ИИ в 1С, инфраструктура и цифровизация: что будет на Петербургском цифровом хабе

3 сентября в Санкт-Петербурге пройдет Петербургский цифровой хаб 2026. Программу уже утвердили: за один день на площадке соберут несколько ИТ-треков, прямые встречи заказчиков и поставщиков решений, а также сессию Инфостарта об искусственном интеллекте в 1С.

Форум в первую очередь рассчитан на ЛПР, ИТ-директоров, руководителей цифровых подразделений и представителей компаний, которые выбирают решения для автоматизации и развития ИТ-инфраструктуры. Но отдельные сессии будут полезны и практикам: разработчикам, архитекторам, администраторам, аналитикам и руководителям команд.

Читать далее

Как фундаментальная математика помогает переосмыслить градиентный спуск

Градиентный спуск — стандартный инструмент обучения нейросетей. Но с точки зрения линейной алгебры операция обновления весов выглядит некорректно: мы складываем вектор и ковектор. Авторы статьи из MIT CSAIL предлагают формальное решение этой проблемы через теорию двойственности и модулей. Разбираем их подход.

Читать далее
❌