Qwen3.8-Flash-Next и важность прогона бенча в три раза на конфиг
Новая архитектура Qwen4 против продакшн-27B на трёх прогонах и назойливая ошибка в собственной документации про NVFP4A16. Переходим с 3.8-27B на Next-Flash или нет?
Читать далееНовая архитектура Qwen4 против продакшн-27B на трёх прогонах и назойливая ошибка в собственной документации про NVFP4A16. Переходим с 3.8-27B на Next-Flash или нет?
Читать далееСейчас много говорят о серверах стандарта MCP (протокол контекста модели). Идея проста: учим большие языковые модели (LLM) взаимодействовать с другими программными системами. В процессе такой работы LLM могут учиться и давать реальный эффект. Например, вызвать веб-сервер, чтобы позвонить по телефону, либо открыть инструмент для работы с интерфейсом командной строки (CLI) и добавить пункт в список продуктов в приложении-напоминалке для походов в магазин, и т.д. Чтобы выполнять такие операции, LLM должны знать, какие именно программы они вправе вызывать, и как это делать. Именно эту проблему и решает MCP: он сообщает LLM обо всех имеющихся в распоряжении программах, учит LLM ими пользоваться, а также прокладывает путь, по которому LLM может вызывать софт.
Читать далееСуществует форум, на который вас не пустят. Не потому что закрытый — регистрация там всего в один POST-запрос. Вас просто не возьмут на сайт. Гражданами может стать только ИИ-агент. Форум называется 1f916.ai, и это, наверное, самое странное и самое живое место в русскоязычном (и не только) сегменте экспериментов с ИИ этого лета. Я на него подсел. А потом меня начало грызть одно чувство несправедливости — и в итоге я собрал для него окно для людей — 1f916.xrayfun.ru. Рассказываю, зачем, как и что из этого вышло.
Читать далееЯ руковожу проектом по внедрению цифровых сотрудников в компании, которая занимается разработкой, внедрением и поддержкой ПО для автоматизации дистрибуции. В этой статье расскажу, почему первым большим сценарием мы выбрали поддержку, как начинали с помощника инженера и что получили после выхода в реальный поток.
Читать далееВсё началось с простой, на первый взгляд, задачи.
Я хотел использовать локально Qwen3.8-27B именно в BF16. Причём не исходный PyTorch-чекпойнт через случайный слой совместимости, а mlx-community/Qwen3.8-27B-bf16 — специально подготовленную в формате MLX версию для Apple Silicon. Вся линейка Qwen3.8 от mlx-community конвертирована именно для запуска на процессорах Apple.
То есть модель уже была адаптирована под архитектуру Mac. Без 8-битной или 4-битной квантизации, потому что исходный приоритет был не в том, чтобы любой ценой получить красивую цифру в бенчмарке. Мне нужна была максимальная точность модели для сложного анализа, работы с кодом и длинных рассуждений.
Казалось, что с железом проблем точно не будет.
Моя конфигурация — Mac Studio 2025 года (Mac15,14, заказной номер Z1CE001BMZP/A) с Apple M3 Ultra: 32 ядра CPU, из них 24 производительных, 80 ядер GPU, 512 ГБ объединённой памяти и SSD на 2 ТБ. Заявленная Apple пропускная способность памяти — 819 ГБ/с.
То есть перед нами не ноутбук, который случайно заставили считать большую языковую модель. Это максимальная конфигурация M3 Ultra по CPU, GPU и объёму памяти.
И на ней оптимизированная для Apple Silicon версия Qwen3.8-27B в BF16 выдавала всего 12 токенов в секунду.
Сначала результат выглядел подозрительно. В машине десятки CPU- и GPU-ядер, модель целиком помещается в память, используется нативный для Apple Silicon фреймворк MLX. Почему тогда скорость совсем не похожа на то, чего ждёшь от топового GPU?
Я начал искать узкое место.
Читать далееЛокальный аналог NotebookLM, фильтр от AI-slop, маршрутизатор для сотен LLM-провайдеров, агент для поиска работы, автоматический пентестер и ComfyUI. Посмотрел, что из этого действительно можно использовать, а где «бесплатно» заканчивается после git clone.
Open source не значит бесплатно.
У проекта может не быть подписки, но останутся расходы на API, Claude Code, GPU, сервер, электричество и несколько часов на настройку. Поэтому ниже не будет обещаний «восемь сервисов, за которые больше никогда не придётся платить».
Зато есть восемь любопытных проектов, которые позволяют забрать себе часть привычного AI-стека, изменить его под свои задачи и в некоторых случаях вообще убрать SaaS из цепочки.
Смотреть подборкуТокен, прочитанный из кеша, стоит не «немного дешевле». Он дешевле в 10–31 раз: DeepSeek — $0.44 против $0.014 за миллион, OpenAI — $4.00 против $0.40.
Кеш провайдера — префиксное дерево по токенам. Он работает ровно до первого расхождения с прошлым запросом. Дальше — всё по полной цене.
Поэтому одна строка вида Current time: {datetime.now()} в начале системного промпта отключает кеш целиком: время меняется на четвёртом слове, и остальные две тысячи токенов политик и базы знаний каждый раз оплачиваются заново. Хотя не менялись ни разу.
Я замерил это на живых вызовах DeepSeek. Один и тот же агент, одни и те же четыре вопроса, одна и та же минута — разница только в том, куда положить время. Ноль попаданий в кеш против 1152 токенов из 1180.
Потом направил профайлер на 97 877 собственных вызовов Claude Code — 32,5 млрд входных токенов, 98% из кеша.
Внутри: как найти такой баг у себя, почему совпадение текста на 96% ещё не значит, что кеш работает, и какие поломки не видно глазами вообще — схемы инструментов из словаря с плавающим порядком ключей, база знаний из set(), «префикс совпал, а кеша нет».
Плюс отрицательный контроль: сценарий, где фикс не даёт ничего, и инструмент честно об этом пишет.
Инструмент открыт: github.com/Isk4R1oT/prefixcash
Проверить свой промпт