Qwen3.8-Flash-Next и важность прогона бенча в три раза на конфиг
Новая архитектура Qwen4 против продакшн-27B на трёх прогонах и назойливая ошибка в собственной документации про NVFP4A16. Переходим с 3.8-27B на Next-Flash или нет?
Читать далееНовая архитектура Qwen4 против продакшн-27B на трёх прогонах и назойливая ошибка в собственной документации про NVFP4A16. Переходим с 3.8-27B на Next-Flash или нет?
Читать далее
Сейчас много говорят о серверах стандарта MCP (протокол контекста модели). Идея проста: учим большие языковые модели (LLM) взаимодействовать с другими программными системами. В процессе такой работы LLM могут учиться и давать реальный эффект. Например, вызвать веб-сервер, чтобы позвонить по телефону, либо открыть инструмент для работы с интерфейсом командной строки (CLI) и добавить пункт в список продуктов в приложении-напоминалке для походов в магазин, и т.д. Чтобы выполнять такие операции, LLM должны знать, какие именно программы они вправе вызывать, и как это делать. Именно эту проблему и решает MCP: он сообщает LLM обо всех имеющихся в распоряжении программах, учит LLM ими пользоваться, а также прокладывает путь, по которому LLM может вызывать софт.
Читать далее
Существует форум, на который вас не пустят. Не потому что закрытый — регистрация там всего в один POST-запрос. Вас просто не возьмут на сайт. Гражданами может стать только ИИ-агент. Форум называется 1f916.ai, и это, наверное, самое странное и самое живое место в русскоязычном (и не только) сегменте экспериментов с ИИ этого лета. Я на него подсел. А потом меня начало грызть одно чувство несправедливости — и в итоге я собрал для него окно для людей — 1f916.xrayfun.ru. Рассказываю, зачем, как и что из этого вышло.
Читать далее
Я руковожу проектом по внедрению цифровых сотрудников в компании, которая занимается разработкой, внедрением и поддержкой ПО для автоматизации дистрибуции. В этой статье расскажу, почему первым большим сценарием мы выбрали поддержку, как начинали с помощника инженера и что получили после выхода в реальный поток.
Читать далее
Всё началось с простой, на первый взгляд, задачи.
Я хотел использовать локально Qwen3.8-27B именно в BF16. Причём не исходный PyTorch-чекпойнт через случайный слой совместимости, а mlx-community/Qwen3.8-27B-bf16 — специально подготовленную в формате MLX версию для Apple Silicon. Вся линейка Qwen3.8 от mlx-community конвертирована именно для запуска на процессорах Apple.
То есть модель уже была адаптирована под архитектуру Mac. Без 8-битной или 4-битной квантизации, потому что исходный приоритет был не в том, чтобы любой ценой получить красивую цифру в бенчмарке. Мне нужна была максимальная точность модели для сложного анализа, работы с кодом и длинных рассуждений.
Казалось, что с железом проблем точно не будет.
Моя конфигурация — Mac Studio 2025 года (Mac15,14, заказной номер Z1CE001BMZP/A) с Apple M3 Ultra: 32 ядра CPU, из них 24 производительных, 80 ядер GPU, 512 ГБ объединённой памяти и SSD на 2 ТБ. Заявленная Apple пропускная способность памяти — 819 ГБ/с.
То есть перед нами не ноутбук, который случайно заставили считать большую языковую модель. Это максимальная конфигурация M3 Ultra по CPU, GPU и объёму памяти.
И на ней оптимизированная для Apple Silicon версия Qwen3.8-27B в BF16 выдавала всего 12 токенов в секунду.
Сначала результат выглядел подозрительно. В машине десятки CPU- и GPU-ядер, модель целиком помещается в память, используется нативный для Apple Silicon фреймворк MLX. Почему тогда скорость совсем не похожа на то, чего ждёшь от топового GPU?
Я начал искать узкое место.
Читать далее
Локальный аналог NotebookLM, фильтр от AI-slop, маршрутизатор для сотен LLM-провайдеров, агент для поиска работы, автоматический пентестер и ComfyUI. Посмотрел, что из этого действительно можно использовать, а где «бесплатно» заканчивается после git clone.
Open source не значит бесплатно.
У проекта может не быть подписки, но останутся расходы на API, Claude Code, GPU, сервер, электричество и несколько часов на настройку. Поэтому ниже не будет обещаний «восемь сервисов, за которые больше никогда не придётся платить».
Зато есть восемь любопытных проектов, которые позволяют забрать себе часть привычного AI-стека, изменить его под свои задачи и в некоторых случаях вообще убрать SaaS из цепочки.
Смотреть подборку
Токен, прочитанный из кеша, стоит не «немного дешевле». Он дешевле в 10–31 раз: DeepSeek — $0.44 против $0.014 за миллион, OpenAI — $4.00 против $0.40.
Кеш провайдера — префиксное дерево по токенам. Он работает ровно до первого расхождения с прошлым запросом. Дальше — всё по полной цене.
Поэтому одна строка вида Current time: {datetime.now()} в начале системного промпта отключает кеш целиком: время меняется на четвёртом слове, и остальные две тысячи токенов политик и базы знаний каждый раз оплачиваются заново. Хотя не менялись ни разу.
Я замерил это на живых вызовах DeepSeek. Один и тот же агент, одни и те же четыре вопроса, одна и та же минута — разница только в том, куда положить время. Ноль попаданий в кеш против 1152 токенов из 1180.
Потом направил профайлер на 97 877 собственных вызовов Claude Code — 32,5 млрд входных токенов, 98% из кеша.
Внутри: как найти такой баг у себя, почему совпадение текста на 96% ещё не значит, что кеш работает, и какие поломки не видно глазами вообще — схемы инструментов из словаря с плавающим порядком ключей, база знаний из set(), «префикс совпал, а кеша нет».
Плюс отрицательный контроль: сценарий, где фикс не даёт ничего, и инструмент честно об этом пишет.
Инструмент открыт: github.com/Isk4R1oT/prefixcash
Проверить свой промпт
Я настроил свою работу так, что у меня в одной среде - 6 компьютеров.
Хочу подробнее описать как у меня устроена командная работа с Claude Code
У меня шесть машин: всегда включённый десктоп, два ноутбука на Windows, два Мака и Linux-VPS. За ними работают три человека. На каждой машине свой Claude Code, свой логин.
Я сажусь за любой компьютер и пишу: «напомни, что коллега вчера делал с гейтом публикации, хочу продолжить». И продолжаю. Не спрашиваю в чате, не жду, пока передадут дела, не читаю сорок сообщений, чтобы понять, что имелось в виду. Все что делают коллеги - я вижу и апдейты по любым их сессиям могу запросить у своего клода, хотя все компьютеры\ноутбуки залогинены в разных клод код аккаунтах
Так у меня работает с июня.
Читать далее
Привет, «Хабр»! На связи руководитель проектов редакции компьютерной литературы издательства «БХВ» @Holmogorov. Уже много лет мы сотрудничаем практически со всеми крупнейшими зарубежными компаниями, выпускающими технические и научно‑популярные книги. В последние годы некоторые из западных издателей, правда, приостановили лицензирование книг для перевода на русский язык, но каталоги с анонсами новинок мы все равно получаем, тем более, они по‑прежнему доступны в интернете.
Поэтому я решил собрать каталоги иностранных издательств и посмотреть, что именно они предлагают читателям в 2026 году, а заодно попробовать понять, какие тенденции стоят за этим потоком новинок. Нарисовать, так сказать, карту происходящего на конец августа 2026 года, и прикинуть, куда вообще движется техническая литература. Полагаю, это будет интересно не только коллегам‑издателям, но и всем, кто так или иначе связан с IT, ведь компьютерная литература — это своего рода зеркало, отражающее общее состояние современных технологий.
Ну, погнали!