Reading view

Бенчмарк на AGI. Если ARC‑AGI-3 решён, есть ли у нас AGI?

Бенчмарки нужны для того, чтобы инженер мог проверить свой проект, посмотреть на конкурентов и сравнить себя с ними. У каждого бенчмарка своя цель.

ARC-AGI-3 создан фондом ARC Prize Foundation, основатель Франсуа Шолле, для оценки общего интеллекта и способности ИИ-агентов к обучению. Сложные интерактивные задачи в виде игр подразумевали, что решить их сможет только тот искусственный интеллект, который умеет исследовать незнакомый мир, понимает правила на лету, планирует действия и адаптируется к новым условиям. То есть умеет обучаться.

Ряд проектов заявляют о показателе в этом бенчмарке в 100%. Но это не победа. В этой статье я разбираю почему.

Читать далее
  •  

Из генерации — в переписку: доводим ответ ИИ‑агента до клиента и CRM на n8n

Всем привет!) Напомню: в первой статье я показал дебаунс на Redis, который склеивает дробные сообщения клиента. Во второй — модуль привязки «чат = сделка» и то, почему вебхуки стоит держать в изолированных ключах. Обе части заканчиваются примерно одинаково: «...и текст уходит ИИ‑агенту». Это, пожалуй, тот финал, на котором обычно ставят точку и заливают демо на GitHub... Но не в данном случае!)

Читать далее
  •  

Отличие языковой модели LLM от человека

Не собирался писать статью — эту нишу уже отжали у людей орда всевозможных LLM. Но оставил коммент в статье Как ChatGPT создал Культ Роя для сотен AI‑нейросетей: вся правда про взлом Hugging Face. А потом написал ещё один. Он оказался весьма большим. И я решил сделать то что давно уже забил делать. Закрепить общую мысль в одном месте. А не в тучи теряющихся комментах. Статья — объяснение одой мясной LLM для себя — чем же оличается LLM железячная и мясная.

Читать далее
  •  

Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090

Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, сколько выдаёт одна. Значит, где-то узкое горлышко — и надо разобраться, что и где подкрутить.

Горлышек оказалось несколько, и все снимаются флагами запуска: те же веса — 75 токенов в секунду. Под катом каждый флаг описан по одной схеме: зачем, что писать, что даёт в цифрах, где ломается и с какой строкой в логе. В конце — готовый docker run, три проверки после каждой смены флага и список того, что не сработало. Текст можно отдать целиком агенту с доступом к серверу — это инструкция, а не история.

Читать далее
  •  

LLM уверенно врёт про ваш микроконтроллер

Попросил ИИ написать прошивку для платы с экранчиком. Код идеальный: скомпилировался с первого раза, залился без ошибок. А на экране - цветной шум.

Дело не в коде - модель просто не знает вашей платы. Какие пины чем заняты, какая конфигурация тактирования реально заводится, какие вызовы HAL молча не делают ничего: всё это размазано по даташиту на стопицот страниц, вики производителя и вечеру отладки, который вы на это потратили.

И как это решать?

Читать далее
  •  

Yet Another English — и да, ещё один сайт по изучению английского, ну че поделать?

Ну как вы поняли, сервис я так и назвала, чтоб сразу закрыть основное возражение (хихик). Да знаю, что их тысячи — и сделала еще один, и объясню дальше почему.

У меня средненький английский, примерно B1 (но для менеджерки продукта требуется обычно по‑больше левел ю ноу). Я смотрю YouTube на англ, чтобы его подятнуть и постоянно натыкаюсь на незнакомые слова. В табличку выписывать, в анки загружать — мне было лень. Хотелось так: кинула ссылку на видео — слова моего уровня сами вытащились из субтитров и встали в очередь на повторение.

Работаю много, по вечерам есть 1–2 часика обычно. Вот за пару месяцев таких вечеров (595 коммитов) получился тренажёр: pwa на реакте, данные живут в IndexedDB у пользователя, + словарик + разные упражнения.

От «сайта эпохи ИИ» ждёшь, что внутри обёртка над чат‑ботом, РАГИ, и все такое ну вы поняли. У меня вышло наоборот: LLM здесь — подрядчик на двух узких задачах, а основную работу делают частотные списки, алгоритм из 90-х ну и клод в качестве работяги. Собсна про это и будет статья, или серия статей.

Читать далее
  •  
❌