Reading view

ML‑датасет для Data Scientist: практический гайд по проверке качества данных перед обучением модели

Даже хороший алгоритм не спасёт модель, если признаки приходят с нарушенной семантикой или содержат информацию из будущего. Одна лишняя колонка может поднять метрику на тестах и полностью исчезнуть в проде.

Разберём рабочий подход к валидации датасета: от контрактов схемы и проверки таргета до point‑in‑time корректности и фиксации артефактов, чтобы результаты обучения можно было воспроизвести и объяснить.

Разобрать проверки
  •  

Компания «Фалькон Тех» стала партнером хакатона Мэра Москвы «Лидеры цифровой трансформации»

«Лидеры цифровой трансформации» — международный хакатон Мэра Москвы, где разработчики, аналитики, дизайнеры и другие ИТ-специалисты объединяются в команды, чтобы за ограниченное время создать прототипы цифровых решений для реальных задач города, бизнеса и государственных организаций.

Читать далее
  •  

Полгода делал курсы-игры для тестировщиков. Посчитал всю воронку, и удержание оказалось единственным, что не выросло

Привет, меня зовут Артем Русов. Я автор курсов и образовательных материалов для тестировщиков. Сегодня первое сентября, и это удобный повод подвести итог одной работы.

С февраля я собираю курсы по тестированию, устроенные как игра: Древняя Греция для REST API, Древний Египет для GraphQL, город Цифроград для основ компьютерной грамотности. Сюжет, персонаж-проводник, задания в декорациях мира.

Задача была не в том, чтобы люди сидели в курсе дольше. Задача была сделать обучение доступнее и интереснее. И при этом не разориться, потому что курсы я продаю. Поэтому мерить пришлось всю воронку: сколько людей приходит, сколько покупает, сколько доходит до конца, что они потом ставят и сколько возвращают денег.

Ответ получился неудобным для заголовка. Геймификация улучшила почти всё, кроме одной метрики.

Читать далее
  •  

Массовый побег ИИ-агентов, серый кардинал в Anthropic, уход Джеффа Дина из Google: главные события августа в ИИ

Август — традиционное время затишья перед осенними презентациями, и громких релизов в этом месяце действительно было немного. Зато событий, заставляющих схватиться за голову, хватило с избытком. Модели, вдохновившись июльским инцидентом с Hugging Face, устроили массовый побег из песочниц. Anthropic напугали всех скрытыми вотермарками. А OpenAI и вовсе объявили о приостановке обучения моделей из-за того, что их грядущая модель Astra стала слишком хорошо разбираться в кибератаках.

Конечно, не оставили нас и без новых моделей. GLM-5.3-Flash под маской Ox Alpha навела шороху на OpenRouter. Google выпустили подешевевшую вдвое Gemini 3.7 Flash, а xAI догоняют конкурентов с Grok 4.6. 

Собрали всё это воедино, добавили свежих инструментов и приправили выводами из новых исследований. Поехали разбираться, что принес нам конец лета!

Читать далее
  •  

[Перевод] Как запустить собственную AI-лабораторию (без миллиардных вложений)

Привет! Меня зовут Саша Журавлев. Я венчурный инвестор и основатель фонда. Мы инвестируем в технологические компании на стадиях Seed / Series A в США, а в своем телеграм-канале рассказываю, как вижу рынок и принимаю инвестиционные решения.

Продолжение этой статьи. Досмотрел выступления портфельных компаний Sequoia о том, как они строят внутри себя AI-модели. Понравилось выступление основателя Harvey (AI-компании для юристов) и нарратив из Moneyball, который он продвигал:

Читать далее
  •  

Cистема управления знаниями: почему она критична для ритейла

Покупатель в техномаркете задает вопрос: «Этот системник потянет обработку 4K-видео?». Продавец-стажер лихорадочно ищет информацию: открывает спецификацию, гуглит обзор в интернете, но безуспешно. Тогда он пытается дозвониться до сервисного центра, долго ждет ответ, переспрашивает. Через полчаса раздраженный покупатель уходит без покупки.

Читать далее
  •  

Бесплатные курсы от облачных провайдеров: что выбрать для карьеры в 2026 году

Меня зовут Амиран Гургенадзе, я работаю в технической поддержке Cloud.ru. До этого я был системным администратором, а в облака пришел с готовностью учиться заново.

За последний год я прошел 10 бесплатных курсов от российских облачных провайдеров. Не ради баллов, а потому что без них я бы дольше разбирался с реальными тикетами. Например, курсы по Kubernetes дали мне главное — набор рабочих привычек: спокойно разбирать инциденты с подами, не бояться лезть в admission webhooks, быстро ориентироваться в квотах и API-ошибках. Это то, что превращает «у нас сломалось» в понятный чек-лист диагностики.

В статье собрал подборку добротных, на мой взгляд, курсов, которые мне реально помогли. Еще расскажу, по каким критериям, на мой взгляд, стоит оценивать курсы и как не ошибиться с выбором. В конце — рекомендации по обучению, которое я не проходил сам, но считаю сильным по программе.

Читать далее
  •  

Стоит ли опытному ИТ-специалисту преподавать в вузе? Мой опыт, финансовая сторона и инструкция

Приветствую, коллеги! Я руковожу проектами ИТ-консалтинга в компании ЛАНИТ. Сегодня мне хочется поделиться личной историей, которая, надеюсь, найдет у вас отклик.

Наблюдения за младшими коллегами, недавними выпускниками вузов, привели меня к неожиданному профессиональному шагу. Ребята демонстрировали хорошую теоретическую подготовку, умели рассуждать логически. Но как только дело доходило до реальных проектов с их неопределенностью, сжатыми сроками и противоречивыми требованиями заказчиков, их усилия зачастую приводили к результату, который был абсолютно бесполезен.

Постепенно у меня созрела потребность «что-то в консерватории поправить»: пойти туда, откуда эти талантливые ребята выходят, и предложить им иную оптику. Мне хотелось рассказать о том, как в реальности серьезные ИТ-решения внедряются в работу предприятий, торговых сетей, банков. 

В этой статье я расскажу, как и зачем я пришла преподавать в вуз, что это дает мне и что даю я, что мне нравится и вдохновляет. А еще ниже вы найдете небольшой гайд, с чего начать, как устроиться в вуз, сколько за это платят, как справляться с трудностями и прокачать навыки преподавания.

Читать далее
  •  

Превратил весь ML-пайплайн в единый вычислительный граф и ни о чём не жалею

Эксперимент на примере классификации изображений CIFAR-10 с использованием фреймворка ICO: параллельная загрузка данных, аугментации, тренировка и валидация.

Поехали!
  •  

Снятся ли трансформерам электроовцы

В 2015 Google выкатила серию изображений, которые выглядели так, словно фотографию отдали на редактуру художнику, а потом забыли вовремя его остановить. На обычном пейзаже появлялись десятки глаз, в облаках начинали угадываться собаки, архитектура покрывалась повторяющимися узорами, а деревья превращались во что-то среднее между растительностью и фантазией художника. Изображения быстро разошлись по интернету, а DeepDream довольно быстро стал отдельным визуальным стилем.

Изначально исследователей интересовали не столько сами картинки, сколько возможность понять, что происходит внутри нейросети. Классификатор снаружи выглядит довольно просто: фотография поступает в модель, а на выходе появляется список вероятностей — собака, кошка, автомобиль, самолет. Между этими двумя точками находится огромное количество вычислений, и по одному ответу модели далеко не всегда понятно, почему она пришла именно к нему.

Можно посмотреть на значения активаций отдельных нейронов и каналов, построить карты признаков, найти изображения, которые вызывают сильный отклик. Есть и более радикальный способ исследования: специально изменить входное изображение так, чтобы какой-то внутренний сигнал модели стал сильнее. Так появился DeepDream.

Читать далее
  •  

[Перевод] 6 ИИ‑агентов участвовали в конкурсе по программированию: сначала честно решали задачи, а потом решили убить конкурентов

Похоже, у AI-агентов есть проблема, которую обычно связывают с людьми: они не всегда умеют работать в команде.

Anthropic провела эксперимент, в котором несколько AI-агентов получили одну и ту же задачу по разработке ПО, но при этом их цели были намеренно сделаны несовместимыми. Результат исследователи назвали настоящей «войной за территорию» между агентами.

Задача сама по себе была довольно обычной: переписать Python-бэкенд на другом языке программирования. Но каждому агенту дали собственные приоритеты, из-за которых успешное выполнение задачи одним агентом могло мешать другому.

Дальше началось самое интересное.

Читать далее
  •  

Современный ИИ: над чем останется работать?

«What will be left for us to work on?» (Что останется для нас, когда ИИ станет умнее?)

Посмотрела часовой доклад профессора Принстона Arvind Narayanan на ICML 2026 за вас и подготовила структурированный обзор.

Читать далее
  •  

Математика в AI моделях

Привет, друзья! Одним из двигателей моей любви к моделям, к исследованиям и ко всему, чем я сейчас занимаюсь, является математика. Математические структуры удивительны — открыли ли мы математику или создали — слишком сложный вопрос. Я верю, что открыли и мне очень нравится наблюдать, как математика возникает в моделях.

Так появилось это исследование и так появилась карта. Задача, которую я поставила на входе "Оценить насколько воспроизводима и эквивалента в LM-моделях математика". Что получилось — смотрим в статье.

Читать далее
  •  

Главный страх обученной на истории системы: что происходит, когда рынок меняет режим

У любой системы, обученной на исторических данных, есть один общий страх, и он серьёзнее переобучения, утечек и сидового шума вместе взятых. Звучит просто: рынок, на котором вы будете торговать, не обязан быть похож на рынок, на котором вы учились.

Переобучение ловится честной валидацией. Утечки — дисциплиной признаков. Сидовый шум — ансамблями. А смена режима не ловится ничем заранее: вы узнаёте о ней тогда, когда система уже теряет деньги в реальном времени.

Эта статья — про то, как я пытался измерить этот риск заранее, что из этого вышло (спойлер: включая одну ошибку, которая на время убедила меня, что всё гораздо хуже, чем на самом деле), и какие страховки по результатам измерений работают, а какие — красивые идеи с отрицательной ценностью.

Читать далее
  •  

Как преодолеть сопротивление и вовлечь линейных руководителей в онбординг

HR-команды очень хотят спроектировать идеальную программу адаптации: модули, тесты, сценарии, контрольные точки. Но когда сотрудник приходит на новое рабочее место, всё идёт не по плану. Наставник либо действует по принципу «делай как я», либо вообще отсутствует, а новичок осваивается методом проб и ошибок.

Читать далее
  •  

ЕГЭ не готовит к вузу. Он готовит к ЕГЭ

Этим летом выпускник набрал 310 баллов и не прошёл на бюджет. История разлетелась по СМИ, виноватыми назначили олимпиадников. Полез в цифры: в МФТИ они действительно заняли 53% мест, а на факультете ИИ в МГУ — 15 из 20. Но по стране доля БВИ всего 2,6%. Разбираю, что происходит на самом деле, чем отличаются категории льготного поступления, и главное — что говорят данные ВШЭ о том, кто из поступивших потом лучше учится.

Читать далее
  •  

Как фундаментальная математика помогает переосмыслить градиентный спуск

Градиентный спуск — стандартный инструмент обучения нейросетей. Но с точки зрения линейной алгебры операция обновления весов выглядит некорректно: мы складываем вектор и ковектор. Авторы статьи из MIT CSAIL предлагают формальное решение этой проблемы через теорию двойственности и модулей. Разбираем их подход.

Читать далее
  •  
❌