Normal view

Где счетный бейзлайн бьет трансформер: честное сравнение на русских отзывах

Когда нужно классифицировать текст, дефолтный ход в 2026 – взять предобученный трансформер и дообучить. TF-IDF воспринимается как музейный экспонат: работал в эпоху до BERT, сейчас не всерьез. Обычно этот выбор никто не проверяет на своих данных, потому что и так понятно, кто победит.

Мы решили проверить. Взяли одну задачу, один корпус, одну метрику и прогнали три подхода подряд: счетный бейзлайн на TF-IDF, сверточную сеть TextCNN и дообученный русский энкодер. Считали не только качество, но и стоимость – время обучения и скорость предсказания на обычном процессоре.

Короткий вывод: на этой задаче счетный бейзлайн обучается за три секунды и по честной метрике держится вровень с трансформером, который дообучался восемь минут. А трансформер, взятый по стандартному рецепту, сначала вообще проиграл – и проиграл поучительно.

Дальше – как так вышло и что из этого забрать себе.

Читать далее

Черный лебедь в мире LLM или когда убьют трансформер?

И снова возвращаюсь к теме больших языковых моделей. В своей достаточно старой статье я писал, что текущая архитектура БЯМ(LLM) — это гонка в тупик. Наблюдения за прошедшее время только укрепляют меня в этом мнении. Но сегодня хочу поговорить о другом, а что если тупик — это не конец пути, а просто барьер, за которым нас ждет технологическая революция? И почему те, кто сейчас вкладывает сотни миллиардов в дата-центры, сделают всё, чтобы эта революция не случилась? Разберем по порядку.

Читать далее

Снятся ли трансформерам электроовцы

В 2015 Google выкатила серию изображений, которые выглядели так, словно фотографию отдали на редактуру художнику, а потом забыли вовремя его остановить. На обычном пейзаже появлялись десятки глаз, в облаках начинали угадываться собаки, архитектура покрывалась повторяющимися узорами, а деревья превращались во что-то среднее между растительностью и фантазией художника. Изображения быстро разошлись по интернету, а DeepDream довольно быстро стал отдельным визуальным стилем.

Изначально исследователей интересовали не столько сами картинки, сколько возможность понять, что происходит внутри нейросети. Классификатор снаружи выглядит довольно просто: фотография поступает в модель, а на выходе появляется список вероятностей — собака, кошка, автомобиль, самолет. Между этими двумя точками находится огромное количество вычислений, и по одному ответу модели далеко не всегда понятно, почему она пришла именно к нему.

Можно посмотреть на значения активаций отдельных нейронов и каналов, построить карты признаков, найти изображения, которые вызывают сильный отклик. Есть и более радикальный способ исследования: специально изменить входное изображение так, чтобы какой-то внутренний сигнал модели стал сильнее. Так появился DeepDream.

Читать далее

Откуда взялся ИИ и причем тут слово перцептрон

Путь от первой попытки смоделировать нейрон до систем, которые сегодня пишут код и ведут диалог, занял меньше 70 лет — и почти обвалился на середине. Разбираемся, как перцептрон Розенблатта чуть не похоронил идею нейросетей, что вернуло ее к жизни, и почему трансформеры изменили все.

Читать далее
❌