Normal view

Черный лебедь в мире LLM или когда убьют трансформер?

И снова возвращаюсь к теме больших языковых моделей. В своей достаточно старой статье я писал, что текущая архитектура БЯМ(LLM) — это гонка в тупик. Наблюдения за прошедшее время только укрепляют меня в этом мнении. Но сегодня хочу поговорить о другом, а что если тупик — это не конец пути, а просто барьер, за которым нас ждет технологическая революция? И почему те, кто сейчас вкладывает сотни миллиардов в дата-центры, сделают всё, чтобы эта революция не случилась? Разберем по порядку.

Читать далее

H-Neurons: 0.1% нейронов, из-за которых LLM врут

А вы когда-нибудь задумывались, почему ваша любимая LLM-ка на 70 лярдов параметров, обученная на всем интернете, может с уверенностью университетского профессора выдать, например, что Наполеон изобрел электричество? Откуда это берется?

Долгое время индустрия списывала галлюцинации на плохие данные, кривой RLHF или декодинг. Но группа ученых из Университета Цинхуа залезла внутрь нейросети и нашла конкретных виновников — 0.1% нейронов, которые буквально заставляют модель врать. И это не метафора, это реальные веса в FFN-слоях трансформера.

В этой статье расскажу, что же обнаружили китайские исследователи, как нейроны-галлюцинаторы связаны с чрезмерной уступчивостью модели и почему корень зла лежит в претрейне. Возможно будет любопытно ML- и дата-инженерам, а также всем, кто не хочет быть одураченным в очередном диалоге с GPT-шкой.

Читать далее
❌