Лекция Стэнфорда про ChatGPT и Claude: конспект по-русски и 7 правил для запросов

Конспект лекции Стэнфорда по-русски и простым языком: как собирают ChatGPT, Claude и похожие нейросети, от нарезки текста на кусочки до проверки готовой модели. Лекцию читает Янн Дюбуа на курсе CS229, она идёт 1 час 44 минуты на английском.

Внутри: конспект лекции CS229 по шагам (токены, обучение на интернете, законы масштаба, дообучение на людях, проверка моделей), цифры из лекции, семь практических правил для запросов и промпт-проверка ответа. Ссылка на оригинал на YouTube.

Прочитай первые два раздела за пять минут, это каркас. Потом раздел 7 с правилами: его стоит держать открытым, когда пишешь запросы.

1. Главная мысль лекции за одну минуту

Языковая модель это программа, которая по началу текста оценивает, какое слово вероятнее всего будет следующим. Весь ChatGPT собирается из этого одного умения, повторённого много раз подряд.

Ты пишешь вопрос, модель выбирает первое слово ответа, дописывает его к тексту и снова выбирает следующее. Так, слово за словом, получается ответ. Отсюда и всё поведение нейросети: она продолжает текст правдоподобно, и правдоподобный текст обычно оказывается правильным, но иногда бывает уверенной выдумкой.

Предобучение

Модель читает огромную часть интернета и учится угадывать следующее слово. Здесь она получает знания о мире и языке.

Дообучение

Модель учат вести себя как помощник: отвечать на вопрос, держать формат, отказываться от вредного. Здесь она получает манеру.

Проверка

Модели сравнивают на тестах и на живых людях, которые вслепую выбирают лучший из двух ответов.

Дюбуа отдельно подчёркивает: в учебниках больше всего говорят про устройство нейросети, хотя в компаниях больше всего сил уходит на данные, проверку и железо. Устройство у сильных моделей сейчас похожее, разница рождается в том, на чём и как их учили.

2. Токены: на что нейросеть режет твой текст

Модель видит текст кусочками, их называют токенами. Токен бывает целым словом, частью слова или знаком.

  1. Нарезку строят заранее: берут большой текст, начинают с отдельных букв и много раз склеивают самую частую пару соседних кусочков в новый кусочек. Частые слова становятся одним токеном, редкие собираются из нескольких.
  2. В английском один токен в среднем около 3-4 букв. Русский текст обычно режется мельче, поэтому тот же смысл на русском занимает больше токенов и быстрее съедает лимит.
  3. Числа и код режутся неудобно: число 327 может оказаться одним токеном, а 3271 двумя кусками. Поэтому модели исторически путаются в арифметике и подсчёте букв.
  4. Лимит длины разговора, цена запроса через API и скорость ответа считаются в токенах, и словами их мерить неточно.

3. Предобучение: учёба на интернете

Задача на этом этапе одна: угадать следующий токен в миллиардах текстов. Модель штрафуют, когда она ставит низкую вероятность на правильное слово, и так шаг за шагом подкручивают миллиарды её внутренних чисел.

Сырьё это открытые архивы интернета: сотни миллиардов страниц, около петабайта текста. Почти весь он мусор, поэтому путь от архива до учебника выглядит так:

  1. Вытащить текст из кода страниц, отдельно бьются формулы и таблицы.
  2. Убрать вредное и личные данные по спискам и фильтрам.
  3. Удалить дубли: одинаковые шапки сайтов, копии статей, повторы с форумов.
  4. Отсеять мусор правилами: страницы со странной длиной, обилием спецсимволов, бессвязным текстом.
  5. Отобрать качественное отдельной моделью. Её учат отличать страницы, на которые ссылается Википедия, от случайных страниц, и оставляют похожие на первые.
  6. Перемешать по темам с весами: кода и книг дают больше, чем развлекательного, потому что они учат рассуждать.
  7. В самом конце доучить на лучшем: Википедии и отборных текстах, с маленьким шагом обучения.

Объём данных

Открытые модели 2024 года учили примерно на 15 триллионах токенов. Llama 2 видела около 2 триллионов, Llama 3 уже 15.

Как меряют прогресс

Перплексия: насколько модель «удивляется» правильному тексту. Чем ниже, тем лучше. С 2017 по 2023 она упала примерно с 70 до значений меньше 10.

Тесты знаний

Наборы вопросов с вариантами ответа по сотням предметов. Подвох: одна и та же модель набирает разные баллы в зависимости от того, как задан вопрос.

4. Законы масштаба: почему модели всё больше

Самое неожиданное открытие последних лет: качество растёт предсказуемо. Больше данных, больше модель и больше вычислений дают меньше ошибок, и на графике в логарифмах это почти прямая линия.

  1. Поэтому настройки подбирают на маленьких моделях за копейки, рисуют линию и по ней предсказывают, что выйдет у большой, ещё до её обучения.
  2. Есть оптимальная пропорция. Для самого дешёвого обучения нужно около 20 токенов текста на каждый параметр модели. Если модель потом будут много использовать, выгоднее учить её дольше, примерно 150 токенов на параметр: она выйдет меньше и дешевле в работе.
  3. Вывод Дюбуа: хитрые идеи в устройстве модели дают меньше, чем просто больше данных и вычислений. Это и есть причина гонки за дата-центрами.

Сколько стоит большая модель

Его оценка для модели уровня Llama 3 на 400 миллиардов параметров: около 16 тысяч видеокарт H100, примерно 70 дней обучения и порядка 75 миллионов долларов вместе с зарплатами команды.

Почему это важно тебе

Знания модели заморожены на дату сбора данных. О том, что случилось позже, она узнаёт только из поиска или из того, что ты сам ей дал.

5. Дообучение: как из угадайки сделали помощника

После предобучения модель умеет продолжать текст, но на вопрос она может ответить ещё тремя вопросами, как на форуме. Помощником её делают два шага.

  1. Обучение на примерах. Модели показывают пары «вопрос и хороший ответ», написанные людьми. Удивительно, но хватает нескольких тысяч примеров: модель здесь учит манеру и формат, знания у неё уже есть с предобучения. Такие пары сейчас часто генерирует другая нейросеть.
  2. Обучение на предпочтениях. Человеку показывают два ответа модели, и он выбирает лучший. Выбирать проще и дешевле, чем писать идеальный ответ с нуля. По тысячам таких выборов модель сдвигают в сторону ответов, которые людям нравятся больше. Этот шаг и дал тот самый эффект ChatGPT в 2022 году.

Откуда выдумки

Если в примерах человек написал ответ, которого модель не знает, её учат уверенно говорить то, чего у неё нет. Так появляется уверенная выдумка.

Откуда длинные ответы

Люди при выборе чаще ставят выше более длинный ответ. Модели это выучили, поэтому льют воду, пока не попросишь короче.

Кто размечает

Людей частично заменили нейросетями-судьями: они дешевле, быстрее и выбирают похоже на людей, хотя тоже любят длинное.

6. Как понять, какая модель лучше

После дообучения старые метрики почти бесполезны: ответов на вопрос много хороших, и правильного слова для сравнения нет.

  1. Арена: живые люди задают свои вопросы двум скрытым моделям и выбирают лучший ответ. По тысячам голосов строится рейтинг как в шахматах. Это самый честный способ, но медленный и дорогой.
  2. Нейросеть-судья: сильная модель сравнивает ответы вместо людей. Результат совпадает с ареной очень близко, если поправить её любовь к длинным ответам.
  3. Практический вывод: смотри на рейтинг арены и проверяй модель на своих задачах. Высокий балл на тесте знаний ещё не значит, что она хорошо пишет твои тексты.

7. Семь правил для запросов, которые следуют из лекции

Когда понимаешь, что модель продолжает текст и обучена нравиться людям, запросы пишутся иначе.

  1. Дай контекст в начале. Модель продолжает то, что видит, поэтому кто ты, для кого текст и зачем он нужен должно стоять до просьбы.
  2. Покажи пример нужного ответа. Формат она выучила на примерах и лучше всего копирует образец.
  3. Задай длину прямо: «до 600 знаков», «5 пунктов». Иначе сработает выученная любовь к длинным ответам.
  4. Разреши говорить «не знаю» и попроси помечать догадки отдельно от фактов. Так уверенных выдумок становится меньше.
  5. Свежие события, цены и цифры давай сам или включай поиск. Знания модели заморожены на дату обучения.
  6. Счёт, проценты и подсчёт букв проверяй отдельно или проси посчитать кодом. Цифры режутся на токены неудобно.
  7. Сложную задачу проси решать по шагам. Каждый следующий токен опирается на предыдущие, и рассуждение, выписанное по шагам, подтягивает итог.
Промпт: проверка ответа нейросети
Проверь свой предыдущий ответ как строгий редактор. 1. Отметь каждое утверждение: [ФАКТ, уверен], [ДОГАДКА] или [НЕ ЗНАЮ]. 2. Для каждого факта с цифрой, датой или именем напиши, откуда он мог быть взят, и насколько он может устареть. 3. Найди места, где ты добавил воду ради длины, и сократи ответ на треть без потери смысла. 4. Если где-то нужен счёт, пересчитай его по шагам. Выдай исправленный ответ и отдельным списком то, что мне стоит перепроверить самому.

8. Оригинал лекции

Запись курса CS229 Стэнфорда, лектор Янн Дюбуа, 1 час 44 минуты, на английском. Субтитры YouTube можно включить с автопереводом на русский.

Ссылка на запись: https://www.youtube.com/watch?v=9vM4p9NN0Ts

Цифры в этом конспекте приведены по лекции 2024 года, с тех пор модели выросли, логика их сборки осталась прежней.

Читать дальше в блоге

Эту тему я разбираю подробно в статье рабочий список нейросетей для контента. Там же лежат остальные разборы про нейросети.

Следующий шаг
Хочешь так же, но под свой блог и продукт?

Я собрал систему, по которой обычный человек запускает блог с нуля и набирает аудиторию без съёмок, монтажа и команды. Внутри разбор, с которого стартовал сам.

Открыть разбор: с чего начать→