Чему на самом деле учат студентов Stanford про ИИ. Большинство людей этого никогда не видит. Часть I

Полный перевод X Article о курсе Stanford CS221: математические основы ИИ, обучение, поиск, принятие решений, RL и теория игр.

Чему на самом деле учат студентов Stanford про ИИ. Большинство людей этого никогда не видит. Часть I

Источник: пост Iron Giant в X и процитированная X Article Mr. Buzzoni. Черновик подготовлен как полный перевод материала на русский.

Контекст исходного поста

Iron Giant пишет, что пока большинство спорит о prompt engineering, лучшие команды переходят к петлям: архитектурам, где сотни агентов проходят тысячи проверяемых шагов по нескольким live-feed источникам без постоянных человеческих подсказок.

Ключевая мысль поста: ценность не в количестве агентов, а в архитектуре цикла. Автор выделяет три проверки каждого шага, постоянное обновление контекста из пяти живых потоков данных, checkpoint состояния после каждого шага и отсутствие очереди ручных промптов: система сама ставит себе следующие действия.

Оригинальное видео из исходного поста

Чему на самом деле учат студентов Stanford про ИИ. Большинство людей этого никогда не видит. Часть I

11 лекций. Полная математическая основа искусственного интеллекта: от того, как машины учатся, до того, как они играют, принимают решения и рассуждают в условиях неопределенности.

Я пересмотрел очень много материалов об ИИ

Большинство из них попадает в одну из двух ловушек.

Либо это слишком поверхностно — «ИИ похож на мозг, он учится на данных, вау, удивительно», — либо настолько плотно, что нужен PhD, чтобы просто разобрать введение.

Stanford Computer Science 221 — не такой курс.

Это самая ясная и полная карта того, как на самом деле работает искусственный интеллект, которую я нашел. Не только математика. Не только философия. Вся картина: от первых принципов машинного обучения до теории игр, вероятностного рассуждения и механики больших языковых моделей.

Всего двадцать лекций. Я разбиваю материал на две части.

Это часть I: математическая и вычислительная основа. Лекции с 1 по 11 — обучение, поиск, принятие решений и стратегическое рассуждение.

Часть II выйдет на следующей неделе: байесовские сети, логика, большие языковые модели и геополитика AI-инфраструктуры.

Начнем.


Чему этот курс на самом деле учит

Большинство людей думает, что ИИ — это что-то одно. Это не так.

Это четыре вещи, работающие вместе:

  • Машинное обучение — как системы извлекают закономерности из данных
  • Поиск и планирование — как ИИ рассуждает через последовательности действий
  • Принятие решений в условиях неопределенности — как он действует, когда исходы не гарантированы
  • Теория игр — как он рассуждает против других агентов

CS221 охватывает все четыре. И, в отличие от большинства вводных курсов, которые останавливаются на уровне «нейросети — хорошо», этот курс идет дальше: в алгоритмы поиска, теорию игр, байесовскую вероятность, формальную логику и механику больших языковых моделей.

К концу вы не просто знаете, что ИИ работает. Вы знаете, почему он работает — и сколько стоит заставить его работать в масштабе.

Лекция 1: что такое интеллект на самом деле

Введение в строительные блоки ИИ и честный взгляд на то, откуда появилась эта область.

До первой строки кода или формулы CS221 задает обманчиво простой вопрос: что значит для машины быть интеллектуальной?

  • Ответ оказывается длинной историей неправильных ответов.
  • От имитационной игры Алана Тьюринга до символического ИИ, от экспертных систем на правилах до статистического обучения и эпохи deep learning, в которой мы живем сейчас: каждое поколение считало, что взломало интеллект, и каждое поколение было частично право.

Лекция вводит тензоры как атомарную единицу современного машинного обучения: многомерные массивы, которые переносят все — от значений пикселей до word embeddings — через каждый слой каждой модели, которой вы когда-либо пользовались.

Оригинальное видео


Лекция 2: как машины на самом деле учатся. Часть I

Математика и механика машинного обучения: линейная регрессия, функции потерь и градиентный спуск.

Вот здесь начинается настоящая работа.

Обучение в математическом смысле состоит из трех компонентов:

  • Класс гипотез — пространство возможных предсказателей, которыми может стать модель
  • Функция потерь — способ измерить, насколько ошибается текущий предсказатель
  • Алгоритм оптимизации — метод сделать его менее ошибочным

Рабочая лошадка всех трех — градиентный спуск: двигайтесь в направлении, которое уменьшает ошибку, и повторяйте, пока больше нельзя улучшить результат.

Лекция глубоко разбирает вычислительные графы и backpropagation — механизм, который делает обучение нейронных сетей возможным без ручного вычисления производных для каждого параметра.

Это двигатель под капотом каждой современной AI-системы, и большинство людей, использующих такие системы, никогда на него не смотрели.

Оригинальное видео


Лекция 3: как учить машины классифицировать. Часть II

От регрессии к классификации: как ИИ учится отличать одно от другого.

Регрессия предсказывает числа. Классификация предсказывает категории. Переход между ними менее очевиден, чем кажется.

Главная проблема: естественная функция потерь для классификации — просто считать неправильные ответы — математически бесполезна для градиентного спуска. Нельзя оптимизировать обрыв.

Решение — вероятностные классификаторы:

  • Для бинарных задач: логистическая функция превращает сырые scores в вероятности, а logistic loss дает гладкую поверхность для спуска
  • Для многоклассовых задач: softmax обобщает это на любое число категорий вместе с cross-entropy loss

Это математический фундамент каждого классификатора — от спам-фильтров до последнего слоя GPT.

Оригинальное видео


Лекция 4: deep learning — когда одного слоя недостаточно

Как стек слоев создает системы, которые учат собственные признаки, и какие трюки не дают обучению развалиться.

Один линейный слой, сколько бы параметров в нем ни было, может выучить только линейные зависимости. Мир не линеен.

Исправление жестко простое: сложите слои, добавьте между ними нелинейности вроде ReLU — просто max(0, x) — и внезапно сеть сможет приблизить любую функцию, какую вы захотите.

Но у глубоких сетей есть проблемы. Чем глубже вы идете, тем сложнее градиентам проходить назад во время обучения: они исчезают или взрываются еще до того, как доберутся до ранних слоев.

Инженерные решения, которые сделали современное deep learning возможным:

  • Residual connections — пропускать слои, чтобы у градиентов был короткий путь
  • Layer normalization — держать активации в здоровом диапазоне
  • Аккуратная инициализация весов — стартовать в правильной окрестности
  • SGD с mini-batches — получать плюсы градиентов по всему датасету без полной цены

Это не академические фокусы. Именно поэтому работают трансформеры.

Оригинальное видео


Лекция 5: поиск — когда думать лучше, чем реагировать

Как ИИ планирует наперед в детерминированных средах, где полный перебор слишком медленный.

Не каждую задачу можно решить распознаванием шаблонов. Некоторые требуют рассуждения: продумать последовательность действий до того, как выбрать одно.

CS221 формализует это как задачу поиска: есть состояния, действия, переходы и стоимости. Вам нужен путь с минимальной стоимостью к цели.

Три подхода, в порядке роста «умности»:

  • Полный перебор — проверить все, работает только на крошечных задачах
  • Динамическое программирование — кэшировать решения подзадач, чтобы не решать одно и то же дважды
  • Эвристический поиск — использовать приблизительные оценки, чтобы вообще не смотреть на большие части пространства

Лекция напрямую связывает это с test-time compute в современных языковых моделях: та же логика поиска, которая находит кратчайшие пути на картах, позволяет LLM думать дольше перед ответом.

Оригинальное видео


Лекция 6: поиск в циклах — A* и искусство умных сокращений

Продвинутый поиск для сред, где пути могут возвращаться к уже посещенным состояниям.

Стандартное динамическое программирование ломается, когда в графах есть циклы. Если можно возвращаться в состояния, можно застрять в бесконечных петлях.

  • Решение — Uniform Cost Search (UCS): исследовать состояния в порядке роста стоимости пути, используя priority queue. Он гарантированно находит оптимальное решение. И гарантированно медленный, когда пространство большое.
  • Появляется A* Search: возьмите UCS и добавьте эвристику — оценку оставшейся стоимости до цели. Если оценка согласована, то есть никогда не завышает стоимость и удовлетворяет неравенству треугольника, A* одновременно оптимален и намного быстрее UCS.
  • Откуда берутся хорошие эвристики? Из расслабленных задач: уберите ограничения из исходной задачи, решите более легкую версию и используйте это решение как оценку.

Идея элегантна: решение более простой версии вашей задачи всегда является нижней границей истинной стоимости.

Оригинальное видео


Лекция 7: марковские процессы принятия решений — когда мир не сотрудничает

Принятие решений в средах, где исходы вероятностны, а не гарантированы.

Реальные среды не ведут себя как шахматная доска. Вы делаете действие, а результат неопределен: дорога обледенела, рынок сдвинулся, сообщение не дошло.

Марковские процессы принятия решений (MDP) моделируют это напрямую: каждое действие создает распределение возможных следующих состояний, каждое со своей вероятностью. Вы не можете гарантировать исходы. Вы можете только максимизировать ожидаемую ценность.

Ключевые понятия:

  • Policy сопоставляет каждому состоянию действие — это полная стратегия принятия решений
  • Policy evaluation вычисляет ожидаемую долгосрочную награду заданной policy
  • Value iteration находит оптимальную policy, итеративно улучшая оценки value до сходимости

Это математическая основа каждой AI-системы, которая работает в неопределенных средах: от роботов до рекомендательных систем и всего, что взаимодействует с реальным миром.

Оригинальное видео


Лекция 8: reinforcement learning — учить правила, играя в игру

Как ИИ учится действовать оптимально, когда никто не сообщает ему правила.

MDP предполагают, что вы знаете вероятности переходов и награды. В reinforcement learning вы их не знаете. Агент должен выяснить их, напрямую взаимодействуя со средой.

Два широких подхода:

  • Model-based RL: наблюдать достаточно взаимодействий, чтобы оценить MDP, а затем применить value iteration к своей оценке
  • Model-free RL: полностью пропустить модель и оценивать value functions напрямую из опыта

Model-free методы в лекции разбиты на два вида:

  • Monte Carlo: запускать полные эпизоды и усреднять returns
  • Temporal Difference (TD): bootstrapping — обновлять оценки на основе других оценок, не дожидаясь конца эпизода

Q-learning — off-policy версия — оценивает value function оптимальной policy независимо от того, как агент фактически ведет себя. Это алгоритм за ранними агентами, игравшими в Atari, и концептуальный предок современного RLHF.

Оригинальное видео


Лекция 9: policy gradients — RL в масштабе

Как reinforcement learning работает с реальным миром, где пространства состояний слишком велики, чтобы их перечислить.

Q-learning с таблицей работает, когда состояния можно пересчитать. Изображения, текст и показания сенсоров так не устроены. Нужна аппроксимация функций: параметризовать Q-values нейронной сетью.

Но это создает новую нестабильность. Лекция вводит методы Policy Gradient как альтернативу: вместо обучения value functions напрямую оптимизировать policy.

Алгоритм REINFORCE делает это, рассматривая policy как распределение вероятностей по действиям и сдвигая ее к действиям, которые дали высокие награды.

Два улучшения, которые делают это практичным:

  • Baselines: вычитать опорную награду, чтобы уменьшить дисперсию без внесения смещения
  • Actor-Critic: объединить policy gradients с обученной value function, чтобы получать менее шумные оценки в реальном времени

Это строительные блоки каждого современного RLHF pipeline, включая fine-tuning за ChatGPT.

Оригинальное видео


Лекция 10: игры — стратегическое рассуждение против противника

Как ИИ думает на несколько ходов вперед, когда кто-то активно пытается его победить.

Игры формализуют новый тип задачи: среда включает другого агента, который тоже оптимизирует — против вас.

В играх с двумя игроками и нулевой суммой выигрыш одного игрока ровно равен проигрышу другого. Оптимальная стратегия следует отсюда:

  • Minimax: предполагайте, что соперник играет идеально, и минимизируйте свой максимально возможный проигрыш
  • Expectimax: если policy соперника известна и несовершенна, берите ожидаемые значения вместо минимумов
  • Alpha-beta pruning: отсекайте ветви игрового дерева, которые не могут повлиять на оптимальное решение, резко уменьшая вычисления без потери оптимальности

Лекция делает аккуратное наблюдение: tree search, который вы используете для шахмат и Go, структурно идентичен алгоритмам планирования из предыдущих лекций. Игра просто добавляет узел противника.

Оригинальное видео


Лекция 11: AlphaGo, равновесия Нэша и дилемма заключенного

Продвинутая теория игр: от обучения через self-play до одновременных игр, где сотрудничество разваливается.

Эта лекция связывает reinforcement learning с игрой на мировом уровне.

TD-learning в self-play: играйте против себя, используйте temporal difference updates, чтобы улучшать оценочную функцию. Именно так TD-Gammon победил чемпионов мира по бэкгэммону в 1990-х, и это концептуальный чертеж policy network AlphaGo.

Затем курс расширяет рамку:

  • Одновременные игры: оба игрока ходят одновременно, ни один не знает выбор другого. Чистые стратегии часто проигрывают эксплуатации — нужны смешанные стратегии, распределения вероятностей по действиям
  • Теорема minimax: для каждой конечной игры с нулевой суммой существует единственное равновесное значение, которое оба игрока могут гарантировать правильной смешанной стратегией
  • Равновесие Нэша: в играх с ненулевой суммой, например в дилемме заключенного, рациональное индивидуальное поведение может приводить к коллективно ужасным результатам

Последний пункт — не просто теория игр. Это причина, по которой AI alignment сложен.

Оригинальное видео


Это была часть I

Одиннадцать лекций. Полная математическая и вычислительная основа ИИ.

Теперь вы понимаете, как машины учатся, как они планируют, как они работают с неопределенностью и как стратегически рассуждают против других агентов.

Часть II

Она покрывает остальную программу: байесовские сети, вероятностный вывод, формальную логику, внутреннюю механику больших языковых моделей, социальные риски, которые почти никто не закладывает в цену, и глобальную цепочку поставок, которая определяет, кто вообще может строить ИИ.

Если это было полезно — подпишитесь на @polydao, добавьте материал в закладки и отправьте его тому, кто хочет понять ИИ по-настоящему.


Где найти полный курс

Полный курс CS221 и сотни других лекций Stanford можно посмотреть здесь: youtube.com/@stanfordonline

  • Все, что описано в этой статье, есть там полностью и бесплатно.
  • Без paywall. Без зачисления. Без студенческих кредитов.
  • Просто настоящая программа Stanford, доступная любому человеку с интернетом.

И, учитывая все, что мы обсуждали о стоимости формального образования, кажется, именно в этом и смысл.

Subscribe to Temperature 0.7 - AI блог об AI и роботах

Don’t miss out on the latest issues. Sign up now to get access to the library of members-only issues.
jamie@example.com
Subscribe