Чему на самом деле учат студентов Stanford про ИИ. Большинство людей этого никогда не видит. Часть I
Полный перевод X Article о курсе Stanford CS221: математические основы ИИ, обучение, поиск, принятие решений, RL и теория игр.
Источник: пост Iron Giant в X и процитированная X Article Mr. Buzzoni. Черновик подготовлен как полный перевод материала на русский.
Контекст исходного поста
Iron Giant пишет, что пока большинство спорит о prompt engineering, лучшие команды переходят к петлям: архитектурам, где сотни агентов проходят тысячи проверяемых шагов по нескольким live-feed источникам без постоянных человеческих подсказок.
Ключевая мысль поста: ценность не в количестве агентов, а в архитектуре цикла. Автор выделяет три проверки каждого шага, постоянное обновление контекста из пяти живых потоков данных, checkpoint состояния после каждого шага и отсутствие очереди ручных промптов: система сама ставит себе следующие действия.
Оригинальное видео из исходного поста
Чему на самом деле учат студентов Stanford про ИИ. Большинство людей этого никогда не видит. Часть I
11 лекций. Полная математическая основа искусственного интеллекта: от того, как машины учатся, до того, как они играют, принимают решения и рассуждают в условиях неопределенности.
Я пересмотрел очень много материалов об ИИ
Большинство из них попадает в одну из двух ловушек.
Либо это слишком поверхностно — «ИИ похож на мозг, он учится на данных, вау, удивительно», — либо настолько плотно, что нужен PhD, чтобы просто разобрать введение.
Stanford Computer Science 221 — не такой курс.
Это самая ясная и полная карта того, как на самом деле работает искусственный интеллект, которую я нашел. Не только математика. Не только философия. Вся картина: от первых принципов машинного обучения до теории игр, вероятностного рассуждения и механики больших языковых моделей.
Всего двадцать лекций. Я разбиваю материал на две части.
Это часть I: математическая и вычислительная основа. Лекции с 1 по 11 — обучение, поиск, принятие решений и стратегическое рассуждение.
Часть II выйдет на следующей неделе: байесовские сети, логика, большие языковые модели и геополитика AI-инфраструктуры.
Начнем.

Чему этот курс на самом деле учит
Большинство людей думает, что ИИ — это что-то одно. Это не так.
Это четыре вещи, работающие вместе:
- Машинное обучение — как системы извлекают закономерности из данных
- Поиск и планирование — как ИИ рассуждает через последовательности действий
- Принятие решений в условиях неопределенности — как он действует, когда исходы не гарантированы
- Теория игр — как он рассуждает против других агентов
CS221 охватывает все четыре. И, в отличие от большинства вводных курсов, которые останавливаются на уровне «нейросети — хорошо», этот курс идет дальше: в алгоритмы поиска, теорию игр, байесовскую вероятность, формальную логику и механику больших языковых моделей.
К концу вы не просто знаете, что ИИ работает. Вы знаете, почему он работает — и сколько стоит заставить его работать в масштабе.
Лекция 1: что такое интеллект на самом деле
Введение в строительные блоки ИИ и честный взгляд на то, откуда появилась эта область.
До первой строки кода или формулы CS221 задает обманчиво простой вопрос: что значит для машины быть интеллектуальной?
- Ответ оказывается длинной историей неправильных ответов.
- От имитационной игры Алана Тьюринга до символического ИИ, от экспертных систем на правилах до статистического обучения и эпохи deep learning, в которой мы живем сейчас: каждое поколение считало, что взломало интеллект, и каждое поколение было частично право.
Лекция вводит тензоры как атомарную единицу современного машинного обучения: многомерные массивы, которые переносят все — от значений пикселей до word embeddings — через каждый слой каждой модели, которой вы когда-либо пользовались.
Лекция 2: как машины на самом деле учатся. Часть I
Математика и механика машинного обучения: линейная регрессия, функции потерь и градиентный спуск.
Вот здесь начинается настоящая работа.
Обучение в математическом смысле состоит из трех компонентов:
- Класс гипотез — пространство возможных предсказателей, которыми может стать модель
- Функция потерь — способ измерить, насколько ошибается текущий предсказатель
- Алгоритм оптимизации — метод сделать его менее ошибочным
Рабочая лошадка всех трех — градиентный спуск: двигайтесь в направлении, которое уменьшает ошибку, и повторяйте, пока больше нельзя улучшить результат.
Лекция глубоко разбирает вычислительные графы и backpropagation — механизм, который делает обучение нейронных сетей возможным без ручного вычисления производных для каждого параметра.
Это двигатель под капотом каждой современной AI-системы, и большинство людей, использующих такие системы, никогда на него не смотрели.
Лекция 3: как учить машины классифицировать. Часть II
От регрессии к классификации: как ИИ учится отличать одно от другого.
Регрессия предсказывает числа. Классификация предсказывает категории. Переход между ними менее очевиден, чем кажется.
Главная проблема: естественная функция потерь для классификации — просто считать неправильные ответы — математически бесполезна для градиентного спуска. Нельзя оптимизировать обрыв.
Решение — вероятностные классификаторы:
- Для бинарных задач: логистическая функция превращает сырые scores в вероятности, а logistic loss дает гладкую поверхность для спуска
- Для многоклассовых задач: softmax обобщает это на любое число категорий вместе с cross-entropy loss
Это математический фундамент каждого классификатора — от спам-фильтров до последнего слоя GPT.
Лекция 4: deep learning — когда одного слоя недостаточно
Как стек слоев создает системы, которые учат собственные признаки, и какие трюки не дают обучению развалиться.
Один линейный слой, сколько бы параметров в нем ни было, может выучить только линейные зависимости. Мир не линеен.
Исправление жестко простое: сложите слои, добавьте между ними нелинейности вроде ReLU — просто max(0, x) — и внезапно сеть сможет приблизить любую функцию, какую вы захотите.
Но у глубоких сетей есть проблемы. Чем глубже вы идете, тем сложнее градиентам проходить назад во время обучения: они исчезают или взрываются еще до того, как доберутся до ранних слоев.
Инженерные решения, которые сделали современное deep learning возможным:
- Residual connections — пропускать слои, чтобы у градиентов был короткий путь
- Layer normalization — держать активации в здоровом диапазоне
- Аккуратная инициализация весов — стартовать в правильной окрестности
- SGD с mini-batches — получать плюсы градиентов по всему датасету без полной цены
Это не академические фокусы. Именно поэтому работают трансформеры.
Лекция 5: поиск — когда думать лучше, чем реагировать
Как ИИ планирует наперед в детерминированных средах, где полный перебор слишком медленный.
Не каждую задачу можно решить распознаванием шаблонов. Некоторые требуют рассуждения: продумать последовательность действий до того, как выбрать одно.
CS221 формализует это как задачу поиска: есть состояния, действия, переходы и стоимости. Вам нужен путь с минимальной стоимостью к цели.
Три подхода, в порядке роста «умности»:
- Полный перебор — проверить все, работает только на крошечных задачах
- Динамическое программирование — кэшировать решения подзадач, чтобы не решать одно и то же дважды
- Эвристический поиск — использовать приблизительные оценки, чтобы вообще не смотреть на большие части пространства
Лекция напрямую связывает это с test-time compute в современных языковых моделях: та же логика поиска, которая находит кратчайшие пути на картах, позволяет LLM думать дольше перед ответом.
Лекция 6: поиск в циклах — A* и искусство умных сокращений
Продвинутый поиск для сред, где пути могут возвращаться к уже посещенным состояниям.
Стандартное динамическое программирование ломается, когда в графах есть циклы. Если можно возвращаться в состояния, можно застрять в бесконечных петлях.
- Решение — Uniform Cost Search (UCS): исследовать состояния в порядке роста стоимости пути, используя priority queue. Он гарантированно находит оптимальное решение. И гарантированно медленный, когда пространство большое.
- Появляется A* Search: возьмите UCS и добавьте эвристику — оценку оставшейся стоимости до цели. Если оценка согласована, то есть никогда не завышает стоимость и удовлетворяет неравенству треугольника, A* одновременно оптимален и намного быстрее UCS.
- Откуда берутся хорошие эвристики? Из расслабленных задач: уберите ограничения из исходной задачи, решите более легкую версию и используйте это решение как оценку.
Идея элегантна: решение более простой версии вашей задачи всегда является нижней границей истинной стоимости.
Лекция 7: марковские процессы принятия решений — когда мир не сотрудничает
Принятие решений в средах, где исходы вероятностны, а не гарантированы.
Реальные среды не ведут себя как шахматная доска. Вы делаете действие, а результат неопределен: дорога обледенела, рынок сдвинулся, сообщение не дошло.
Марковские процессы принятия решений (MDP) моделируют это напрямую: каждое действие создает распределение возможных следующих состояний, каждое со своей вероятностью. Вы не можете гарантировать исходы. Вы можете только максимизировать ожидаемую ценность.
Ключевые понятия:
- Policy сопоставляет каждому состоянию действие — это полная стратегия принятия решений
- Policy evaluation вычисляет ожидаемую долгосрочную награду заданной policy
- Value iteration находит оптимальную policy, итеративно улучшая оценки value до сходимости
Это математическая основа каждой AI-системы, которая работает в неопределенных средах: от роботов до рекомендательных систем и всего, что взаимодействует с реальным миром.
Лекция 8: reinforcement learning — учить правила, играя в игру
Как ИИ учится действовать оптимально, когда никто не сообщает ему правила.
MDP предполагают, что вы знаете вероятности переходов и награды. В reinforcement learning вы их не знаете. Агент должен выяснить их, напрямую взаимодействуя со средой.
Два широких подхода:
- Model-based RL: наблюдать достаточно взаимодействий, чтобы оценить MDP, а затем применить value iteration к своей оценке
- Model-free RL: полностью пропустить модель и оценивать value functions напрямую из опыта
Model-free методы в лекции разбиты на два вида:
- Monte Carlo: запускать полные эпизоды и усреднять returns
- Temporal Difference (TD): bootstrapping — обновлять оценки на основе других оценок, не дожидаясь конца эпизода
Q-learning — off-policy версия — оценивает value function оптимальной policy независимо от того, как агент фактически ведет себя. Это алгоритм за ранними агентами, игравшими в Atari, и концептуальный предок современного RLHF.
Лекция 9: policy gradients — RL в масштабе
Как reinforcement learning работает с реальным миром, где пространства состояний слишком велики, чтобы их перечислить.
Q-learning с таблицей работает, когда состояния можно пересчитать. Изображения, текст и показания сенсоров так не устроены. Нужна аппроксимация функций: параметризовать Q-values нейронной сетью.
Но это создает новую нестабильность. Лекция вводит методы Policy Gradient как альтернативу: вместо обучения value functions напрямую оптимизировать policy.
Алгоритм REINFORCE делает это, рассматривая policy как распределение вероятностей по действиям и сдвигая ее к действиям, которые дали высокие награды.
Два улучшения, которые делают это практичным:
- Baselines: вычитать опорную награду, чтобы уменьшить дисперсию без внесения смещения
- Actor-Critic: объединить policy gradients с обученной value function, чтобы получать менее шумные оценки в реальном времени
Это строительные блоки каждого современного RLHF pipeline, включая fine-tuning за ChatGPT.
Лекция 10: игры — стратегическое рассуждение против противника
Как ИИ думает на несколько ходов вперед, когда кто-то активно пытается его победить.
Игры формализуют новый тип задачи: среда включает другого агента, который тоже оптимизирует — против вас.
В играх с двумя игроками и нулевой суммой выигрыш одного игрока ровно равен проигрышу другого. Оптимальная стратегия следует отсюда:
- Minimax: предполагайте, что соперник играет идеально, и минимизируйте свой максимально возможный проигрыш
- Expectimax: если policy соперника известна и несовершенна, берите ожидаемые значения вместо минимумов
- Alpha-beta pruning: отсекайте ветви игрового дерева, которые не могут повлиять на оптимальное решение, резко уменьшая вычисления без потери оптимальности
Лекция делает аккуратное наблюдение: tree search, который вы используете для шахмат и Go, структурно идентичен алгоритмам планирования из предыдущих лекций. Игра просто добавляет узел противника.
Лекция 11: AlphaGo, равновесия Нэша и дилемма заключенного
Продвинутая теория игр: от обучения через self-play до одновременных игр, где сотрудничество разваливается.
Эта лекция связывает reinforcement learning с игрой на мировом уровне.
TD-learning в self-play: играйте против себя, используйте temporal difference updates, чтобы улучшать оценочную функцию. Именно так TD-Gammon победил чемпионов мира по бэкгэммону в 1990-х, и это концептуальный чертеж policy network AlphaGo.
Затем курс расширяет рамку:
- Одновременные игры: оба игрока ходят одновременно, ни один не знает выбор другого. Чистые стратегии часто проигрывают эксплуатации — нужны смешанные стратегии, распределения вероятностей по действиям
- Теорема minimax: для каждой конечной игры с нулевой суммой существует единственное равновесное значение, которое оба игрока могут гарантировать правильной смешанной стратегией
- Равновесие Нэша: в играх с ненулевой суммой, например в дилемме заключенного, рациональное индивидуальное поведение может приводить к коллективно ужасным результатам
Последний пункт — не просто теория игр. Это причина, по которой AI alignment сложен.
Это была часть I
Одиннадцать лекций. Полная математическая и вычислительная основа ИИ.
Теперь вы понимаете, как машины учатся, как они планируют, как они работают с неопределенностью и как стратегически рассуждают против других агентов.
Часть II
Она покрывает остальную программу: байесовские сети, вероятностный вывод, формальную логику, внутреннюю механику больших языковых моделей, социальные риски, которые почти никто не закладывает в цену, и глобальную цепочку поставок, которая определяет, кто вообще может строить ИИ.
Если это было полезно — подпишитесь на @polydao, добавьте материал в закладки и отправьте его тому, кто хочет понять ИИ по-настоящему.

Где найти полный курс
Полный курс CS221 и сотни других лекций Stanford можно посмотреть здесь: youtube.com/@stanfordonline
- Все, что описано в этой статье, есть там полностью и бесплатно.
- Без paywall. Без зачисления. Без студенческих кредитов.
- Просто настоящая программа Stanford, доступная любому человеку с интернетом.
И, учитывая все, что мы обсуждали о стоимости формального образования, кажется, именно в этом и смысл.