Теория информации для машинного обучения, Куликов В., 2026.
Фрагмент из книги.
В 1948 году Клод Шеннон строил не просто теорию передачи по телеграфному проводу, а общий язык для источников, кодов и шумных каналов. Инженерный вопрос звучал почти вызывающе просто: какой минимальный ресурс нужен, чтобы передать сообщение надёжно? Чтобы на него ответить, требовалось научиться измерять неопределенность до того, как сообщение пришло.

Основной маршрут и второй проход.
В каждом модуле есть основной ML-маршрут и явно помеченные математические углубления. Основной маршрут начинается с узнаваемой задачи, вводит минимально необходимую математику и возвращается к моделям, данным или обучению. Углубление сохраняет полное доказательство, более общие условия и контрпримеры, но не служит входным экзаменом.
В этом модуле разделение уже работает на практике. Чтобы идти дальше, достаточно различать вероятность, неожиданность и смысл, понимать область действия шенноновского фрейма и увидеть короткий логарифмический механизм из §1.3. Полный вывод формулы энтропии ценен, но лучше читать его вторым слоем — после того, как энтропия стала знакомым рабочим объектом.
ОГЛАВЛЕНИЕ.
Модуль 1. Введение.
1.1. Информация и смысл: почему это не одно и то же.
1.2. Шенноновский фрейм: сила и ограничения.
1.3. Почему появляется логарифм: короткий мост к энтропии.
1.4. Как устроен курс и как его читать.
1.5. Обзор программы курса.
1.6. Литература: с чего начинать.
1.7. Справочная заметка: convex / concave (выпуклая / вогнутая функция).
1.8. Справочник: подробная программа курса.
1.9. Справочник: полный аннотированный список литературы.
1.10. Факультативное математическое углубление I: равномерный источник.
1.11. Факультативное математическое углубление II: от группировки к формуле Шеннона.
Модуль 2. Энтропия.
2.1. Энтропия: средний счёт за неопределённость.
2.2. Цепное правило: как разбить один счёт на токены.
2.3. От монеты к языку: энтропийная скорость.
2.4. Как читать энтропию языковой модели.
2.6. Литература и первоисточники.
Модуль 3. Кросс-энтропия и KL-дивергенция.
3.1. Модель отвечает распределением, мир — одним исходом.
3.2. Кросс-энтропия: средний счёт по вероятностям модели.
3.3. KL-дивергенция: часть потери, за которую отвечает модель.
3.4. Чужой код: как KL превращается в лишние биты.
3.5. Одна формула для классификации и языковой модели.
3.6. Почему CrossEntropyLoss так удобно оптимизировать.
3.7. Перплексия: возврат из логарифмической шкалы.
3.8. Математическое углубление: почему направление KL меняет ответ.
3.9. Карта KL-целевых функций в ML.
3.11. Литература и первоисточники.
Модуль 4. Неравенство Йенсена: когда среднее встречает нелинейность.
4.1. Сначала усреднить или сначала посчитать функцию потерь?.
4.2. Неравенство Йенсена: направление задаёт кривизна.
4.3. Ансамбли: точная гарантия для log-loss.
4.4. ELBO: логарифм стоит снаружи скрытых объяснений.
4.5. Log-sum inequality: что теряется при объединении состояний.
4.6. Одна теорема — четыре рабочих механизма.
4.7. Ключевые выводы модуля.
4.9. Литература и первоисточники.
Модуль 5. Взаимная информация: сколько один объект говорит о другом.
5.1. Признак полезен не сам по себе.
5.2. Одна величина — три чтения.
5.3. PMI: локальный логарифм связи.
5.4. Условная MI: что новый признак добавляет сверх известных.
5.5. DPI: энкодер может перепаковать информацию, но не напечатать новые биты.
5.6. MI, корреляция и причинность отвечают на разные вопросы.
5.7. Шумные метки: когда 100% ошибок всё ещё несут один бит.
5.8. Отбор признаков: полезный фильтр, но не оракул.
5.9. InfoNCE: найти согласованную пару среди случайных.
5.10. Почему число MI трудно получить из выборки.
5.11. Энтропия attention — не взаимная информация.
5.12. Ключевые выводы модуля.
5.14. Источники и дальнейшее чтение.
Модуль 6. Кодирование источника: от энтропии к реальным битам.
6.1. Инженерная постановка: вероятностная модель и энтропийный кодер.
6.2. Префиксные коды и неравенство Крафта—Макмиллана.
6.3. Односимвольная теорема кодирования.
6.4. Хаффман, арифметическое кодирование и кодирование диапазонов.
6.5. Длинные последовательности: блочное кодирование, AEP и энтропийная скорость.
6.6. Метрики языковой модели: PPL, BPC и BPB.
6.7. Языковая модель как часть компрессора.
6.8. Размер модели, законы масштабирования и полная длина описания.
6.9. Математическое углубление: универсальное кодирование, последовательная логарифмическая потеря и ICL.
6.10. Связь качества сжатия и возможностей модели.
6.11. Практический протокол оценки LLM как компрессора.
6.13. Заключение.
Основные источники.
Модуль 7. Канал и пропускная способность.
7.1. Надёжная передача через шум.
7.2. Дискретный канал без памяти и блочный код.
7.3. Пропускная способность дискретного канала.
7.4. BSC, BEC и Z-канал.
7.5. Гауссовский канал и ограничение мощности.
7.6. Почему случайное кодирование достигает ???? < ????(????; ????).
7.7. Обратная теорема и конечная длина блока.
7.8. Шумные метки как канал.
7.9. Канальное кодирование в ML: ECOC и DeepJSCC.
7.10. LLM как канал: точная постановка и границы аналогии.
7.11. Как формализовать канал в ML-системе.
7.13. Заключение.
Основные источники.
Модуль 8. Максимальная энтропия, экспоненциальные модели и KL-регуляризация.
8.1. От неполного знания к распределению.
8.2. Экспоненциальный наклон и информационная проекция.
8.3. Пространство состояний и базовая мера.
8.4. Классические MaxEnt-распределения и AWGN-канал.
8.5. Условный MaxEnt и лог-линейные модели.
8.6. Softmax как решение задачи «оценка + энтропия».
8.7. Энергетические модели и нормировочная константа.
8.8. KL-регуляризованная политика и Gibbs-оптимум.
8.9. Переоптимизация награды и роль KL.
8.10. Математическое углубление: экспоненциальные семейства и достаточность.
8.12. Заключение.
Основные источники.
Модуль 9. Скорость–искажение и Information Bottleneck: как управлять потерей информации.
9.1. Зачем модели забывать.
9.2. Теория скорости–искажения: сколько информации нужно сохранить.
9.3. Information Bottleneck: сохранить то, что важно для ????.
9.4. Variational Information Bottleneck: как сделать IB обучаемым.
9.5. VAE как система скорость–искажение.
9.6. Когда скорость становится реальными битами.
9.7. Как построить честную кривую скорость–искажение.
9.8. Информационная плоскость: цель обучения или описание динамики?.
9.9. Математическое углубление: I–MMSE и гауссовское зашумление.
9.11. Ключевые выводы модуля.
Основные источники.
Модуль 10. Алгоритмическая теория информации: кратчайшие описания, MDL и универсальное предсказание.
10.1. От распределения к одному конкретному объекту.
10.2. Колмогоровская сложность и язык описания.
10.3. Несжимаемость, невычислимость и реальные компрессоры.
10.4. Связь с энтропией Шеннона.
10.5. Алгоритмическая вероятность и универсальное предсказание.
10.6. MDL в машинном обучении.
10.7. Сходство через совместное сжатие.
10.8. LLM и универсальное предсказание.
10.9. Математическое углубление: AIXI.
10.10. Факультативный физический мост: принцип Ландауэра.
10.12. Ключевые выводы модуля.
Основные источники.
Модуль 11. Сравнение распределений: f-дивергенции, вариационные критики и расстояние Вассерштейна.
11.1. От двух выборок к задаче сравнения распределений.
11.2. f-дивергенции: одна схема, разные штрафы.
11.3. Какие различия видят f-дивергенции.
11.4. Классификатор оценивает отношение плотностей.
11.5. Вариационная форма: как сделать расхождение обучаемым.
11.6. GAN и f-GAN.
11.7. MINE и InfoNCE.
11.8. Интегральные вероятностные метрики: расстояние Вассерштейна и MMD.
11.9. Выбор расхождения в практической задаче.
11.10. Математическое углубление: общая мера и точная двойственность.
11.12. Заключение.
Основные источники.
Модуль 12. Информационные границы обобщения: PAC-Bayes и взаимная информация.
12.1. Почему лучшая обучающая ошибка почти неизбежно слишком хороша.
12.2. От фиксированной модели к адаптивному выбору.
12.3. PAC-Bayes: распределение до данных и распределение после обучения.
12.4. PAC-Bayes-kl: сертификат для конкретной выборки.
12.5. От сертификата к обучаемому распределению.
12.6. MI-границы: обучение как канал от выборки к модели.
12.7. Точное разложение, связывающее PAC-Bayes и MI.
12.8. Связи с MDL, Information Bottleneck и KL-регуляризованными политиками.
12.9. Как построить практический PAC-Bayes-сертификат.
12.10. Математическое углубление: более локальные информационные цены.
12.12. Ключевые выводы модуля.
Основные источники.
Модуль 13. Рассуждение в LLM: вычисление, поиск и информация.
13.1. Что меняется, когда модель «думает дольше».
13.2. Амортизация, рабочий черновик и поиск.
13.3. Почему промежуточные токены могут помогать.
13.4. Новая информация или новое вычисление?.
13.5. Что можно измерять по шагам.
13.6. Одна длинная траектория или много кандидатов?.
13.7. In-context learning: когда контекст действительно приносит данные.
13.8. Как модели учатся рассуждать.
13.9. Как оценивать систему рассуждения.
13.10. Что доказано, что наблюдается и что пока служит гипотезой.
13.11. Математическое углубление: пошаговый информационный прирост.
13.13. Заключение: информация не заменяет вычисление.
Основные источники.
Модуль 14. Компьютерное зрение через теорию информации.
14.1. Почему компьютерное зрение — хороший полигон для теории информации.
14.2. Нейронное сжатие изображений: энтропийная модель и реальный поток битов.
14.3. Искажение и перцептивное качество.
14.4. Диффузионные модели: гауссовское зашумление, денойзинг и I–MMSE.
14.5. CLIP и контрастивное выравнивание изображений с текстом.
14.6. Самообучение визуальных представлений: инвариантности и защита от коллапса.
14.7. Сжатие CV-модели: квантизация, pruning и distillation.
14.8. Один CV-пайплайн, четыре разных информационных бюджета.
14.9. Математическое углубление: два точных расчёта.
14.11. Заключение.
Основные источники.
Модуль 15. Информационная геометрия: Fisher, естественный градиент и потоки распределений.
15.1. Что значит «маленький шаг» для вероятностной модели.
15.2. Информация Фишера и локальная форма KL.
15.3. Естественный градиент: наискорейший спуск при малом изменении модели.
15.4. Что именно называют «кривизной» в глубокой сети.
15.5. Геометрия политик: NPG, TRPO, PPO и KL в RLHF.
15.6. Wasserstein-геометрия и потоки распределений.
15.7. Экспоненциальные семейства, двойственные координаты и зеркальный спуск.
15.8. Практическая карта: сначала выберите объект, затем геометрию.
15.9. Математическое углубление: α-геометрия и точные примеры.
15.11. Заключение.
Основные источники.
Модуль 16. Памятка по курсу.
16.1. Памятка по курсу: ключевые идеи и формулы.
Бесплатно скачать электронную книгу в удобном формате, смотреть и читать:
Скачать книгу Теория информации для машинного обучения, Куликов В., 2026 - fileskachat.com, быстрое и бесплатное скачивание.
Скачать pdf
Ниже можно купить эту книгу, если она есть в продаже, и похожие книги по лучшей цене со скидкой с доставкой по всей России.Купить книги
Скачать - pdf - Яндекс.Диск.
Дата публикации:
Теги: учебник по математике :: математика :: Куликов
Смотрите также учебники, книги и учебные материалы:
Предыдущие статьи:








