Обучалка в Телеграм

Теория информации для машинного обучения, Куликов В., 2026

Подробнее о кнопках "Купить"

По кнопкам "Купить бумажную книгу" или "Купить электронную книгу" можно купить в официальных магазинах эту книгу, если она имеется в продаже, или похожую книгу. Результаты поиска формируются при помощи поисковых систем Яндекс и Google на основании названия и авторов книги.

Наш сайт не занимается продажей книг, этим занимаются вышеуказанные магазины. Мы лишь даем пользователям возможность найти эту или похожие книги в этих магазинах.

Список книг, которые предлагают магазины, можно увидеть перейдя на одну из страниц покупки, для этого надо нажать на одну из этих кнопок.


Теория информации для машинного обучения, Куликов В., 2026.
 
Фрагмент из книги.
В 1948 году Клод Шеннон строил не просто теорию передачи по телеграфному проводу, а общий язык для источников, кодов и шумных каналов. Инженерный вопрос звучал почти вызывающе просто: какой минимальный ресурс нужен, чтобы передать сообщение надёжно? Чтобы на него ответить, требовалось научиться измерять неопределенность до того, как сообщение пришло.

Теория информации для машинного обучения, Куликов В., 2026


Основной маршрут и второй проход.
В каждом модуле есть основной ML-маршрут и явно помеченные математические углубления. Основной маршрут начинается с узнаваемой задачи, вводит минимально необходимую математику и возвращается к моделям, данным или обучению. Углубление сохраняет полное доказательство, более общие условия и контрпримеры, но не служит входным экзаменом.

В этом модуле разделение уже работает на практике. Чтобы идти дальше, достаточно различать вероятность, неожиданность и смысл, понимать область действия шенноновского фрейма и увидеть короткий логарифмический механизм из §1.3. Полный вывод формулы энтропии ценен, но лучше читать его вторым слоем — после того, как энтропия стала знакомым рабочим объектом.

ОГЛАВЛЕНИЕ.
Модуль 1. Введение.
1.1. Информация и смысл: почему это не одно и то же.
1.2. Шенноновский фрейм: сила и ограничения.
1.3. Почему появляется логарифм: короткий мост к энтропии.
1.4. Как устроен курс и как его читать.
1.5. Обзор программы курса.
1.6. Литература: с чего начинать.
1.7. Справочная заметка: convex / concave (выпуклая / вогнутая функция).
1.8. Справочник: подробная программа курса.
1.9. Справочник: полный аннотированный список литературы.
1.10. Факультативное математическое углубление I: равномерный источник.
1.11. Факультативное математическое углубление II: от группировки к формуле Шеннона.
Модуль 2. Энтропия.
2.1. Энтропия: средний счёт за неопределённость.
2.2. Цепное правило: как разбить один счёт на токены.
2.3. От монеты к языку: энтропийная скорость.
2.4. Как читать энтропию языковой модели.
2.6. Литература и первоисточники.
Модуль 3. Кросс-энтропия и KL-дивергенция.
3.1. Модель отвечает распределением, мир — одним исходом.
3.2. Кросс-энтропия: средний счёт по вероятностям модели.
3.3. KL-дивергенция: часть потери, за которую отвечает модель.
3.4. Чужой код: как KL превращается в лишние биты.
3.5. Одна формула для классификации и языковой модели.
3.6. Почему CrossEntropyLoss так удобно оптимизировать.
3.7. Перплексия: возврат из логарифмической шкалы.
3.8. Математическое углубление: почему направление KL меняет ответ.
3.9. Карта KL-целевых функций в ML.
3.11. Литература и первоисточники.
Модуль 4. Неравенство Йенсена: когда среднее встречает нелинейность.
4.1. Сначала усреднить или сначала посчитать функцию потерь?.
4.2. Неравенство Йенсена: направление задаёт кривизна.
4.3. Ансамбли: точная гарантия для log-loss.
4.4. ELBO: логарифм стоит снаружи скрытых объяснений.
4.5. Log-sum inequality: что теряется при объединении состояний.
4.6. Одна теорема — четыре рабочих механизма.
4.7. Ключевые выводы модуля.
4.9. Литература и первоисточники.
Модуль 5. Взаимная информация: сколько один объект говорит о другом.
5.1. Признак полезен не сам по себе.
5.2. Одна величина — три чтения.
5.3. PMI: локальный логарифм связи.
5.4. Условная MI: что новый признак добавляет сверх известных.
5.5. DPI: энкодер может перепаковать информацию, но не напечатать новые биты.
5.6. MI, корреляция и причинность отвечают на разные вопросы.
5.7. Шумные метки: когда 100% ошибок всё ещё несут один бит.
5.8. Отбор признаков: полезный фильтр, но не оракул.
5.9. InfoNCE: найти согласованную пару среди случайных.
5.10. Почему число MI трудно получить из выборки.
5.11. Энтропия attention — не взаимная информация.
5.12. Ключевые выводы модуля.
5.14. Источники и дальнейшее чтение.
Модуль 6. Кодирование источника: от энтропии к реальным битам.
6.1. Инженерная постановка: вероятностная модель и энтропийный кодер.
6.2. Префиксные коды и неравенство Крафта—Макмиллана.
6.3. Односимвольная теорема кодирования.
6.4. Хаффман, арифметическое кодирование и кодирование диапазонов.
6.5. Длинные последовательности: блочное кодирование, AEP и энтропийная скорость.
6.6. Метрики языковой модели: PPL, BPC и BPB.
6.7. Языковая модель как часть компрессора.
6.8. Размер модели, законы масштабирования и полная длина описания.
6.9. Математическое углубление: универсальное кодирование, последовательная логарифмическая потеря и ICL.
6.10. Связь качества сжатия и возможностей модели.
6.11. Практический протокол оценки LLM как компрессора.
6.13. Заключение.
Основные источники.
Модуль 7. Канал и пропускная способность.
7.1. Надёжная передача через шум.
7.2. Дискретный канал без памяти и блочный код.
7.3. Пропускная способность дискретного канала.
7.4. BSC, BEC и Z-канал.
7.5. Гауссовский канал и ограничение мощности.
7.6. Почему случайное кодирование достигает ???? < ????(????; ????).
7.7. Обратная теорема и конечная длина блока.
7.8. Шумные метки как канал.
7.9. Канальное кодирование в ML: ECOC и DeepJSCC.
7.10. LLM как канал: точная постановка и границы аналогии.
7.11. Как формализовать канал в ML-системе.
7.13. Заключение.
Основные источники.
Модуль 8. Максимальная энтропия, экспоненциальные модели и KL-регуляризация.
8.1. От неполного знания к распределению.
8.2. Экспоненциальный наклон и информационная проекция.
8.3. Пространство состояний и базовая мера.
8.4. Классические MaxEnt-распределения и AWGN-канал.
8.5. Условный MaxEnt и лог-линейные модели.
8.6. Softmax как решение задачи «оценка + энтропия».
8.7. Энергетические модели и нормировочная константа.
8.8. KL-регуляризованная политика и Gibbs-оптимум.
8.9. Переоптимизация награды и роль KL.
8.10. Математическое углубление: экспоненциальные семейства и достаточность.
8.12. Заключение.
Основные источники.
Модуль 9. Скорость–искажение и Information Bottleneck: как управлять потерей информации.
9.1. Зачем модели забывать.
9.2. Теория скорости–искажения: сколько информации нужно сохранить.
9.3. Information Bottleneck: сохранить то, что важно для ????.
9.4. Variational Information Bottleneck: как сделать IB обучаемым.
9.5. VAE как система скорость–искажение.
9.6. Когда скорость становится реальными битами.
9.7. Как построить честную кривую скорость–искажение.
9.8. Информационная плоскость: цель обучения или описание динамики?.
9.9. Математическое углубление: I–MMSE и гауссовское зашумление.
9.11. Ключевые выводы модуля.
Основные источники.
Модуль 10. Алгоритмическая теория информации: кратчайшие описания, MDL и универсальное предсказание.
10.1. От распределения к одному конкретному объекту.
10.2. Колмогоровская сложность и язык описания.
10.3. Несжимаемость, невычислимость и реальные компрессоры.
10.4. Связь с энтропией Шеннона.
10.5. Алгоритмическая вероятность и универсальное предсказание.
10.6. MDL в машинном обучении.
10.7. Сходство через совместное сжатие.
10.8. LLM и универсальное предсказание.
10.9. Математическое углубление: AIXI.
10.10. Факультативный физический мост: принцип Ландауэра.
10.12. Ключевые выводы модуля.
Основные источники.
Модуль 11. Сравнение распределений: f-дивергенции, вариационные критики и расстояние Вассерштейна.
11.1. От двух выборок к задаче сравнения распределений.
11.2. f-дивергенции: одна схема, разные штрафы.
11.3. Какие различия видят f-дивергенции.
11.4. Классификатор оценивает отношение плотностей.
11.5. Вариационная форма: как сделать расхождение обучаемым.
11.6. GAN и f-GAN.
11.7. MINE и InfoNCE.
11.8. Интегральные вероятностные метрики: расстояние Вассерштейна и MMD.
11.9. Выбор расхождения в практической задаче.
11.10. Математическое углубление: общая мера и точная двойственность.
11.12. Заключение.
Основные источники.
Модуль 12. Информационные границы обобщения: PAC-Bayes и взаимная информация.
12.1. Почему лучшая обучающая ошибка почти неизбежно слишком хороша.
12.2. От фиксированной модели к адаптивному выбору.
12.3. PAC-Bayes: распределение до данных и распределение после обучения.
12.4. PAC-Bayes-kl: сертификат для конкретной выборки.
12.5. От сертификата к обучаемому распределению.
12.6. MI-границы: обучение как канал от выборки к модели.
12.7. Точное разложение, связывающее PAC-Bayes и MI.
12.8. Связи с MDL, Information Bottleneck и KL-регуляризованными политиками.
12.9. Как построить практический PAC-Bayes-сертификат.
12.10. Математическое углубление: более локальные информационные цены.
12.12. Ключевые выводы модуля.
Основные источники.
Модуль 13. Рассуждение в LLM: вычисление, поиск и информация.
13.1. Что меняется, когда модель «думает дольше».
13.2. Амортизация, рабочий черновик и поиск.
13.3. Почему промежуточные токены могут помогать.
13.4. Новая информация или новое вычисление?.
13.5. Что можно измерять по шагам.
13.6. Одна длинная траектория или много кандидатов?.
13.7. In-context learning: когда контекст действительно приносит данные.
13.8. Как модели учатся рассуждать.
13.9. Как оценивать систему рассуждения.
13.10. Что доказано, что наблюдается и что пока служит гипотезой.
13.11. Математическое углубление: пошаговый информационный прирост.
13.13. Заключение: информация не заменяет вычисление.
Основные источники.
Модуль 14. Компьютерное зрение через теорию информации.
14.1. Почему компьютерное зрение — хороший полигон для теории информации.
14.2. Нейронное сжатие изображений: энтропийная модель и реальный поток битов.
14.3. Искажение и перцептивное качество.
14.4. Диффузионные модели: гауссовское зашумление, денойзинг и I–MMSE.
14.5. CLIP и контрастивное выравнивание изображений с текстом.
14.6. Самообучение визуальных представлений: инвариантности и защита от коллапса.
14.7. Сжатие CV-модели: квантизация, pruning и distillation.
14.8. Один CV-пайплайн, четыре разных информационных бюджета.
14.9. Математическое углубление: два точных расчёта.
14.11. Заключение.
Основные источники.
Модуль 15. Информационная геометрия: Fisher, естественный градиент и потоки распределений.
15.1. Что значит «маленький шаг» для вероятностной модели.
15.2. Информация Фишера и локальная форма KL.
15.3. Естественный градиент: наискорейший спуск при малом изменении модели.
15.4. Что именно называют «кривизной» в глубокой сети.
15.5. Геометрия политик: NPG, TRPO, PPO и KL в RLHF.
15.6. Wasserstein-геометрия и потоки распределений.
15.7. Экспоненциальные семейства, двойственные координаты и зеркальный спуск.
15.8. Практическая карта: сначала выберите объект, затем геометрию.
15.9. Математическое углубление: α-геометрия и точные примеры.
15.11. Заключение.
Основные источники.
Модуль 16. Памятка по курсу.
16.1. Памятка по курсу: ключевые идеи и формулы.



Бесплатно скачать электронную книгу в удобном формате, смотреть и читать:
Скачать книгу Теория информации для машинного обучения, Куликов В., 2026 - fileskachat.com, быстрое и бесплатное скачивание.

Скачать pdf
Ниже можно купить эту книгу, если она есть в продаже, и похожие книги по лучшей цене со скидкой с доставкой по всей России.Купить книги



Скачать - pdf - Яндекс.Диск.
Дата публикации:





Теги: :: ::


 


 

Книги, учебники, обучение по разделам




Не нашёл? Найди:





2026-09-07 05:33:01