Языковые модели без лишних слов, Бурков А., 2026.
Книга представляет собой лаконичное и в то же время исчерпывающее руководство по построению языковых моделей. Рассматриваются математические основы машинного обучения, векторные представления и работа нейронных сетей. Изложены принципы моделирования языка: от мешков слов и эмбеддингов до рекуррентных сетей и архитектуры трансформеров. Приводятся полные реализации описанных моделей и методов на Python с использованием фреймворка PyTorch, включая примеры в виде Jupyter-блокнотов. Описаны методы обучения, тонкой настройки и оптимизации больших языковых моделей: LoRA, инженерия промптов, оценка качества, а также вопросы авторского права и этики. В заключительной главе даны направления для дальнейшего изучения: смесь экспертов, сжатие моделей, выравнивание на основе предпочтений, мультимодальные модели.

Современная эпоха.
В конце 1990-х и начале 2000-х годов постепенное совершенствование аппаратного обеспечения и доступность больших наборов данных (благодаря широкому использованию Интернета) способствовали тому, что искусственный интеллект благополучно пережил вторую зиму своего существования. Алгоритм случайного леса (random forest) Лео Бреймана (Leo Breiman, 2001) был разработан для решения проблемы переобучения деревьев принятия решений путем создания нескольких деревьев на основе случайных подмножеств данных и последующего объединения их выходных данных, что значительно повысило точность прогнозирования.
Еще одним значительным шагом вперед стал метод опорных векторов (support vector machines, SVM), представленный в 1992 году Владимиром Вапником (Vladimir Vapnik) и его коллегами. SVM определяет оптимальную гиперплоскость, которая разделяет точки данных разных классов с наибольшим зазором. Внедрение методов ядра (kernel methods) позволило SVM управлять сложными нелинейными моделями, отображая данные в многомерные пространства, что упростило поиск подходящей разделяющей гиперплоскости. В начале 2000-х годов эти инновации поставили SVM в центр исследований в области машинного обучения.
ОГЛАВЛЕНИЕ.
Предисловие.
Введение.
Для кого предназначена эта книга.
Чего нет в этой книге.
Структура книги.
Стоит ли вам покупать эту книгу?.
Благодарности.
Глава 1. Основы машинного обучения.
1.1. Искусственный интеллект и машинное обучение.
1.1.1. Первые успехи.
1.1.2. ИИ в периоды "похолоданий".
1.1.3. Современная эпоха.
1.2. Модель.
1.3. Четырехэтапный процесс машинного обучения.
1.4. Вектор.
1.5. Нейронная сеть.
1.6. Матрица.
1.7. Градиентный спуск.
1.8. Автоматическое дифференцирование.
Глава 2. Основы языковых моделей.
2.1. Мешок слов.
2.2. Эмбеддинг слов.
2.3. Кодирование парами байтов.
2.4. Языковая модель.
2.5. Языковая модель, основанная на подсчете.
2.6. Оценка языковых моделей.
2.6.1. Перплексия.
2.6.2. ROUGE.
2.6.3. Человеческая оценка.
Глава 3. Рекуррентные нейронные сети.
3.1. Elman RNN.
3.2. Мини-пакетный градиентный спуск.
3.3. Программирование сети RNN.
3.4. RNN как языковая модель.
3.5. Слой эмбеддинга.
3.6. Обучение языковой модели RNN.
3.7. Dataset и DataLoader.
3.8. Обучающие данные и расчет потерь.
Глава 4. Модель трансформера.
4.1. Блок декодера.
4.2. Самовнимание.
4.2.1. Шаг самовнимания 1.
4.2.2. Шаг самовнимания 2.
4.2.3. Шаг самовнимания 3.
4.2.4. Шаг самовнимания 4.
4.2.5. Шаг самовнимания 5.
4.2.6. Шаг самовнимания 6.
4.3. Позиционный многослойный персептрон.
4.4. Поворотный позиционный эмбеддинг.
4.5. Многопотоковое внимание.
4.6. Остаточная связь.
4.7. Нормализация среднеквадратичного значения.
4.8. Кеширование значений ключей.
4.9. Трансформер на Python.
Глава 5. Большая языковая модель.
5.1. Почему чем больше, тем лучше?.
5.1.1. Большое количество параметров.
5.1.2. Большой размер контекста.
5.1.3. Большой набор обучающих данных.
5.1.4. Большой объем вычислений.
5.2. Контролируемая тонкая настройка.
5.3. Тонкая настройка предварительно обученной модели.
5.3.1. Базовый классификатор эмоций.
5.3.2. Генерация эмоций.
5.3.3. Тонкая настройка для задачи выполнения инструкций.
5.4. Выборка из решений языковых моделей.
5.4.1. Базовая выборка с учетом температуры.
5.4.2. Выборка top-k.
5.4.3. Выборка Nucleus (top-p).
5.4.4. Штрафные санкции.
5.5. Адаптация низкого ранга (LoRa).
5.5.1. Основная идея.
5.5.2. Тонкая настройка с учетом параметров (РЕFГ).
5.6. LLM как классификатор.
5.7. Промпт-инженерия.
5.7.1. Особенности хорошего промпта.
5.7.2. Последующие действия.
5.7.3. Генерация кода.
5.7.4. Синхронизация документации.
5.8. Галлюцинации.
5.8.1. Причины галлюцинаций.
5.8.2. Предотвращение галлюцинаций.
5.9. LLM, авторское право и этика.
5.9.1. Обучающие данные.
5.9.2. Сгенерированный контент.
5.9.3. Модели с открытым весом.
5.9.4. Более важные этические соображения.
Глава 6. Что прочитать дополнительно.
6.1. Mixture of experts.
6.2. Слияние моделей.
6.3. Модели сжатия.
6.4. Согласование на основе предпочтений.
6.5. Расширенное рассуждение.
6.6. Безопасность языковой модели.
6.7. Визуально-языковая модель.
6.8. Предотвращение переобучения.
6.9. Заключительные замечания.
6.10. Другие книги автора.
Предметный указатель.
Бесплатно скачать электронную книгу в удобном формате, смотреть и читать:
Скачать книгу Языковые модели без лишних слов, Бурков А., 2026 - fileskachat.com, быстрое и бесплатное скачивание.
Скачать pdf
Ниже можно купить эту книгу, если она есть в продаже, и похожие книги по лучшей цене со скидкой с доставкой по всей России.Купить книги
Скачать - pdf - Яндекс.Диск.
Дата публикации:
Теги: учебник по программированию :: программирование :: Бурков
Смотрите также учебники, книги и учебные материалы:
Предыдущие статьи:








