Нейросети. Роадмап

- -
- 100%
- +
Почему это гениально?
Во-первых, скорость. Рекуррентная сеть читает по одному слову, как человек, который водит пальцем по строчке. Трансформер видит всю страницу разом. Это можно распараллелить на видеокартах, что делает обучение в сотни раз быстрее.
Во-вторых, глубина понимания. Трансформер может уловить связь между словами, которые находятся друг от друга на расстоянии в тысячу слов. Потому что он «внимателен» ко всему тексту сразу.
Кто живет внутри трансформера?
Все современные звезды — это трансформеры:
GPT (Generative Pre-trained Transformer) — та самая модель, которая пишет тексты.
BERT — модель, которая отлично понимает запросы в поисковиках.
CLIP — модель, которая связывает текст и картинки (поэтому мы можем написать «кот в космосе» и получить картинку).
Когда вы пользуетесь ChatGPT, вы общаетесь с гигантским трансформером, который прошёл через механизм внимания миллиарды раз.
5. Диффузия: Художники, которые рисуют из шума
Пару слов о том, как сети рисуют картинки. Если вы видели работы Midjourney или Stable Diffusion, вы наверняка задавались вопросом: «Откуда это берется?»
Ответ — диффузионные модели.
Идея, которая кажется безумной, но работает:
Берем чистый шум. Просто случайные пиксели. Как «снег» на старом телевизоре.
Говорим сети: «Представь, что в этом шуме спрятан кот в космосе. Убери лишний шум и оставь кота».
Сеть начинает постепенно убирать шум. Шаг за шагом. Сначала появляется силуэт, потом контуры, потом детали. Через 50 шагов из хаоса рождается картинка.
Как сеть этому учится?
Ей показывают миллионы пар: «шумная картинка» «чистая картинка». Она учится предсказывать, что нужно убрать, чтобы остался осмысленный образ.
Так работают все современные генераторы изображений.
Итог главы: Шпаргалка
Архитектура Сильная сторона Пример использования
Полносвязные (Dense) Таблицы, числа Прогноз цен, скоринг
Сверточные (CNN) Пространство, картинки Распознавание лиц, медицина
Рекуррентные (RNN/LSTM) Последовательности Распознавание речи (раньше)
Трансформеры Текст, связи, всё сразу ChatGPT, переводчики
Диффузия Генерация из шума Midjourney, Stable Diffusion
Теперь, когда вы слышите «нейросеть», вы можете с умным видом спросить: «А какая архитектура?» Это, кстати, хороший способ отличить дилетанта от профессионала.
Глава 4. Какнейросеть видит мир?
или «Почему для компьютера "король" — это просто стрелочка в космосе»
Странная проблема: Компьютер не понимает слов
Давайте начнём с эксперимента. Откройте любой переводчик и попросите его перевести фразу «Я хочу есть». Вы получите «I want to eat». Отлично.
А теперь спросите у того же переводчика: «Что общего между "король" и "мужчина"?»
Он зависнет. Не потому что переводчик глупый, а потому что компьютер в принципе не понимает смысла слов. Для него слово «король» — это просто набор из шести букв, кодировка символов. Ноль или единица. Он не знает, что король — это человек, что у него есть власть, что он мужчина.
А теперь представьте, что нам нужно научить нейросеть отличать хорошие отзывы от плохих. «Мне всё понравилось» — хорошо. «Это ужас» — плохо. Пока слова совпадают — всё просто. Но что если клиент напишет: «Ну вы даёте, ребята. Сервис — огонь!» Формально слово «огонь» может быть и плохим (пожар?), а на деле — это высшая похвала.
Как объяснить компьютеру, что «огонь» — это «хорошо»?
Ответ гениален и прост: мы перестали объяснять словами. Мы начали показывать числами.
Идея, которая изменила всё: Смысл как координата
В 2013 году команда исследователей из Google предложила алгоритм Word2Vec. Идея была настолько элегантной, что сейчас её называют «революцией эмбеддингов».
Суть такая: любое слово можно представить в виде точки в многомерном пространстве.
Звучит жутко? На самом деле это как карта сокровищ.
Представьте обычную карту города. У каждой точки на карте есть две координаты: X (долгота) и Y (широта). Магазин, парк, дом — всё имеет свой адрес в этом плоском мире.
Теперь представьте, что у нас не две координаты, а три. Как в игре или в фильме. Добавляется высота. Точки больше не на плоскости, а в объёме. Можно описать самолёт, который летит над городом.
А теперь добавьте не три координаты, а триста. Или тысячу. Мы не можем это нарисовать или представить, но математически это работает. Каждая координата описывает какое-то скрытое свойство слова.
Например, у нас есть вектор (набор чисел) для слова «король». И есть вектор для слова «королева». Где-то в недрах этих чисел есть измерение 17, которое отвечает за «пол». У короля там, условно, стоит 0.9, а у королевы — -0.9.
Измерение 42 отвечает за «власть». И там у обоих будет высокое значение.
А измерение 88 — за «еду». Там у обоих почти ноль.
Как нейросеть строит эту карту?
Она ничего не знает о королях и власти. Она просто читает миллиарды предложений.
Игра «Найди соседа»:
Нейросеть видит фразу: «Король приказал...»
И фразу: «Королева приказала...»
Она замечает: слова «король» и «королева» часто встречаются в одинаковых контекстах (приказал, трон, дворец, власть). Значит, они похожи. Она ставит их рядом.
Слова «огурец» и «король» встречаются в разных контекстах. Значит, между ними нужно поставить стену. Развести подальше.
Прочитав все книги мира, нейросеть строит идеальную карту языка, где:
«Король» и «королева» стоят рядом.
«Огурец» и «помидор» стоят рядом.
«Радость» и «счастье» почти в одной точке.
А «радость» и «ипотека» — на разных полюсах.
Знаменитая формула: Король минус мужчина плюс женщина равно королева
Это не шутка. Это реальное свойство таких векторных пространств.
Если вы возьмёте вектор слова «король», вычтете из него вектор слова «мужчина» и прибавите вектор слова «женщина», вы получите точку в пространстве. Если вы посмотрите, какое слово находится ближе всего к этой точке, — это будет «королева».
Компьютер не понимал логики. Он просто выучил геометрию. Он увидел, что разница между «король» и «королева» в языке точно такая же, как между «мужчина» и «женщина». Это называется лингвистическая регулярность.
Другие примеры:
«Париж» — «Франция» + «Россия» = «Москва».
«Ходить» — «Ходил» + «Говорить» = «Говорил».
Машина неосознанно выучила грамматику и семантику через географию точек. Это как если бы вы выучили иностранный язык, просто глядя на карту звёздного неба, где созвездия — это смыслы.
Но слова — это только начало. А картинки?
Через несколько лет после Word2Vec инженеры задались вопросом: если можно сделать вектор для слова, можно ли сделать вектор для фотографии кота?
Оказалось, да. И это была ещё одна революция.
CLIP (Contrastive Language–Image Pre-training) — модель, которая научилась помещать картинки и текст в одно и то же пространство.
Как это работает?
Модели показывают миллионы пар: фотография собаки + подпись «фотография собаки». Фотография заката + подпись «красивый закат».
Модель учится ставить точку картинки рядом с точкой текста.
Результат? Мы можем написать «кот в скафандре на луне», и модель нарисует точку в этом многомерном пространстве. А потом найдёт картинку, которая находится ближе всего к этому описанию.
Конец ознакомительного фрагмента.
Текст предоставлен ООО «Литрес».
Прочитайте эту книгу целиком, купив полную легальную версию на Литрес.
Безопасно оплатить книгу можно банковской картой Visa, MasterCard, Maestro, со счета мобильного телефона, с платежного терминала, в салоне МТС или Связной, через PayPal, WebMoney, Яндекс.Деньги, QIWI Кошелек, бонусными картами или другим удобным Вам способом.



