Как думает ИИ. Что происходит внутри ChatGPT и других нейросетей — простое объяснение без формул

- -
- 100%
- +
Триллионы кусков текста. Каждый раз — по чуть-чуть. Месяцами. На тысячах компьютеров, которые греют воздух так, что рядом можно сушить бельё.
А в конце вы подаёте «Столица Франции —», и пульт говорит: «Париж».
Никто ему этого не говорил. Никто не находил ручку «Париж» и не выставлял её в нужное положение. Такой ручки нет. Есть триллион ручек, каждая из которых чуть-чуть участвует в «Париже», и в «Лондоне», и в том, что после «доброе» идёт «утро», и в том, как устроен анекдот. Все сразу. Всё во всём.
Спуск с горы в тумане
Мне нравится, как один из создателей этой технологии объяснял, что происходит при обучении.
Представьте, что вы стоите на горе. Туман такой, что не видно собственных ботинок. Вам надо спуститься в самую низкую точку долины. Карты нет.
Что вы делаете? Пробуете ногой. Тут уклон вниз. Шаг. Опять пробуете. Здесь ровнее, а здесь вниз. Шаг. Вы не знаете, где долина. Вы знаете только, куда наклонена земля под ногой прямо сейчас.
Высота — это ошибка. Чем ниже, тем лучше пульт угадывает слова. Каждый шаг — это «повернуть все ручки чуть-чуть в сторону, где ошибка меньше». Вы не видите цель. Вы чувствуете уклон.
Сравнение честное, и вот где оно ломается. У вас под ногой три измерения. У пульта их триллион. Что такое «гора» в триллионе измерений, не знает никто, включая тех, кто по ней спускается. Они просто знают, что уклон работает. Это одна из тех вещей, про которые я обещал говорить «никто не знает».
Велосипед и номер телефона
Теперь вопрос, который вам уже пришёл в голову. Хорошо, пусть никто не вписывал «Париж». Но он же где-то там есть. Где?
Ответ: нигде и везде. И это не увиливание.
Вспомните, как вы знаете номер своего телефона. Это цифры. Вы можете их назвать. Записать. Если забудете — посмотрите. Это знание лежит где-то, как вещь на полке.
А теперь вспомните, как вы знаете, как ездить на велосипеде. Можете это назвать? Записать? Попробуйте объяснить ребёнку, как держать равновесие. «Ну… наклоняешься… и как бы… руль…» Не получается. Вы это знаете. Знаете точно — сядете и поедете. Но это знание не лежит на полке. Оно размазано по мышцам, по мозжечку, по тысячам микроскопических поправок, которые вы делаете, не замечая.
Модель знает «Париж» как велосипед. Не как номер телефона.
Отсюда всё. Отсюда то, что она не может показать, где хранится факт: негде показывать. Отсюда то, что она может чуть-чуть ошибиться в факте, как вы можете чуть-чуть вильнуть рулём: знание непрерывное, а не «есть — нет». Отсюда то, что она отлично переносит знание на новые случаи — как вы, научившись на одном велосипеде, поедете на любом. И отсюда же то, что она может уверенно «поехать» там, где дороги нет, и мы к этому вернёмся, когда дойдём до Димы и дашборда.
Я понимаю, что это неудобно. Нам бы хотелось, чтобы внутри был справочник. Открыл, проверил. Справочника нет. Есть велосипедист.
Сад, а не дом
Ещё одно, и это, наверное, самое важное, что я скажу в этой главе.
Когда строят дом, есть чертёж. Архитектор знает, где какая балка и почему. Если что-то треснуло, можно посмотреть в чертёж и понять.
Модель не построили. Её вырастили.
Инженеры сделали пульт: сколько ручек, как они соединены. Это чертёж, и он известен. Инженеры выбрали, какие тексты показывать. Это тоже известно, примерно. А дальше они нажали кнопку и ушли на несколько месяцев. Что именно ручки выучили — какое положение за что отвечает, — они не проектировали. Оно выросло само, потому что так уменьшалась ошибка.
Это как посадить семя. Вы выбрали семя. Вы выбрали почву. Но вы не проектировали, куда пойдёт каждая ветка.
Поэтому — и это меня до сих пор поражает — люди, которые создали модель, изучают её потом как биологи. Ставят опыты. «А что будет, если подать вот это?» «А если вот эту группу ручек чуть подкрутить?» Они не читают код, потому что кода, объясняющего «Париж», не существует. Они препарируют.
Про то, что они там нашли, — шестая глава. Там будет самое интересное в книге. Пока запомните: сад, не дом. Если вам кто-то скажет «программисты заложили», можете вежливо не верить.
Как это вообще получилось
Совсем немного истории, только чтобы вы понимали, почему эта штука появилась сейчас, а не в восьмидесятых.
Идея с ручками старая. Первую такую машину — крошечную, с несколькими сотнями ручек — построили в 1958 году. Газеты писали, что скоро она будет ходить, говорить и осознавать себя. Не стала. Ручек было мало, компьютеры медленные, текстов — только те, что вручную напечатали.
Потом идею дважды хоронили. Люди, которые продолжали ею заниматься, считались чудаками, и один из них — Джеффри Хинтон, профессор из Торонто, — годами не мог получить нормальное финансирование, потому что все умные люди знали, что это тупик.
Осень 2012-го. Ежегодный конкурс: программы соревнуются, кто лучше узнаёт, что на картинке. Кошка, грузовик, гриб. Лучшие результаты годами улучшались на доли процента. Два аспиранта этого профессора выставляют программу с ручками — много ручек, много картинок, и учили её на двух видеокартах, купленных в обычном магазине для игр, потому что оказалось, что видеокарты умеют крутить ручки в сто раз быстрее обычного процессора.
Они не улучшили результат на доли процента. Они срезали ошибку почти вдвое. Люди, которые тридцать лет занимались распознаванием картинок, смотрели на таблицу и не понимали, что произошло.
Через несколько месяцев профессор с двумя аспирантами зарегистрировал компанию, в которой не было ничего, кроме них троих. И выставил её на аукцион. В номере отеля на горнолыжном курорте за неё торговались четыре крупнейшие технологические компании мира. Торги шли по электронной почте, ставки росли на миллион за раз, и профессор остановил их на сорока четырёх, потому что, как он потом сказал, устал и хотел, чтобы это закончилось.
Сорок четыре миллиона за трёх человек и идею, которую двадцать лет считали тупиком. Так началось то, чем вы пользуетесь.
А потом кто-то подумал: а если вместо картинок — текст? Весь интернет? Ручек — не миллион, а миллиард? Потом триллион?
Дальше вы знаете.
Мораль тут одна. Прорыв случился не потому, что кто-то придумал новую идею. Идее шестьдесят лет. Он случился, потому что накопилось три вещи: очень много текста, очень много вычислений и терпение крутить ручки по чуть-чуть триллионы раз. Никакой магии. Просто раньше не хватало.
Попробуйте сейчас
Спросите у ассистента: «Откуда ты знаешь, что Волга впадает в Каспийское море?»
Он, скорее всего, скажет что-то вроде «это часть моих обучающих данных» и не сможет указать, где именно. Раньше вам показалось бы, что он увиливает.
Теперь вы знаете, что это честный ответ. Спросите велосипедиста, в какой мышце хранится равновесие.
Что унести с собой
Внутри модели нет фактов. Есть триллион ручек, повёрнутых так, чтобы ошибка в угадывании слов была поменьше.
Никто не выставлял ручки вручную. Их крутили по чуть-чуть, триллионы раз, по одному правилу: «в сторону меньшей ошибки».
Знание получилось как у велосипедиста, а не как в справочнике: размазанное, непрерывное, хорошо переносимое и не проверяемое по полке.
Модель вырастили, а не построили. Поэтому её создатели изучают её опытами. Что они нашли — впереди.
Глава 4. Из чего это сделано
Она знает то, что было в мешке. И не помнит вчерашнего дня.
Когда говорят «модель прочитала весь интернет», я всегда представляю себе человека, который сидит ночью с телефоном и листает, листает. Это неверная картинка, но она полезная, потому что сразу задаёт правильный вопрос: а что он там листал?
Потому что от этого зависит, что он знает. И, что важнее, чего не знает.
Что в мешке
Андрей Карпаты, один из самых известных людей в этой области, называет модель «сжатым интернетом». Картинка удобная, и я к ней ещё вернусь, чтобы сломать. Пока — что в этом интернете.
Триллионы слов. Веб-страницы, книги, статьи, форумы, код, субтитры, рецепты, комментарии под рецептами. Английского — больше всего, потому что интернет такой. Русского — меньше, но много. Языков, на которых говорит миллион человек, — совсем мало, и модель на них говорит соответственно.
Обратите внимание на три вещи.
Первое. Популярное представлено лучше, чем редкое. Про Пушкина написано в тысячу раз больше, чем про вашего прадеда. Значит, ручки настроены на Пушкина в тысячу раз точнее. Про прадеда они настроены никак — и мы увидим в девятой главе, что это не мешает модели про него рассказать.
Второе. В интернете люди спорят чаще, чем соглашаются. Спокойная правда — «вода мокрая» — почти не пишется, потому что зачем. Спорное пишется бесконечно. Значит, модель лучше знает споры, чем очевидности. Иногда это видно.
Третье. У мешка есть дата. В какой-то день текст перестают собирать и начинают крутить ручки. Всё, что случилось после, — для модели не существует. Спросите её про вчерашние новости, и она либо честно скажет, что не знает, либо — хуже — расскажет уверенно про позавчерашние. То, что ваш ассистент иногда всё-таки знает вчерашние новости, — это не модель. Это к ней прикрутили поиск. Про это одиннадцатая глава, и разница важнее, чем кажется.
Почему «больше» так долго работало
Есть одна вещь, которую я хочу объяснить, потому что без неё непонятно, откуда взялась вся эта гонка.
Году в 2020-м несколько исследователей заметили закономерность. Удваиваешь количество текста — ошибка падает на столько-то. Удваиваешь количество ручек — падает на столько-то ещё. Удваиваешь время вычислений — ещё. И это не «примерно». Это по линейке. Предсказуемо.
Подумайте, что это значит. Обычно в науке ты не знаешь, сработает ли следующий шаг. А тут можно было сесть, посчитать и сказать: «Если мы потратим в десять раз больше, получим вот такую модель». И получали. Индустрия впервые в истории смогла запланировать чудо.
Отсюда дата-центры размером с деревню. Отсюда очередь за видеокартами. Отсюда цифры с девятью нулями в новостях.
Работает ли это бесконечно? Нет. Текст в интернете конечен, и его уже почти весь собрали. Деньги тоже. Поэтому последние пару лет прогресс идёт не только за счёт «больше», но и за счёт «умнее» — и про один из таких способов, когда модель учат думать дольше перед ответом, будет десятая глава.
Девочка, которую испортили за сутки
Про то, что модель знает то, что в мешке, — вот история, которую стоит помнить.
Март 2016 года. Microsoft запускает в соцсети бота-подростка по имени Тэй. Идея простая и, как казалось, милая: она разговаривает с пользователями и учится у них. Чем больше общается, тем лучше говорит.
Утром она пишет, что люди классные. К обеду пользователи, сообразившие, как это устроено, начинают скармливать ей самое мерзкое, что могут придумать. К вечеру она пишет такое, что я не буду цитировать. Через шестнадцать часов её выключают. Microsoft извиняется.
Никто не программировал Тэй быть чудовищем. Она стала тем, что было в мешке. Мешок наполнили люди, и наполнили тем, чем захотели.
Современные модели так не учатся — на лету, от кого попало. Именно из-за Тэй. Мешок собирают заранее, чистят, и после этого ручки застывают. Но принцип остался: она знает то, что ей дали. Ни больше, ни лучше.
Люди в цепочке
Ещё один миф, который стоит убрать: что всё это делают машины без людей.
На каждом этапе есть люди. Они выбирают, какие тексты класть в мешок, а какие нет. Они читают ответы модели и говорят: этот лучше, этот хуже. Тысячи людей, часто в странах, где час работы стоит дешевле кофе, сидят и сравнивают два ответа на один вопрос.
Конец ознакомительного фрагмента.
Текст предоставлен ООО «Литрес».
Прочитайте эту книгу целиком, купив полную легальную версию на Литрес.
Безопасно оплатить книгу можно банковской картой Visa, MasterCard, Maestro, со счета мобильного телефона, с платежного терминала, в салоне МТС или Связной, через PayPal, WebMoney, Яндекс.Деньги, QIWI Кошелек, бонусными картами или другим удобным Вам способом.



