ИИ без паники. Практическая книга о нейросетях для тех, кто не программист

- -
- 100%
- +
Три надежды
Теперь о хорошем — и тоже без розовых очков.
Надежда первая: выравнивание доступа. Раньше персональный репетитор, юрист-консультант, редактор, аналитик были доступны тем, кто может платить. Сейчас качественная консультация первого уровня стала практически бесплатной. Это не заменяет специалиста, но радикально меняет положение человека, у которого специалиста не было вообще.
Особенно это касается людей вне крупных городов, людей с ограниченными возможностями, людей, которым стыдно спрашивать очевидное.
Надежда вторая: возврат времени. Значительная часть интеллектуального труда — это не творчество, а перекладывание информации из одной формы в другую. Отчёты, справки, протоколы, согласования. Если хотя бы треть этого уходит машине, освобождается время. Что вы с ним сделаете — отдельный вопрос, но возможность появляется.
Надежда третья: ускорение науки и медицины. Здесь самые сильные ожидания. Предсказание структуры белков, поиск молекул-кандидатов для лекарств, анализ медицинских изображений, обработка научной литературы — области, где ИИ уже дал результаты, которые люди не получили бы за то же время.
Правда посередине
Если свести всё к одному абзацу, он звучит так.
Искусственный интеллект — не разум и не магия. Это очень мощный усилитель интеллектуальной работы, который резко удешевляет производство и обработку информации. Он делает сильных сильнее, слабых — не обязательно слабее, но точно оставляет позади тех, кто отказывается его брать в руки. Он не отменяет необходимости думать — он повышает цену умения думать, потому что теперь мысль воплощается быстрее.
Всё, что вы прочитаете дальше, — развёртывание этого абзаца.
Что делать с эмоциями
Практический совет, который редко дают в книгах о технологиях.
Если вы чувствуете тревогу, читая об ИИ, — это адекватная реакция на быстрые изменения, а не признак слабости. Тревога становится проблемой, когда приводит к параличу: человек не разбирается, потому что боится, и боится, потому что не разбирается.
Разорвать этот круг проще всего действием. Не изучением теории, а маленьким конкретным делом. Открыть приложение. Задать один вопрос. Получить один полезный ответ.
Понимание приходит после первого практического успеха, а не до него.
Поэтому, если вам сейчас тревожно, у меня есть предложение: пролистайте вперёд, к Главе 14, сделайте то, что там описано — это тридцать минут, — и возвращайтесь сюда. Дальше читать будет легче.
ЧАСТЬ II. КРАТКАЯ ИСТОРИЯ ОДНОЙ ИДЕИ
Зачем читать историю, если хочется практики? Затем, что понимание происхождения избавляет от двух крайностей — мистического преклонения и пренебрежительного отмахивания. Когда вы знаете, из каких кирпичей и почему это собрано, вы перестаёте видеть в этом либо чудо, либо ерунду. Эта часть короткая: три главы, около часа чтения.
Глава 4. Мечта о мыслящей машине: от Тьюринга до перцептрона
Идея старше компьютера
Мысль о том, что рассуждение можно механизировать, гораздо старше техники.
Ещё в XIII веке каталонский философ Раймунд Луллий строил вращающиеся бумажные круги с записанными на них понятиями — механическое устройство для порождения всех возможных комбинаций суждений. Он всерьёз надеялся, что так можно рационально демонстрировать истину веры любому оппоненту.
В XVII веке Лейбниц мечтал о «характеристике универсалис» — языке, на котором любой спор можно было бы решить вычислением. Его знаменитая фраза: «Давайте посчитаем!» — вместо «давайте поспорим».
В XIX веке Джордж Буль опубликовал работу с говорящим названием «Исследование законов мышления», в которой свёл логику к алгебре. Тогда же Ада Лавлейс, работая над проектом аналитической машины Бэббиджа, написала первую в истории программу — и одновременно сформулировала возражение, которое цитируют до сих пор: аналитическая машина «не претендует на создание чего-либо оригинального; она может делать лишь то, что мы умеем ей приказать».
Возражение Лавлейс станет одним из главных предметов спора об искусственном интеллекте в следующие два столетия.
Тьюринг: вопрос поставлен правильно
Алан Тьюринг — фигура, с которой начинается всё современное.
В 1936 году, будучи двадцатичетырёхлетним, он описал абстрактную машину, способную выполнить любое вычисление, которое вообще может быть выполнено. Не построил — описал математически. Эта конструкция, «машина Тьюринга», лежит в основании всей информатики.
Во время войны он работал в Блетчли-парке над взломом немецкой шифровальной машины «Энигма». Работа была засекречена десятилетиями; по некоторым оценкам, она сократила войну на два года.
Но нас интересует статья 1950 года — «Вычислительные машины и разум». Тьюринг начинает её с вопроса «Могут ли машины мыслить?» — и немедленно объявляет этот вопрос бессмысленным, потому что мы не умеем определить «мыслить».
Вместо этого он предлагает заменить вопрос на операциональный: если человек, переписываясь с собеседником вслепую, не может определить, машина это или человек, — какая разница, что происходит внутри?
Это стало известно как «тест Тьюринга», хотя сам он называл это «игрой в имитацию».
Что здесь важно для нас. Тьюринг сделал гениальный ход: он перевёл вопрос из области философии в область наблюдаемого поведения. И заодно предсказал, что примерно к 2000 году машины будут обманывать экспертов в пятиминутном разговоре в трети случаев. Он ошибся лет на двадцать, но направление угадал точно.
Забавная деталь: в той же статье Тьюринг разбирает девять возражений против машинного мышления, включая «возражение леди Лавлейс», религиозное возражение и «страусиное возражение» (последствия слишком ужасны, поэтому будем надеяться, что это невозможно). Все девять звучат в спорах и сегодня, слово в слово.
1956: рождение термина
Летом 1956 года в Дартмутском колледже собралась небольшая группа исследователей на двухмесячный семинар. В заявке на финансирование Джон Маккарти впервые употребил словосочетание «искусственный интеллект» — по его собственному признанию, чтобы отмежеваться от смежных направлений и получить деньги.
Формулировка заявки звучит сегодня трогательно: «Исследование основано на предположении, что любой аспект обучения или любое иное свойство интеллекта в принципе может быть описано настолько точно, что машина сможет его симулировать. Будет предпринята попытка выяснить, как заставить машины использовать язык, формировать абстракции и понятия, решать задачи, ныне доступные только людям, и совершенствовать себя. Мы полагаем, что значительный прогресс может быть достигнут, если тщательно отобранная группа учёных поработает над этим вместе в течение лета».
Одно лето. Они были уверены, что справятся за одно лето.
Семьдесят лет спустя работа продолжается.
Перцептрон: первая нейросеть
Параллельно логическому направлению развивалось совсем другое.
В 1943 году нейрофизиолог Уоррен Мак-Каллок и логик Уолтер Питтс опубликовали первую математическую модель искусственного нейрона: элемент, который суммирует входящие сигналы и выдаёт единицу, если сумма превысила порог, и ноль в противном случае. Простейшая абстракция нервной клетки.
В 1949 году психолог Дональд Хебб сформулировал принцип обучения: связь между двумя нейронами усиливается, если они активируются одновременно. Правило Хебба часто пересказывают фразой «нейроны, срабатывающие вместе, связываются вместе».
А в 1957—1958 годах Фрэнк Розенблатт в Корнеллской лаборатории построил перцептрон — устройство, которое училось распознавать простые образы. Не программировалось, а именно училось: ему показывали примеры, он ошибался, веса связей корректировались, ошибок становилось меньше.
Это была первая широко известная работающая обучающаяся нейросеть. Занимала она комнату, распознавала простейшие фигуры и вызвала бурю восторга. Газета New York Times написала, что флот США ожидает получить машину, которая «сможет ходить, говорить, видеть, писать, воспроизводить себя и осознавать своё существование».
Розенблатт, надо сказать, и сам подливал масла в огонь.
Ключевая идея, которая осталась
Здесь стоит остановиться, потому что именно в перцептроне заложена идея, дожившая до сегодняшних моделей.
Классическое программирование работает так: человек формулирует правила, машина их исполняет. Хотите, чтобы программа отличала кошку от собаки, — опишите признаки кошки. Проблема в том, что описать «кошку» набором правил невозможно. Попробуйте сами: уши треугольные? У некоторых собак тоже. Усы? Хвост? Размер? Каждое правило ломается на исключениях.
Обучающийся подход переворачивает схему: человек даёт примеры и ответы, машина сама выводит правила. Покажите десять тысяч кошек и десять тысяч собак с подписями — система сама нащупает признаки, которые вы никогда бы не сформулировали.
Эта разница — между «запрограммировать» и «обучить» — фундаментальна. Всё, что вы читаете дальше, вырастает из неё.
Другая ветвь: символьный ИИ
Пока одни строили обучающиеся системы, другие шли путём явных правил, и в шестидесятые-семидесятые именно они доминировали.
Были созданы программы, доказывающие теоремы, решающие алгебраические задачи, ведущие диалог в узкой области. Самая знаменитая — ELIZA Джозефа Вейценбаума (1966), имитировавшая психотерапевта роджерианской школы. Программа была примитивна до неприличия: она переформулировала фразы пользователя в вопросы. «Мне грустно» → «Почему вам грустно?»
Вейценбаум был потрясён реакцией людей. Его секретарша, знавшая, как устроена программа, попросила его выйти из комнаты, чтобы поговорить с ELIZA наедине. Люди приписывали примитивному алгоритму понимание и сочувствие.
Этот феномен позже назвали «эффектом ELIZA» — склонность человека приписывать компьютерной программе понимание, которого у неё нет. Держите его в голове: он абсолютно актуален сегодня и объясняет очень многое в том, как мы воспринимаем современные модели. Мы устроены так, что видим собеседника там, где есть только структура текста.
Вейценбаум, кстати, до конца жизни оставался критиком ИИ — во многом именно из-за увиденного тогда.
Глава 5. Зимы и вёсны: почему ИИ дважды почти умер
Первая зима (примерно 1974—1980)
Восторг шестидесятых закончился жёстко.
В 1969 году Марвин Минский и Сеймур Пейперт выпустили книгу «Перцептроны», где математически строго показали ограничения однослойной сети. Классический пример: перцептрон не способен научиться функции «исключающее ИЛИ» — простейшей логической операции.
Формально они были правы. Практический эффект оказался разрушительным: финансирование нейросетевого направления обвалилось почти до нуля на полтора десятилетия. Было известно, что многослойные сети ограничение снимают — но метода их обучения тогда не было, а книга Минского и Пейперта в общественном сознании закрыла тему целиком.
Одновременно рухнули ожидания от машинного перевода. В 1966 году американский комитет ALPAC выпустил отчёт, констатировавший, что машинный перевод хуже и дороже человеческого и перспектив не имеет. Финансирование обрезали.
В Британии в 1973 году вышел «доклад Лайтхилла», разгромивший британские исследования ИИ. Результат тот же.
Наступила первая зима. Многие перестали употреблять словосочетание «искусственный интеллект» в заявках на гранты — оно стало токсичным. Писали «информатика», «распознавание образов», «информационный поиск».
Короткая весна: экспертные системы
В начале восьмидесятых пришло оживление, связанное с «экспертными системами».
Идея: не пытаться строить универсальный интеллект, а взять узкую область, опросить настоящих экспертов, записать их знания в виде тысяч правил «если — то» и получить программу-консультанта.
Это работало. Система MYCIN диагностировала бактериальные инфекции крови не хуже врачей-инфекционистов. Система XCON, конфигурировавшая компьютеры для корпорации DEC, по оценкам, экономила компании десятки миллионов долларов в год.
Возник рынок. Появились компании, продававшие специализированные компьютеры для языка Lisp. Япония запустила амбициозный национальный проект «Проект по созданию компьютеров пятого поколения». Всё выглядело многообещающе.
Вторая зима (примерно 1987—1993)
И снова обвалилось.
Экспертные системы оказались хрупкими. Их приходилось создавать вручную, правило за правилом, что стоило дорого. Они не умели обучаться — при изменении предметной области нужно было переписывать правила. Они ломались на границах своей области, причём ломались тихо: выдавали уверенный неправильный ответ вместо признания «я не знаю».
А главное — колоссальная часть человеческого знания вообще не выражается правилами. Эксперт часто не может объяснить, как он пришёл к выводу. Он говорит: «Опыт подсказывает». Это неформализуемо.
Рынок Lisp-машин рухнул за год: обычные персональные компьютеры стали достаточно быстрыми. Японский проект пятого поколения завершился без прорыва. Наступила вторая зима.
Что происходило зимой
Важная деталь, которую упускают в популярных пересказах: во время зим работа не остановилась. Она ушла в тень, в академические лаборатории, и там были сделаны решающие вещи.
В 1986 году Дэвид Румельхарт, Джеффри Хинтон и Рональд Уильямс популяризировали алгоритм обратного распространения ошибки — метод, позволяющий обучать многослойные сети. Именно то, чего не хватало в шестидесятые.
Идея алгоритма, если объяснять на пальцах: сеть даёт ответ, мы сравниваем его с правильным, вычисляем ошибку — и «прокручиваем» её назад через все слои, слегка подправляя каждую связь в сторону уменьшения ошибки. Повторяем миллионы раз.
Это до сих пор основной метод обучения нейросетей. Ему сорок лет.
В 1989 году Ян Лекун применил свёрточные сети к распознаванию рукописных цифр — система читала почтовые индексы и банковские чеки. Работала в промышленном масштабе с начала девяностых.
В 1997 году Зепп Хохрайтер и Юрген Шмидхубер предложили архитектуру LSTM для работы с последовательностями — она доминировала в обработке текста и речи следующие двадцать лет.
Тогда же, в 1997-м, произошло событие, всколыхнувшее публику: Deep Blue обыграл Гарри Каспарова в шахматы. Правда, к нейросетям это отношения почти не имело — Deep Blue была системой перебора вариантов на специализированном железе. Но символически это был перелом: последний бастион «человеческого превосходства в мышлении» пал.
Урок из двух зим
Из этой истории стоит вынести практический вывод, полезный прямо сейчас.
Обе зимы наступали по одной и той же схеме: реальный технический результат в узкой области → экстраполяция «раз это работает, скоро заработает всё» → инвестиции под завышенные ожидания → столкновение с тем, что следующий шаг оказался на порядок сложнее → разочарование, обвал, остановка финансирования.
Мы сейчас находимся в фазе очень высоких ожиданий. Вероятность коррекции ненулевая. Многие серьёзные люди ждут «сдувания пузыря» в ближайшие годы.
Но — и это важно — обвал ожиданий не означает обвала технологии. После краха доткомов в 2000 году интернет никуда не делся; исчезли компании, продававшие корм для собак онлайн с убытком, а Amazon и Google выросли. Похожая динамика вероятна и здесь: часть нынешних ИИ-стартапов исчезнет, а сама технология останется и станет фоном.
Для вас как пользователя вывод простой: не ориентируйтесь на градус шума. Ориентируйтесь на то, экономит ли инструмент ваше время сегодня.
Глава 6. Взрыв: как за четырнадцать лет всё изменилось
2012: момент, когда всё повернуло
Осенью 2012 года на ежегодном соревновании по распознаванию изображений ImageNet произошло то, что задним числом называют началом эпохи.
Соревнование состояло в том, чтобы классифицировать миллион с лишним фотографий по тысяче категорий. Лучшие результаты предыдущих лет топтались около 26% ошибок и улучшались на доли процента в год.
Команда Алекса Крижевского, Ильи Суцкевера и Джеффри Хинтона из Торонто представила глубокую свёрточную сеть, получившую название AlexNet. Результат — около 15% ошибок. Разрыв с ближайшим конкурентом был не эволюционным, а катастрофическим.
Что они сделали нового? Почти ничего. Свёрточные сети существовали с восьмидесятых, обратное распространение — тоже. Новыми были три вещи: очень большой размеченный датасет (ImageNet, собранный под руководством Фэй-Фэй Ли), обучение на видеокартах вместо процессоров (это дало ускорение в десятки раз), и несколько технических приёмов, стабилизирующих обучение глубоких сетей.
Оказалось, что старые идеи прекрасно работают — просто раньше не хватало данных и вычислений.
Индустрия развернулась почти мгновенно. К 2015 году машины превзошли рассчитанную ранее человеческую точность на этом наборе задач.
2014—2016: сети учатся творить и играть
В 2014 году Ян Гудфеллоу предложил генеративно-состязательные сети (GAN). Идея красивая: две сети соревнуются. Одна пытается создать поддельное изображение, вторая — отличить подделку от настоящего. Обе улучшаются, пока подделки не становятся неотличимыми.
Именно GAN дали дорогу к созданию первых фотореалистичных лиц несуществующих людей и, к сожалению, первые дипфейки.
В 2016 году система AlphaGo от DeepMind обыграла Ли Седоля, одного из сильнейших игроков в го. Это было важнее шахмат: в го число возможных позиций превышает число атомов во Вселенной, перебором его не взять. Требовалось нечто, похожее на интуицию.
Знаменитый 37-й ход второй партии — ход, который все комментаторы сочли ошибкой и который оказался решающим, — вошёл в историю как момент, когда машина сделала нечто, чего человек не понял, но что оказалось правильным.
Год спустя AlphaGo Zero научилась играть вообще без человеческих партий, только играя сама с собой, и превзошла предыдущую версию.
2017: трансформер
В июне 2017 года восемь исследователей Google опубликовали статью «Attention Is All You Need» — «Внимание — это всё, что вам нужно».
Задача, которую они решали, была узкой: улучшить машинный перевод. Существующие модели обрабатывали текст последовательно, слово за словом, что было медленно и плохо работало с длинными предложениями — к концу фразы модель «забывала» начало.
Предложенное решение: обрабатывать все слова одновременно, а связи между ними устанавливать через механизм «внимания» — каждое слово как бы оглядывается на все остальные и решает, какие из них для него важны.
Простой пример. В предложении «Кошка не стала есть корм, потому что он был испорчен» слово «он» относится к корму. В предложении «Кошка не стала есть корм, потому что она была сыта» слово «она» относится к кошке. Механизм внимания позволяет модели устанавливать такие связи напрямую, минуя расстояние.
Побочный, но решающий эффект: параллельная обработка отлично раскладывается на тысячи видеокарт. Модели стало возможно масштабировать.
Буква T в аббревиатуре GPT — это Transformer. Вся современная генеративная эпоха выросла из этой статьи.
2018—2022: гонка масштаба
Дальше события ускоряются.
2018. OpenAI выпускает GPT-1 — 117 миллионов параметров. Google выпускает BERT. Обе модели показывают силу подхода: сначала обучить на огромном объёме текста «вообще», потом дообучить под конкретную задачу.
2019. GPT-2 — 1,5 миллиарда параметров. OpenAI сначала отказывается публиковать модель полностью, объясняя это опасностью массовой генерации дезинформации. Сегодня это выглядит забавно — тексты GPT-2 по нынешним меркам слабые, — но тогда произвело впечатление.
2020. GPT-3 — 175 миллиардов параметров. Скачок был не только количественным. Обнаружилось явление, которое назвали «обучением по ходу дела»: модель, которую никто не учил конкретной задаче, справлялась с ней, увидев два-три примера прямо в запросе. Возникли «эмерджентные способности» — умения, появляющиеся при увеличении размера сами собой, без специального обучения.
2021. DALL·E и CLIP связывают текст и изображения. Появляется генерация картинок по описанию.
2022, первая половина. Stable Diffusion выходит в открытый доступ. Midjourney запускается для широкой публики. Генерация изображений становится массовым явлением.
30 ноября 2022. OpenAI выкладывает ChatGPT — по сути, демонстрационную обёртку вокруг дообученной модели GPT-3.5. Внутри компании ожидали умеренного интереса.
Через пять дней — миллион пользователей. Через два месяца — сто миллионов. Самый быстрый рост потребительского продукта в истории.
Ключевое отличие от GPT-3 было не в мощности модели, а в дообучении на человеческих предпочтениях: модель научили быть полезным собеседником, а не просто продолжателем текста. Плюс — бесплатный доступ через обычное окно чата, без регистрации разработчика и без единой строчки кода.
Технология существовала два года. Интерфейс изменил всё.
2023—2026: от чата к агентам
Дальнейшую хронику имеет смысл дать не по продуктам (они устаревают), а по смене принципов.
2023 — год конкуренции и мультимодальности. Появляется GPT-4, Anthropic выпускает Claude, Google — Bard, затем Gemini. Meta открывает веса LLaMA, что запускает волну открытых моделей. Модели начинают понимать изображения, а не только текст. Контекстное окно растёт с тысяч до сотен тысяч слов.
2024 — год интеграции. ИИ перестаёт быть отдельным сайтом и встраивается всюду: в офисные пакеты, в поисковики, в операционные системы, в мессенджеры. Появляются голосовые режимы, работающие в реальном времени с естественными интонациями. Открытые модели догоняют закрытые с отставанием примерно в год.
2025 — год рассуждения. Массово появляются модели, которые перед ответом «думают»: генерируют длинную внутреннюю цепочку размышлений, проверяют себя, перебирают подходы. Качество на сложных задачах — математика, программирование, анализ — прыгает скачком. Одновременно появляется работа с компьютером: модель видит экран и управляет мышью и клавиатурой.
2026 — год агентов. Основной сдвиг: от «модель отвечает» к «модель делает». Системы выполняют многошаговые задачи с ограниченным надзором, работают с внешними инструментами, обращаются к базам данных, пишут и запускают код. Точность на тестах управления компьютером выросла с уровня ниже 15% в конце 2024 года до примерно 72% к началу 2026-го.
К середине 2026 года на фронтире конкурируют несколько сопоставимых по силе семейств моделей от разных компаний, и универсального победителя нет: одни лучше в программировании, другие — в длинных документах, третьи — в скорости или цене. Для пользователя это скорее хорошо: конкуренция держит цены низкими и заставляет всех быстро улучшаться.



