Нейросети человеческим языком. Освойте ИИ и станьте востребованным специалистом

- -
- 100%
- +

© Ренат Фатуллин, 2026
ISBN 978-5-0071-3390-6
Создано в интеллектуальной издательской системе Ridero
Вступление
Через неделю после релиза
Я открыл его не в день выхода, а примерно через неделю — в начале декабря 2022 года. Пост OpenAI «Introducing ChatGPT» вышел 30 ноября, без презентации на сцене, почти буднично. Я задал случайный вопрос, не помню уже какой, и полминуты читал ответ: ровный, связный, по-настоящему живой текст, а не пересказ первой страницы поисковой выдачи и не программа с заранее прописанными фразами.
Ощущение было не «удобно». Ощущение было «что-то сместилось». Как будто мир, каким мы его знали, изменился.
Скажу сразу, чтобы вы могли сделать на это скидку: я по складу характера ранний последователь. Новое устанавливаю первым, на любую технологию смотрю с интересом, а не с подозрением, и открыл ChatGPT в первую же доступную мне неделю не по работе, а потому что не мог не открыть. Это не нейтральная позиция, и лёгкость, с которой мне даются такие решения, — не то же самое, что лёгкость, с которой они дадутся вам. Мой собственный путь от «попробовал — не заработало» до «работаю с этим каждый день» занял два года, не два месяца. Что случилось в середине — в первой главе.
Возможно, один из самых значимых моментов
У меня нет привычки к громким формулировкам, но здесь без одной не обойтись: похоже, мы застали один из самых значимых периодов за всю историю человечества. Меняется не частность — меняется то, на чём держались представления о работе, об уме и о том, кто получает преимущество в профессии. Эта книга — не попытка предсказать, чем всё кончится. Это попытка дать вам навигацию по уже начавшимся переменам, чтобы вы разобрались в них раньше, чем они разберутся с вами, и прошли этот отрезок пути успешно — на своём рабочем месте, с той профессией, которая у вас уже есть.
Три вещи, ради которых эта книга написана
Первая — не остаться за бортом. Скажу это прямо и только один раз, а дальше не вернусь к этому страху: перемены такого масштаба задевают любую профессию, и человеку, который годами строил карьеру, разумно спросить, что с ней будет. Сроками и катастрофой пугать не буду — точных сроков не знает никто, а книга, которая берётся их называть, вас обманывает.
Вторая, и главная: работать лучше и жить легче. Меньше рутины, быстрее черновики, спокойнее вечера, выше качество того, что вы в итоге отдаёте клиенту, начальнику или самому себе.
Третья: найти новые возможности. Внутри своей компании, в виде новой услуги, подработки или своего проекта — спрос на людей, которые умеют это по-настоящему, уже есть. Как он выглядит и как проверить свою гипотезу на малом, не бросая основную работу, — в главах 20 и 21.
Кто вам это рассказывает
Коротко — подробный путь ждёт вас в конце книги, в главе «Об авторе». Я не инженер и не обучаю модели: этим занимаются другие люди, и там, где книге нужна инженерная глубина, я буду говорить прямо — здесь я не эксперт. Я руковожу производством видеоконтента для внешних клиентов: сроки, бюджеты, команды по всему миру. ИИ для меня не предмет изучения ради самого изучения, а инструмент, которым я эту работу делаю каждый день.
Главный принцип: после каждой главы вы что-то сделаете
После каждой главы — конкретное задание на десять-тридцать минут, с результатом, который можно потрогать на вашей рабочей задаче. Пропускайте задания — и на выходе получите общее представление вместо рабочего навыка. Тратьте на них время — и через двадцать шесть глав у вас будет не книга на полке, а система, которая уже работает.
Как здесь даются советы
По каждому шагу я называю один порядок действий — тот, который считаю правильным. Альтернативы, если они есть, идут после и коротко. Вы не найдёте здесь «зависит от ваших предпочтений» или «попробуйте оба варианта и решите сами» — это способ ничего не посоветовать, спрятанный за уважением к вашей самостоятельности. Там, где ваша ситуация действительно другая, в тексте прямо сказано, где свернуть.
Как читать эту книгу
Совет по умолчанию простой: читайте по порядку и не пропускайте разделы. Ни один здесь не лишний — если сейчас какой-то покажется не вашим, через две-три главы связь станет видна, а цельная картина сложится только у того, кто прошёл книгу целиком.
Ещё до первой страницы
Книга написана в сентябре 2026 года, и это важно: половина в ней — навык, который не устареет, половина — снимок того, чем сейчас пользуются люди и компании. Всё, что может устареть за несколько месяцев — версии, цены, лимиты, — стоит отдельно, во врезке «Сейчас» с датой, и никогда не в основном тексте. Дата редакции — на титульном листе.
И формальность, которую лучше сказать один раз и забыть: книга написана для практики и не заменяет юриста или финансового консультанта там, где решение стоит денег или подписи. Ни с одной из упомянутых на этих страницах компаний я не связан коммерческими отношениями.
Договорились. Вместе с первой главой начинается ваш путь в удивительный мир искусственного интеллекта.
Часть I. Что это такое и как мы сюда пришли
Глава 1. Как мы сюда пришли: короткая история ИИ
8 июля 1958 года «Нью-Йорк Таймс» вышла с заметкой под заголовком «Новое устройство ВМС учится на практике». Речь шла о машине, которую психолог Фрэнк Розенблатт показал журналистам в Корнеллской авиационной лаборатории в Буффало. Газета передала ожидания военных без тени иронии: перед публикой «зародыш электронного компьютера, который, как рассчитывает флот, сможет ходить, говорить, видеть, писать, воспроизводить себя и осознавать своё существование». Журнал «Нью-Йоркер» добавил, что это «первый серьёзный соперник человеческого мозга из когда-либо созданных».
Умела она к тому моменту следующее: после пятидесяти попыток научилась отличать перфокарты с меткой слева от перфокарт с меткой справа.
Устройство называлось перцептрон. Оно смотрело на мир через решётку из четырёхсот фотоэлементов, двадцать на двадцать. Его память состояла из потенциометров — тех самых ручек-регуляторов, что стояли в ламповых радиоприёмниках. Когда машина ошибалась, электромоторы поворачивали ручки, и в следующий раз она ошибалась чуть меньше.
Между этой машиной и той, которая сегодня пишет за вас деловые письма, идёт прямая линия. Идея за шестьдесят восемь лет изменилась удивительно мало. Изменились условия, при которых она работает, и на то, чтобы эти условия сошлись в одной точке, ушло больше полувека. Эта глава — про то, каких именно условий не хватало и почему они появились только сейчас.
Вы это уже пробовали
Скорее всего, ваш первый настоящий разговор с моделью случился в 2023 году, и закончился он смешанным чувством.
Вы попросили написать коммерческое предложение и получили текст, который подошёл бы любой компании в любой отрасли. Вы попросили посчитать — и получили красивое число, которое при проверке оказалось выдуманным. Вы задали вопрос про свою профессию, в которой работаете пятнадцать лет, и получили пересказ первых страниц поисковой выдачи. Где-то на третьей попытке появилась мысль: вокруг этого слишком много шума.
Мысль была верной, и у неё была техническая причина — даже несколько.
Модель того поколения отвечала одним проходом: получила вопрос, сразу начала писать ответ и не имела возможности остановиться и переписать. Она не видела ваших документов, ваших цифр и ваших прошлых проектов, поэтому отвечала усреднённо по всему, что видела при обучении. Она не умела пользоваться инструментами: не могла открыть браузер, чтобы проверить факт, и калькулятор, чтобы проверить арифметику. И она была устроена так, что уверенный тон достаётся ей бесплатно, а точность — нет.
Каждое из этих четырёх ограничений за последние три года было снято отдельным техническим решением. Разбирать их я буду в следующих главах. Но чтобы понимать, чему верить в новостях и чего ждать дальше, полезно сначала увидеть всю дугу целиком: откуда эта идея взялась, почему дважды казалась мёртвой и что конкретно изменилось.
Лето 1956 года: у идеи появляется имя
31 августа 1955 года четыре человека подали в Рокфеллеровский фонд заявку на 13 500 долларов. Они просили денег на двухмесячный летний семинар для десяти исследователей.
Заявку подписали: Джон Маккарти, двадцативосьмилетний ассистент-профессор математики Дартмутского колледжа; Марвин Минский из Гарварда; Натаниэль Рочестер из IBM, конструктор первого серийного компьютера компании; и Клод Шеннон из Bell Labs, автор теории информации, на которой стоит вся современная связь. Компания, мягко говоря, не рядовая.
Дартмутский колледж — частный университет Лиги плюща в городке Ганновер, штат Нью-Гэмпшир, на границе с Вермонтом. Место тихое и удалённое, и это было частью замысла: собрать людей там, где им не помешают.
В заявке была фраза, которую с тех пор цитируют как свидетельство о рождении области:
«Исследование будет вестись на основе предположения, что всякий аспект обучения или любое иное свойство интеллекта в принципе может быть описано настолько точно, что машина сможет его смоделировать».
Обратите внимание на «в принципе». Это не обещание результата, это заявленная рабочая гипотеза. За семьдесят лет она ни разу не была ни доказана, ни опровергнута.
Семинар прошёл с 18 июня по 17 августа 1956 года. Устроен он был как мастерская: люди приезжали и уезжали, кто на неделю, кто на месяц; постоянно присутствовали трое. Работали по семи темам, среди которых были автоматические вычислители, использование машиной языка, нейронные сети, самоулучшение программы, абстракции, а также случайность и творчество.
Отдельного упоминания заслуживает само название. Термин «искусственный интеллект» (artificial intelligence, отсюда привычное сокращение AI) придумал Маккарти, и придумал по причине вполне земной: нужно было слово, не занятое чужой школой. Главной школой того времени была кибернетика Норберта Винера, человека влиятельного и тяжёлого в общении. Новое имя позволяло не воевать за определения и не работать под чужим флагом.
Итог семинара: у направления появились имя, программа исследований и круг людей. Ответа на главный вопрос не появилось ещё пятьдесят шесть лет.
Как машина «учится»: главная идея, которой семьдесят лет
Здесь стоит остановиться и разобрать механику, потому что всё остальное в книге на неё опирается.
Обычная программа — это записанные человеком правила. Бухгалтерская программа считает налог, потому что программист прочитал закон и перевёл его в инструкции. Такой подход упирается в стену там, где правило невозможно записать: попробуйте объяснить словами, по каким признакам вы отличаете кошку от собаки на фотографии, или почему одно письмо звучит вежливо, а другое грубо.
Розенблатт предложил другой путь. Его машина не содержала правил распознавания. Она содержала веса (weights) — числа, которые определяют, насколько сильно каждый вход влияет на ответ. В «Марк I» эти числа были физическими: положение ручки потенциометра. Дальше работал цикл, который лежит в основе всего машинного обучения до сегодняшнего дня:
1. Машине показывают пример с известным правильным ответом.
2. Она выдаёт свой ответ.
3. Ответы сравнивают, ошибку измеряют.
4. Веса чуть-чуть подкручивают в сторону, которая уменьшает ошибку.
5. Повторить. Много раз.
Этот способ называется обучением с учителем (supervised learning): учитель здесь — набор примеров с правильными ответами. Программу в таком подходе не пишут, её настраивают. Знание не формулируется словами, оно оседает в тысячах чисел, каждое из которых само по себе ничего не значит.
Идея красивая, и у неё сразу обнаружился предел. В 1969 году Марвин Минский — тот самый, из дартмутской заявки — вместе с Сеймуром Папертом выпустил книгу «Перцептроны». В ней было показано, что однослойная сеть не способна выучить даже элементарную функцию «либо одно, либо другое, но не оба сразу» (в информатике её называют XOR). Причина геометрическая: такая сеть умеет провести между примерами только одну прямую границу, а для XOR одной прямой не хватает.
Минский и Паперт знали, что многослойная сеть это ограничение снимает. Но никто не умел обучать многослойные сети: способ подкручивать веса в глубине, а не только на выходе, ещё не был найден. Книгу прочитали как приговор всему направлению. Деньги ушли, и на полтора десятилетия сети исчезли из повестки.
Розенблатт до реабилитации своей идеи не дожил: он утонул во время прогулки на яхте в 1971 году, в день своего сорокатрёхлетия.
Две зимы: почему идея дважды считалась мёртвой
У области есть собственный термин для таких периодов — зима ИИ (AI winter). Это не метафора настроения, это про деньги: момент, когда обещания не сбываются, финансирование прекращается и тема становится неприличной в заявках на гранты.
Первая зима, середина 1960-х — начало 1980-х. В 1966 году американская комиссия ALPAC подвела итог десятилетию работ по машинному переводу, на которые ушло около 20 миллионов долларов. Вывод: человек переводит дешевле и точнее машины. Финансирование закрыли полностью.
Через семь лет то же самое произошло в Великобритании. Физик Джеймс Лайтхилл по заказу парламента оценил результаты британских исследований и назвал главную причину провала — комбинаторный взрыв (combinatorial explosion). Понятие простое и важное: число вариантов, которые нужно перебрать, растёт быстрее, чем растут вычислительные возможности. Программа, которая уверенно решает задачу с десятью объектами, при сорока объектах не решит её до конца существования Вселенной. Методы того времени работали на игрушечных примерах и рассыпались на настоящих. После отчёта Лайтхилла исследования ИИ в Британии свернули почти полностью.
Второе дыхание и вторая зима, 1980-е. Область вернулась через экспертные системы (expert systems) — программы, в которые вручную записывали правила вида «если симптом А и симптом Б, то диагноз В», собранные из бесед с профессионалами. Это работало. Система XCON, конфигурировавшая заказы компьютеров в корпорации DEC, сэкономила ей около 40 миллионов долларов за шесть лет. К 1985 году корпорации тратили на такие разработки больше миллиарда долларов в год. Япония запустила национальный проект «ЭВМ пятого поколения» с бюджетом порядка 850 миллионов долларов.
Под это вырос отдельный рынок специализированных компьютеров — LISP-машин, заточенных под язык, на котором такие системы писали. Объём рынка доходил до полумиллиарда долларов в год. В 1987 году он исчез за двенадцать месяцев: обычные рабочие станции стали справляться с той же работой дешевле.
Экспертные системы рухнули по причине, которую стоит запомнить. Знание в них приходилось вносить руками, и стоило это дорого. Система не училась на новых случаях. Каждое исключение из правила требовало нового правила, а число исключений в реальном мире не кончается. Поддержка дорожала быстрее, чем росла польза.
Оба раза причина была одна: идею нечем было накормить.
Три условия и горький урок
Чтобы идея заработала, должны были сойтись три условия: способ обучать глубокие сети, дешёвые вычисления и данные в промышленных объёмах. Появлялись они поодиночке, с большими перерывами, и до 2012 года ни разу не оказывались в одном месте.
Условие первое: способ обучать глубокие сети. 1986 год.
Сначала о том, что такое слой. Перцептрон был устроен в один слой: входы влияли на выход напрямую, поэтому он умел провести между примерами только одну границу. В многослойной сети между входом и выходом стоят промежуточные слои, и каждый следующий работает с тем, что выделил предыдущий. На фотографиях это выглядит так: первый слой реагирует на перепады яркости, второй складывает их в углы и дуги, третий — в детали вроде глаза или колеса, и только последний говорит «кошка». Что выделять на каждом уровне, никто не задаёт: сеть находит это сама. Отсюда и слово глубокая — слоёв много; отсюда же и термин глубокое обучение (deep learning), который означает буквально «обучение многослойных сетей», и больше ничего.
Здесь и была загвоздка. Подкрутить веса в последнем слое просто: видно ответ, видно правильный, видно ошибку. А что делать с весами в середине, где правильного ответа не существует и сравнивать не с чем? Задача называется распределением вины: надо понять, какая доля общей ошибки приходится на каждое из тысяч внутренних чисел.
Ответ дали в 1986 году Дэвид Румельхарт, Джеффри Хинтон и Рональд Уильямс — статья в журнале Nature про обратное распространение ошибки (backpropagation, в разговоре обычно просто backprop). Идея: ошибку, измеренную на выходе, можно пересчитать назад, слой за слоем, и получить для каждого внутреннего веса его собственную долю вины. Дальше всё как у Розенблатта — каждый вес подкручивают в сторону меньшей ошибки, только теперь это работает на любой глубине.
Способ был найден. Мощности, на которой он даёт результат, ещё не существовало.
Условие второе: дешёвые параллельные вычисления. Обучение сети состоит из миллиардов однотипных простых операций — умножений и сложений. Обычный процессор считает их по очереди, одну за другой. Видеокарта устроена иначе: она рассчитана считать тысячи одинаковых операций одновременно, потому что именно это нужно, чтобы отрисовать миллионы пикселей игрового кадра. Задача обучения сети математически совпала с задачей отрисовки картинки. До середины 2000-х эти ядра были заперты внутри графики: обращаться к ним можно было только через графические библиотеки, то есть объясняя машине задачу на языке треугольников и текстур. В 2006 году Nvidia объявила CUDA — набор инструментов, позволяющий писать под эти ядра обычные расчётные программы, безо всякой графики; первая общедоступная версия вышла в 2007-м. Так видеокарты открылись для науки, а через несколько лет — и для обучения сетей. Игровая индустрия невольно оплатила подготовку инфраструктуры для ИИ.
Условие третье: размеченные данные в промышленных объёмах. В 2006 году исследовательница Фей-Фей Ли начала собирать базу ImageNet. К 2010 году в ней было 14,2 миллиона изображений, разложенных по 21 841 категории, и каждое изображение было подписано человеком. Разметку делали через краудсорсинговую площадку Amazon Mechanical Turk, где тысячи людей по всему миру выполняли микрозадачи за небольшие деньги; сложные случаи проходили до десяти кругов проверки. Такой базы не существовало бы без интернета: ни собрать столько картинок, ни нанять столько рук иначе физически невозможно.
Точка схождения: осень 2012 года. Алекс Крижевский, Илья Суцкевер и Джеффри Хинтон выставили на ежегодный конкурс по базе ImageNet свою сеть, известную теперь как AlexNet.
Задание конкурса выглядело так: программа получает фотографию и должна отнести её к одной из тысячи категорий, от немецкой овчарки до пожарной машины. Учили на 1,2 миллиона размеченных снимков, проверяли на отложенных, которых программа не видела. Попадание засчитывали, если верная категория оказывалась среди пяти вариантов, названных программой самыми вероятными. По этой мерке AlexNet ошибалась в 15,3% случаев против 26,2% у второго места — разрыв, какого в этом соревновании до тех пор не случалось. Обучена она была на двух игровых видеокартах GTX 580 по три гигабайта, за пять-шесть дней, и содержала 60 миллионов настраиваемых весов.
Ни одна из трёх составляющих не была новой сама по себе. Идея сети — 1958 год. Способ обучения — 1986. Видеокарты — товар из магазина электроники. Новым было только то, что всё это оказалось в одной комнате одновременно.
Из этого следует главный вывод главы, и он неприятный. В марте 2019 года Ричард Саттон, один из основателей обучения с подкреплением, опубликовал короткое эссе «Горький урок».
Сюжет, по его наблюдению, повторялся всю историю области. Исследователи вкладывали в программу своё понимание предмета: записывали шахматные принципы, описывали, как устроено человеческое зрение, закладывали правила грамматики. Такие программы работали, пока их не встречала на соревновании другая программа — более простая и ничего не знающая о предмете, зато получившая больше вычислений и больше данных. Проигрывали именно машины машинам. Так вышло в шахматах, в го, в распознавании речи и в компьютерном зрении.
Урок горький потому, что он обесценивает самое дорогое — экспертное знание о предмете. Он же объясняет, почему всё сдвинулось в 2010-е: считать стало дёшево.
Исследовательская группа Epoch AI ведёт базу так называемых заметных моделей. Модель попадает туда, если выполнено хотя бы одно условие: статья о ней собрала больше тысячи цитирований, либо она показала лучший результат на признанном тесте, либо вошла в историю области, либо работает в продукте с большой аудиторией. По их расчёту на 428 таких моделях за период с 2010 года по сентябрь 2025-го объём вычислений, потраченных на обучение, растёт в 4,7 раза в год: удвоение каждые полгода. На последнем обновлении базы, ноябрь 2025 года, тренд держался.
Для сравнения — закон Мура, полвека считавшийся пределом скорости в технике. Гордон Мур сформулировал его в 1965 году: число транзисторов на кристалле удваивается примерно раз в год; в 1975-м уточнил период до двух лет. Так и держалось лет сорок, а с середины 2000-х замедляется — глава Intel Пэт Гелсингер в конце 2023 года говорил уже о трёхлетнем шаге. Удвоение раз в полгода против удвоения раз в два-три года: в таком темпе область живёт последние пятнадцать лет.
Язык: 2017—2022
Сети научились видеть. С языком дело шло тяжелее, и причина была в архитектуре.
До 2017 года язык обрабатывали рекуррентными сетями (по-английски recurrent neural network, RNN) и их улучшенным вариантом LSTM, придуманным в 1997 году. Устроены они так: слова подаются в сеть по одному, и после каждого слова сеть обновляет своё внутреннее состояние — короткую память о прочитанном. Чтобы взяться за десятое слово, нужно состояние после девятого, а для него — после восьмого. Шаги выстроены в цепочку, и разложить их на тысячу видеокарт невозможно: каждая ждала бы предыдущую. Мощности росли, а язык от этого роста почти ничего не получал.
12 июня 2017 года восемь исследователей Google опубликовали статью с названием, ставшим поговоркой: «Внимание — это всё, что нужно». Они предложили архитектуру трансформер (transformer), в которой цепочки нет вовсе. Вместо неё работает механизм внимания (attention): обрабатывая очередной фрагмент текста, модель одновременно смотрит на все остальные и сама решает, какие из них сейчас важны для смысла.
Практическое следствие важнее теоретического. Весь текст теперь обрабатывается за один заход, а значит, обучение раскладывается на столько машин, сколько удастся собрать. Архитектура оказалась пригодной к масштабированию, а из горького урока следует, что именно это и решает.
Дальше пять лет масштаба. Всё это время модели решали одну и ту же задачу: предсказать продолжение текста, кусок за куском, на корпусе (corpus) — так называют большой набор текстов, собранный для обучения: копии веб-страниц, книги, статьи, код, переписку форумов. Никаких правил грамматики внутрь не закладывали. Как из одной этой задачи получается связный ответ на ваш вопрос — механика следующей главы.
Числа роста по одной линейке моделей: первое поколение, 2018 год, — 117 миллионов весов. Второе, 2019-й, — полтора миллиарда. Третье, 2020-й, — 175 миллиардов. Принцип везде один и тот же. Менялся только масштаб, и вместе с масштабом появлялись способности, которых никто отдельно не программировал: перевод, пересказ, написание кода.



