ИИ. История машины, которая научилась говорить

- -
- 100%
- +
ALPAC стал сильным предупреждением для широкой области, потому что поднял неудобный вопрос: кто решает, какой результат считается достаточным? Переводчик может ценить помощь, даже если она не заменяет его работу. Заказчик может требовать полной автоматизации. Исследователь может считать ценным новый метод, даже если коммерческая польза отложена. Один отчёт редко способен одновременно оценить все эти виды ценности.
Невозможность, неудача и неподходящая цена
Когда система не достигает обещанного, люди обычно смешивают три разных вывода. Первый: конкретная программа оказалась слабой. Второй: используемый метод плохо справляется с этим типом данных или масштабом задачи. Третий: сама задача невозможна для машин. Первый и второй выводы могут быть основаны на опыте. Третий требует намного более сильного доказательства.
В 1966 году слабость машинного перевода не означала, что компьютер никогда не сможет переводить тексты с практической пользой. Но позднейший успех статистических или нейронных методов не делает раннюю критику несправедливой. Если система того времени была медленнее, дороже и менее точной, чем альтернативный процесс, это было важным фактом о той системе. Будущее не может задним числом сделать её более полезной.
Так же важно не путать «невозможно» и «не готово». Некоторые проблемы действительно требуют новых идей; другие становятся решаемыми, когда появляется больше вычислительной мощности, данных или качественно иной алгоритм; третьи остаются дорогими из-за нужды в человеческом контроле. В середине XX века невозможно было знать, какой из этих случаев перед исследователями. Поэтому честный отчёт должен говорить о том, что можно измерить сейчас, и ясно обозначать, что остаётся гипотезой.
Технологическое обещание часто содержит срок, но не всегда содержит план проверки. «Когда-нибудь компьютер сможет переводить всё» — практически бессодержательное обещание, если не сказано, какой язык, какая предметная область, какой уровень ошибок, сколько времени и при чьём контроле. ALPAC показал цену отсутствия этих условий. Комитет спрашивал не только о том, существует ли демонстрация, но и о затратах всего процесса.
Это не означает, что вся фундаментальная наука должна оправдываться немедленной окупаемостью. Ядерная физика, теория информации и многие математические результаты могли долго не иметь массового применения. Но практическая программа, которую финансируют именно потому, что обещана скорое решение, не может бесконечно просить оценивать её как чистое исследование. Здесь проблема часто не в науке, а в двусмысленности заявления: публике обещают продукт, а при провале защищают фундаментальную идею.
Идеи могут быть ценны и без продукта. Продукт может быть полезным, даже если он не реализует все теоретические амбиции. Но нельзя подменять одно другим в разговоре о результатах. Когда задача узкая, это нужно говорить. Когда результат экспериментальный, его не следует рекламировать как готовое решение. Когда обещан масштаб, нужно объяснить, что позволит системе его достигнуть.
У каждого результата свой метр
Финансирующая организация часто просит один ответ: достиг ли проект цели? Но в молодой области сама цель может иметь несколько уровней. Программа может доказать, что операция вычислима; получить устойчивый результат на тщательно заданном наборе; продемонстрировать пользу в одной организации; стать экономически выгодной; наконец, приблизиться к общему интеллекту. Успех на одном уровне не автоматически отвечает на следующий.
Это видно на переводе. Машина могла показать, что определённые конструкции можно преобразовать автоматически. Затем нужно было проверить качество на тексте, который не готовили специально. Потом — оценить, помогает ли черновик переводчику. И лишь затем — спросить, сможет ли система заменить часть профессионального процесса. Если публичный рассказ перепрыгивал через эти ступени, появлялось разочарование; если отчёт считал ценным только конечный продукт, он мог недооценить промежуточные научные результаты.
Та же проблема существовала в робототехнике. Один удачный захват предмета доказывает, что определённая конфигурация сработала. Стабильная серия захватов — уже лучшее свидетельство надёжности. Работа в незнакомой комнате — более сильное испытание переноса. Способность действовать без заранее подготовленной среды — ещё более высокая планка. Слова «робот умеет брать предметы» не говорят, на какой именно ступени находится система.
Полезный отчёт должен поэтому называть измеряемый уровень, а не только итоговый ярлык. «Система работает» слишком расплывчато. «Система правильно обрабатывает заданный набор примеров при ручной проверке результата» — длиннее, зато сообщает границы вывода. Такая точность могла бы снизить завышенные ожидания и одновременно позволить обществу ценить ранний прогресс, не принимая его за готовый продукт.
В этом смысле спор 1970-х касался не только будущего ИИ, но и языка оценки. Кто выбирает метр? Какой этап считать достаточным, чтобы продолжить грант? Когда узкое улучшение оправдывает расширение проекта? Эти вопросы не имели универсального ответа, но их отсутствие делало разочарования почти неизбежными.
Комбинаторный взрыв: не один враг, а свойство масштаба
В 1970-е обсуждение ограничений ИИ часто приводило к выражению «комбинаторный взрыв». Термин звучит как предупреждение о катастрофе, хотя описывает простую арифметику. Если в каждом шаге у программы есть несколько вариантов выбора, число возможных цепочек быстро растёт с длиной задачи. Из двадцати действий можно составить множество последовательностей; если каждое действие открывает новые состояния, перебор очень быстро становится невозможным.
Представим робота, которому нужно забрать книгу со стола. В лаборатории стол пуст, книга лежит в известной точке, путь свободен, рука заранее настроена. Программа выбирает заданный порядок: подъехать, схватить, поднять, переместить. Теперь добавим реальную комнату. На столе чашка; книга частично закрыта бумагой; свет падает сбоку; ручка робота движется с погрешностью; человек ставит сумку на пути. Система должна распознать, какие предметы перед ней, какие важны, что можно двигать, что нельзя, как избежать столкновения и что считать успешно выполненной задачей.
Каждая новая возможность добавляет ветвления. Можно выбрать разные цели, разные предметы, разные способы захвата, разные маршруты. Программа, которая перебирала варианты в маленьком мире, может оказаться беспомощной в комнате, где человек даже не замечает половины условий. Он использует знания о том, что такое стол, книга, край, хрупкий предмет, препятствие. Эти знания не появляются автоматически из списка возможных движений.
Комбинаторный взрыв был не открытием 1970-х и не приговором искусственному интеллекту. Исследователи давно знали, что полный перебор растёт слишком быстро. Разные методы пытались уменьшать пространство поиска с помощью эвристик: правил, которые помогают выбирать перспективные варианты и игнорировать маловероятные или бессмысленные. Вопрос заключался в том, удастся ли сформулировать достаточно хорошую эвристику и сколько знаний придётся заранее вложить в систему.
Ещё один вопрос: как система узнает, что попала в новый случай? Если программа отбрасывает вариант, который кажется ей бесперспективным, а тот на самом деле ведёт к решению, эвристика может отсечь нужный путь. Если не отбрасывать почти ничего, поиск разбухает. Умение выбирать — не бесплатное сокращение вычислений; оно само требует знания задачи и критериев.
Слово «взрыв» иногда звучало так, будто достаточно добавить компьютеру больше мощности — и трудность исчезнет. Но рост вычислительной скорости не всегда успевает за ростом вариантов. Это похоже на увеличение скорости автомобиля, когда число развилок удваивается после каждого километра: быстрее ехать полезно, но карта всё равно становится сложнее. Новые ресурсы решают часть проблем и одновременно позволяют ставить более трудные задачи.
Лайтхилл сделал комбинаторный взрыв центральным объяснением разочарований, но не изобрёл сам аргумент и не был единственным, кто его обсуждал. Его отчёт придал этой трудности особый вес для финансирующего совета. Для искусственного интеллекта он стал вопросом о том, есть ли у поля общий способ справляться с ростом сложности или существуют только локальные алгоритмы, применимые к отдельным задачам.
Британия искала собственный масштаб
К началу 1970-х британские университетские группы пытались понять, какое место занимать в международной вычислительной науке. В Эдинбурге работали над машинной логикой, восприятием и робототехникой; в других университетах развивались лаборатории экспериментальной биологии, машинного зрения и автоматизации. У этих групп были разные научные вопросы, но государственному совету нужно было решать, что именно из множества заявок является частью «искусственного интеллекта» и как сравнить просьбы о поддержке.
У области не было единого согласованного определения. Кто-то видел её как производство автоматических помощников, кто-то — как теорию интеллекта, кто-то — как математическое моделирование нервной системы. Одна и та же лаборатория могла работать одновременно на нескольких стыках. Из-за этого счётчик «сколько сделано ИИ?» не имел очевидной единицы измерения.
Такой административный вопрос легко принять за бюрократическую помеху. На деле он определял рамку продолжения работы. Если совет считал робототехнику прикладной, он мог требовать показать полезный аппарат. Если считал её инструментом для когнитивной теории, результатом могли быть знание о планировании или обработке сигналов. Если воспринимал её как обещание общего машинного интеллекта, планка результата уходила в будущее.
Лайтхиллу поручили превратить неоднородную область в обзор, пригодный для решений. Это не означало, что сам совет уже решил закрывать лаборатории. Но растущее число заявок означало, что привычное доверие больше не было достаточным: нужно было объяснить, какие направления существуют, чего уже достигли и почему следующие инвестиции оправданы.
Чистый мир и настоящая комната
Многие ранние программы проверяли в так называемом «мире блоков»: несколько предметов, плоская поверхность, ограниченный набор действий. Это был полезный лабораторный мир. Исследователь мог изолировать проблему планирования: какие действия нужно выполнить, чтобы переместить блок A из-под блока B, не нарушая заданных правил? Если программа находила допустимую последовательность, это показывало, что поиск и представление состояния можно автоматизировать.
Но реальная комната добавляет неопределённость ещё до первого действия. Предмет может быть частично закрыт; его контур может совпадать с фоном; поверхность — быть скользкой; освещение — менять оттенок; рука робота — иметь погрешность. Система должна решить, что именно видит, а затем выяснить, какое действие безопасно. Если план рассчитан на состояние «блок стоит здесь», а камера ошиблась на несколько сантиметров, дальнейшие шаги могут последовательно закрепить ошибку.
У человека такой сбой часто остаётся незаметным. Мы слегка меняем хват, переставляем ноги, замечаем, что предмет тяжелее, чем выглядит. Каждый небольшой коррективный акт использует знания, приобретённые в обычной жизни. Компьютерная программа, напротив, должна иметь процедуру для каждого случая, который может нарушить план. Можно добавить новые правила, но это увеличивает пространство возможных взаимодействий и число исключений, которые тоже нужно учитывать.
Так становится понятно, почему победа в лабораторном сценарии не была бессмысленной и одновременно не решала задачу робота для дома. Упрощённый мир позволял увидеть, какую часть поведения уже можно формализовать. Реальная среда показывала, сколько ещё скрытых предпосылок остаётся незаданными. Ошибка состояла не в том, чтобы начать с маленького мира; ошибка возникала, когда маленький мир выдавали за близкий эквивалент большого.
Лайтхилл видел именно этот разрыв в робототехнике. Даже различить предметы разной формы на достаточно чистом фоне требовало значительных вычислений; зрительно-моторная координация добавляла инженерные сложности, которые не исчезали от простого увеличения скорости компьютера. Его описание было пессимистичным, но сама сложность задачи подтверждалась опытом лабораторий. Спорным оставалось то, что из этих трудностей следовало для долгосрочной ценности исследований.
Лайтхилл получает поручение
В Великобритании к началу 1970-х складывалась своя история охлаждения. Исследования искусственного интеллекта были сосредоточены в нескольких университетских группах, особенно заметных в Эдинбурге, Кембридже и других центрах. Учёные работали над робототехникой, машинным восприятием, моделями мозга и общими теориями решения задач. Это была небольшая область, но она уже обращалась к Science Research Council за заметной поддержкой.
Совет получал всё больше заявок на исследования, которые относили к ИИ, и хотел иметь общую оценку поля. Он попросил математика Джеймса Лайтхилла подготовить обзор. Лайтхилл был известным специалистом по прикладной математике, не исследователем ИИ. Этот факт позже стал предметом критики. Однако Совет намеренно искал внешнего оценщика, который мог бы рассмотреть заявки с позиции человека вне сообщества.
В самом докладе Лайтхилл честно описал условия работы. Он изучил литературу и разговаривал с исследователями примерно два месяца; назвал текст личной оценкой, а не исчерпывающим техническим обзором. Это уточнение важно. Документ не претендовал на окончательный приговор всей области. Он был инструментом для совета, которому нужно было решать, как распределять ресурсы.
В 1972 году Лайтхилл завершил свой обзор; в 1973 году Science Research Council опубликовал его в сборнике вместе с комментариями учёных. Заглавный текст назывался «Искусственный интеллект: общий обзор». Публичный формат позволял не только прочитать оценку внешнего эксперта, но и увидеть ответы людей, чьи программы и лаборатории оценивались. Таким образом доклад стал и административным документом, и площадкой для открытого спора.
Лайтхилл пытался не просто перечислить удачные и неудачные программы. Он спрашивал, существует ли у ИИ достаточная научная связность, чтобы оправдать отдельную область исследований, и как оценивать движение от локальных задач к более общим формам интеллекта. Его критика относилась к большой дистанции между обещанными целями и достигнутыми результатами. Роботы, которым приписывали зрение и здравый смысл, работали в специально подготовленных условиях; перенос в обычный мир оставался чрезвычайно трудным.
Представитель финансирующего совета спрашивал: если в заявке говорится об общем интеллекте, по каким промежуточным результатам оценить прогресс? Исследователь мог ответить, что теория развивается и измерить её пользу заранее невозможно. Это не обязательно означало, что один из них не понимает науку. Они решали разные задачи: один распределял ограниченные средства между конкурирующими предложениями, другой искал объяснительный принцип, который не обязан сразу стать продуктом.
Лайтхилл был не злодеем, который пришёл закрыть лаборатории. И исследователи не были безответственными мечтателями, которые просто просили денег на роботов из фантастики. Разногласие касалось того, как связать фундаментальный поиск с практическими целями и когда считать обещание достаточно зрелым, чтобы продлевать финансирование.
Буквы A, B и C
Лайтхилл разделил исследовательское поле на три категории. «A» — продвинутая автоматизация, то есть применение вычислений к задачам с практической целью. «C» — модели центральной нервной системы, где компьютеры помогали исследовать биологические и психологические механизмы. «B» — создание роботов и более общих систем, которые должны были связать методы автоматизации с моделями познания и поведения.
Такая схема делала поле наглядным для человека, который должен оценить, что именно финансировать. Но она была не нейтральной картой. В категории A находились более прикладные задачи, а в C — работы, опиравшиеся на биологические вопросы. Самая смелая претензия на собственно искусственный интеллект концентрировалась в B: программа должна была получить общее поведение, которое не сводится к одной автоматизируемой операции или к одной модели мозга.
Лайтхилл считал, что достижения A и C можно оценивать по их собственным целям, хотя и там прогресс оказывался скромнее некоторых ожиданий. Для B, которую он связывал с построением роботов, разрыв между целями и результатами был особенно велик. Роботы в лабораториях с трудом справлялись с задачами, которые человеку кажутся элементарными: видеть объекты, координировать движение, перемещаться по незнакомой среде. Отсюда он задавал вопрос, насколько разумно финансировать промежуточный проект, если он не демонстрирует ни быстрой прикладной ценности, ни ясного научного результата.
Критика исследователей была направлена не только на его скепсис, но и на сами категории. Некоторые возражали, что Лайтхилл помещает базовые исследования интеллекта в категорию «строительства роботов», словно робот — конечная цель, а не испытательное оборудование для теоретической работы. Другие настаивали, что исследования эвристик, представлений и программирования уже дают знания о том, как организовать сложное поведение, даже если робот не способен обслужить дом.
Вот где спор становился вопросом об определении поля. Лайтхилл видел отдельные исследовательские программы и спрашивал, образуют ли они одну связную дисциплину. Его оппоненты видели общую задачу — понять и моделировать интеллектуальное действие — и считали, что множество локальных экспериментов со временем соединятся в общую теорию. Если каждый оценивается по краткосрочной практической отдаче, такая теория может так и не появиться; если область защищает себя лишь будущим синтезом, совету трудно решить, когда она добилась прогресса.
Лайтхилл был особенно обеспокоен тем, что рост компьютеров сам по себе не решит проблему. Если число возможных состояний увеличивается гораздо быстрее, чем скорость обработки, просторный склад гипотез может превратиться в ловушку. Чтобы двигаться дальше, нужна не просто более мощная машина, а организация знания и стратегии поиска. В этом пункте критика касалась реальной технической трудности, хотя выводы о сроках и перспективах оставались спорными.
В докладе были также упомянуты очень широкие предсказания о машинах, способных превзойти человека в течение десятилетий. Лайтхилл сопоставлял их с тем, что исследователи уже умели делать. Это было сильное риторическое решение: читатель видел не только локальный результат, но и расстояние до заявленного будущего. В ответ участники сообщали, что такие предсказания не отражали взгляды большинства специалистов или не были планом их лабораторий.
Этот спор тоже нельзя свести к тому, что «учёные обещали сверхразум, а потом не смогли». Некоторые самые громкие прогнозы были публичными и реальными, но не каждый исследователь их разделял. Преувеличение ожиданий могло приходить из заголовков, заявок, интервью или из отдельных оптимистических оценок. Нельзя распределить ответственность за общий образ технологии по одному набору цитат. Нужно смотреть, кто говорил, в каком контексте и какие решения эти слова должны были убедить принять.
Ответы и публичная сцена
Сборник Science Research Council включал не только обзор Лайтхилла, но и ответы других участников. Среди тех, кто спорил с его формулировкой поля и оценкой результатов, были британские исследователи Дональд Мичи и Ричард Грегори; американский учёный Джон Маккарти также изложил возражения. В 1973 году дискуссия продолжилась в публичных дебатах в Королевском институте в Лондоне. Телевизионная камера фиксировала спор, который обычно происходит в грантовых отзывах, письмах и коридорах университетов.
Публичная сцена привлекала внимание именно потому, что за ней стоял распределительный вопрос. Разговор был не только о том, можно ли считать эвристику признаком общего интеллекта или правильна ли классификация «A/B/C». Он касался того, какие исследования получат ресурсы, каким лабораториям дадут возможность продолжать работу и какие обещания будут считаться обоснованными.
Мичи и другие исследователи возражали против того, чтобы судить общие методы только по видимому поведению роботов. В их интерпретации робототехника могла быть способом проверять теорию: машина — лабораторный прибор, на котором видно, как представления и планы взаимодействуют с миром. Если смотреть только на то, насколько полезен сам робот, можно не заметить теоретическую ценность эксперимента. Похожим образом аэродинамический туннель ценен не потому, что сам летит, а потому, что позволяет изучать полёт.
Это сильный аргумент, но он не отменяет вопроса совета: сколько стоит эксперимент и как понять, что теория действительно продвигается? Фундаментальная наука не обязана немедленно выпускать продукт, но и слово «теория» не может автоматически оправдать любой проект. Нужны критерии, и сами критерии становятся частью научного спора.
Лайтхилл отвечал за оценку от внешнего лица и практических перспектив; участники — за описание внутренней логики исследований. Их позиции не симметричны: одному поручили помочь совету принять бюджетные решения, другие защищали направления, в которых работали. Это не лишает ни одну сторону аргументов. Напротив, показывает, почему спор нельзя читать как чистую техническую дискуссию. У разных участников были разные обязанности и разные риски.
В публичном поле отчёт начал означать больше, чем его страницы. Для политиков он мог быть сигналом, что ожидания завышены. Для исследователей — сомнением в легитимности всей дисциплины. Для газет — историей о том, что машины разочаровали. Сборник с ответами усложняет эту картину, потому что фиксирует сам процесс несогласия. Это был не приговор, с которым никто не спорил, а полемика, где стороны пытались определить, что считается исследовательским прогрессом.
Американская переоценка шла своим путём
В США за военные исследования ИИ отвечали не те же учреждения, что распределяли университетские гранты в Великобритании. Одним из заметных источников поддержки была DARPA — ведомство, финансировавшее исследовательские программы с возможным значением для обороны. У таких программ был особый договор с фундаментальной наукой: заказчик мог дать исследователям свободу, пока верил, что долгий поиск в итоге создаст важные возможности.
По мере накопления разочарований эта свобода сужалась. После того как британский спор стал заметен в США, Министерство обороны организовало American Study Group для оценки программы ИИ. Исторический обзор National Research Council связывает эту проверку с изменением приоритетов DARPA: средства стали больше направлять на «миссионные» исследования с более ясной связью с оборонными задачами и меньше — на неограниченный поиск общих методов. Это было не простое прекращение финансирования, а смена условий доступа к нему.
На практике различие могло быть жёстким. Группа, которая строила робота для общего исследования восприятия и движения, должна была объяснить, как её работа связана с конкретной задачей. Программа речи, планирования или машинного зрения с понятным заказчиком получала более убедительную заявку. При этом граница между фундаментальным и прикладным не всегда чистая: методы, созданные для одной задачи, могут позже оказаться полезны в другой. Но в момент составления бюджета будущее применение конкурировало с задачами, которые уже имели заказчика.
Эта система создавала не только давление, но и новые возможности. Оборонные проекты могли финансировать дорогостоящие вычисления, крупные команды и долгую инженерную работу. Прикладной фокус также заставлял исследователей измерять производительность на реальных условиях. Обратная сторона — риск, что программы, не способные быстро показать миссионную пользу, перестанут получать поддержку, даже если их научная ценность ещё не прояснилась.
Поэтому американскую часть первой зимы лучше описывать как изменение режима финансирования, а не как «DARPA бросила ИИ». Отдельные программы продолжали существовать, но у исследовательских групп появлялся более узкий коридор, в котором нужно было обосновывать работу. Сильнее всего это било по направлениям, чья польза заключалась в общем понимании интеллекта, а не в готовой функции для определённого заказчика.
Лайтхилл не закрыл американские лаборатории
Часто можно встретить версию, будто отчёт Лайтхилла вызвал первую зиму искусственного интеллекта во всём мире. Это неверно по географии и по времени. Его мандат относился к британскому исследовательскому полю и решениям Science Research Council. В Соединённых Штатах финансирование и политика менялись по собственной траектории, хотя британская дискуссия повлияла на то, как американские ведомства обсуждали свои программы.



