Что не так с вашим промтом

- -
- 100%
- +
Теперь вторая проверка, и она даёт противоположный ответ.
Добария и Кумар, Университет штата Пенсильвания, октябрь 2025 года. Короткая работа, представленная на конференции, — не полноценная статья. Взяли пятьдесят вопросов по математике, естественным науками и истории и переписали каждый в пяти тонах: очень вежливо, вежливо, нейтрально, грубо, очень грубо. Получилось двести пятьдесят промтов, каждый прогнали по десять раз на одной модели.
Получилась ровная лесенка. Очень вежливо — 80,8 процента верных ответов. Вежливо — 81,4. Нейтрально — 82,2. Грубо — 82,8. Очень грубо — 84,8. Ступенька к ступеньке, разрыв между крайними — четыре пункта. Авторы проверили это парными сравнениями, и различия получились не из тех, что получаються по случайности.
Заголовок вырывается сам: Хамите модели — получите лучше. Основатель Google был прав.
Только что делать с предыдущей страницей, где почти пять тысяч прогонов не показали ничего?
Соблазнительно подумать, что перед нами научный спор: одни говорят так, другие эдак, истина где-то рядом. Так вот, спора нет. Авторы из Пенсильвании сами пишут, что их результат расходиться с более ранней работой, где грубость связывали с ухудшением, и сами предлагают, что новые модели могут реагировать на тон иначе, чем прежние. Свои опыты они называют предварительными и допускают, что модели помощнее вообще перестанут замечать тон и займутся существом вопроса. Они ни с кем не воюют. Обе работы сделаны честно. Разница между ними одна, и она не в выводах. Пенсильвания: пятьдесят вопросов, десять прогонов, одна модель. Уортон: сто девяносто восемь вопросов в первом наборе, и во сто вопросов во втором, двадцать пять прогонов, шесть моделей. Прикиньте в уме разницу порядков. В одном случае каждый тон испытан пятьюстами прогонами. В другом каждая приписка — почти пятью тысячами, и так на шести моделях. Четыре пункта, полученные на пятистах прогонах одной модели, и порог в 0,2 пункта, полученные на пяти тысячах прогонов на каждой из шести, — это не два мнения об одном предмете. Это измерение крупным шагом и измерение мелким шагом.
Разница есть. Эффекта нет.
Звучит как игра слов, давайте посмотрим пристальнее. Возьмём верхнюю ступеньку — 84,8 процента при очень грубом тоне. Пятьдесят вопросов, десять прогонов по каждый: пятьсот ответов, из них верных четыреста двадцать четыре. Нижняя ступенька — 80,8, то есть четыреста верных их тех же пятисот. Вся находка целиком — двадцать ответов. Двадцать штук из пятисот, переехавших из одной клетки в другую. И тут стоит заглянуть в соседнюю колонку той же таблицы, которую в пересказах не приводят никогда. Авторы напечатали не только средние, но разбросы по десяти прогонам.
Очень вежливо: от 80 до 82. Вежливо: от 80 до 82. Нейтрально: от 82 до 84. Грубо: от 82 до 84. Очень грубо: от 82 до 86.
Прочитайте нижнюю и верхнюю строки вместе. Худший прогон при очень грубом тоне дал 82. Лучший при очень вежливом дал 82. Одно и то же число. соседние тоны имеют буквально одинаковые границы — не близкие, а совпадающие. Лесенка существует в средних. В отдельно взятом прогоне её нет. Дальше сравнения. Их всего десять, по паре на каждые два тона. Значимыми оказались восемь. Не попали в список ровно две пары, и оде — соседние ступеньки: «очень вежливо — вежливо» и «нейтрально — грубо». То есть два перехода из четырех, из которых лесенка складывается, значимости не показали. А одно из уцелевших различий — «вежливо — нейтрально» — стоит у самого порога, и поправки на десять сравнений, авторы не делали.
И последнее, про единицу счета. Тест сравнивал не пятьсот ответов с пятьюстами, а десять чисел с десятью: точность каждого прогона, спаренная то тонам. Под значимостью тут лежат не сотни, а десятки.
Авторы правы, на их выборке из пятидесяти вопросов разница в двадцать ответов значима и превышает случайную погрешность. Претензий к арифметике нет.
Но эффекта все равно нет. Потому что проверка на случайность отвечает на один вопрос: могло ли выйти так само собой вот в этом замере. Она не отвечает на второй: выйдет ли так же на других пятидесяти вопросах, на другой модели, в другом году. Первый вопрос дешёвый, его задают всегда. Второй дорогой, и его почти никогда не задают, потому что для ответа нужно мерить заново и много. В Уортоне как раз задали второй вопрос. Шесть моделей, две сотни вопросов, двадцать пять прогонов на каждый — в десять раз больше на одну модель. Результат — ноль.
Эффект это то, что регулярно повторяется, при измерениях кем-то другим, на других вопросах, на другой модели. Его нужно заслужить количеством, и заслуживают его редко.
И вот что из этого следует для вас лично. Вы попробовали приём три раза, вышло лучше — у вас на руках результат, полученный на трёх прогонах. Пенсильвания получила свой почти на ста семидесяти таких тройках и вдобавок проверила его на случайность. Этого не хватило. Ни один из двух заголовков — «хамство помогает» и «тон важнее» — не сообщает вам, сколько раз мерили. А выбирать вы будете из заголовков, потому что больше вам ничего не покажут.
И есть в пенсильванской работе еще одно, о чем я до сих пор молчал, потому что оно касается не способностей модели, а самого понятия точности.
Пятьдесят вопросов авторы не составляли. Их сочинила функция глубокого поиска в ChatGTP. Правильные ответы к этим вопросам авторы получили от нее же — и по ним сверяли, что отвечала модель.
Перечитайте последний абзац. Восемьдесят с лишним процентов верных ответов — это доля совпадений одного прохода продукта с другим проходом того же продукта.
Эталона снаружи в этом опыте нет вовсе.
В вину авторам я это не ставлю. Набор задач с проверенными ответами стоит времени и денег, а короткая работа их не оплачивает. Запомнить это надо по другой причине, и она пригодиться вам до конца книги.
Проверка на верность требует, чтобы кто-то знал правильный ответ — и знал его не из той же машины, которую проверяет. Здесь такого знания нет ни у кого. Ни у авторов, ни у читателя, ни у самой модели. Круг замкнулся не в выводе работы, а в самом измерительном приборе.
Дальше вы увидите этот круг ещё много раз и во все более неудобных местах. Первый раз он попался вам здесь — в наборе задач, которыми меряют вежливость.
Осталась третья работа, и с ней случилось то, чего не было с первыми двумя.
Начнем с того, где вы ее встречали. Совет заключается в эмоциональном усилении и выглядит примерно так: Добавьте к запросу фразу «это очень важно для моей карьеры». Исследование показало улучшение качества ответов до 115%. Это собирательный пример, а не прямая цитата: одну часть я взял от одного места, а другую из другого. Но узнаёте её вы, сразу — и, возможно сами дописываете ее к своим запросам.
Теперь пройдём по цепочке, из которой строка выросла.
Число идет из работы 2023 года об эмоциональных приписках. Ли с соавторами испробовали одиннадцать разных — про карьеру, про уверенность в себе, про то, что от ответа многое зависит, — на шести моделях. Заявок в работе три: улучшение на восемь процентов на одном наборе задач, на сто пятнадцать процентов на другом и почти на одиннадцать процентов в отдельном исследовании со ста шестью живыми участниками.
По руководствам разошлась лишь одна, самая эффектная про сто пятнадцать процентов. В ней три мысли и каждая последующая — слабее предыдущей.
Первое. В работе сказано «сорок пять задач», и это сумма двух разных наборов: двадцать четыре в одном, двадцать один в другом. Сто пятнадцать процентов относиться только ко второму. Ставить эти числа рядом — значит брать числитель от одного, а знаменатель от другого. Второе. Заявленное улучшение есть результат победителя перебора. Авторы использовали одиннадцать приписок, по каждой задаче взяли лучшую из одиннадцати и напечатали то, что вышло. Они этого не скрывают: способ счёта описан в подписи к таблице. У них было одиннадцать вариантов, два набора и шесть моделей, чтобы выбрать, что вынести в заголовок. У вас один вопрос, один раз. Вам предлагают применять чужой лучший исход как универсальный. Третье. В работе прямо сказано, какая приписка выиграла на каком наборе. На первом наборе — на том, где восемь процентов, — победила как раз фраза про карьеру. На втором, где сто пятнадцать, победила другая: составная, из трёх сшитых кусков, и по тексту это в основном просьба поставить оценку уверенности от нуля до единицы и объяснить ход рассуждения, к которой пристегнута строчка про карьеру. Про саму фразу про карьеру авторы на этом наборе прямо пишут: выступила плохо.
Перечитайте теперь совет, который ушёл в руководства. Фраза взята с одного набора. Число — с другого. На том наборе, откуда число, эта фраза проиграла. Между двумя половинами строки, которую вам рекомендуют дописывать к своим вопросам, нет никакой связи.
А теперь обещанное возвращение к процентам и пунктам.
Откуда вообще берутся сто пятнадцать процентов, в работе написано, только не одной строкой, а таблицей. Я её сложил.
Второй набор меряли особой шкалой, и её устройство важно разобрать, иначе дальше ничего не понять. Ноль на этой шкале — это случайное угадывание. Сто — это человек, разбирающийся в предмете. Значения ниже нуля возможны: она означают, что модель отвечает хуже, чем если бы тыкала наугад. Опытов на этом наборе два, и сто пятнадцать процентов — среднее из двух приростов.
Первый прирост — семнадцать процентов: с 10,1 до 11,9. Второй — двести тринадцать процентов: с 2,4 до 7,5.
Среднее двух — сто пятнадцать.
Задержите внимание на втором. Двести тринадцать процентов означают движение на пять пунктов по шкале, где ноль — это подбрасывание монетки. Модель стояла почти вплотную к случайному угадыванию. После приписки она стоит чуть дальше от случайного угадывания. Одна из шести моделей в этом столбце вообще начинала с — 0,1, то есть отвечала хуже монетки.
Вот оно, то самое место, о котором я говорил в начале главы. Большой процент от маленького числа. «Было два, стало четыре» — сто процентов и два пункта, одна и та же прибавка, два разных заголовка. Здесь было 2,4, стало 7,5, и получился хайповый заголовок про сто пятнадцать процентов, попавший во многие руководства.
Вогрант, Ниперт и Хагендорф из Штутгартского университете разбирали, воспроизводятся ли вообще результаты работ о поведении языковых моделей. Про эту работу они пишут: числовые значения, приведенные в самом исследовании, не сходятся с его же заявками; вместо среднего улучшения авторы сосредоточились на улучшениях при выборе самого результативного стимула.
По опубликованным в той же работе данным они посчитали среднее по всем одиннадцати приемам. На том наборе, где заявлено сто пятнадцать, — 4,4 процента. По всем наборам вместе — 2,6. Они же провели полноценную перепроверку — шесть моделей, пять популярных приемов, вручную выверенные подмножества пяти наборов задач. Роль, «представь, что ты эксперт», воспроизвести не удалось, подробнее это будем разбирать в третьей главе.
Одно замечание, чтобы вы не унесли из главы больше, чем в ней есть.
Ноль, который получили уортонцы, и невоспроизведение, которое получили штутгардцы, относиться к определенной породе задач: вопросы с известным ответом, ближе к экзамену, чем к вашей работе. Есть область, где приёмы промтинга дают не ноль, а полтора десятка пунктов и больше. Это счёт, символы, формальный вывод — задачи, где ход решения можно выписать и проверить построчно. Границу между этой областью и всем остальным измерили отдельно, и в следующей главе мы до этого измерения дойдём.
Пока запомните, что из этого следует про весь жанр. Приемы меряют там, где они работают. Советуют применять везде. Между «померено на арифметике» и «работает в вашей переписке» лежит переход, который никто не делал вслух, — а вы его совершаете каждый раз, когда по рецепту приписываете чужую фразу.
И последнее. Ту же фразу про карьеру испытала и уортонская группа — та самая, с пятью тысячами прогонов. На одной модели, из семейства Gemini, вышел значительный результат: минус четыре пункта, и настоящая величина почти наверняка лежит между 1,4 и 6,5 пункта вниз.
Тут я обязан поймать себя сам, иначе эта глава ничего не стоит. И ловить придется дважды.
Первое Минус четыре пункта — это одна модель. По правилу, которое я вывел страницей выше, единичный результат есть разница, а не эффект, и никакого «универсального измерения эффекта приема» я вам не показал. Второе, и оно неприятнее. Я взял из таблицы то значение, которое мне подходит. В той же таблице есть вторая модель того же семейства, и на ней та же фраза дала плюс два пункта — незначительно, но со знаком в другую сторону. А самое крпное единичное значение всего отчёта принадлежит вообще не карьере: приписка про мать, больную раком, подняла результат той же линейки моделей почти на десять пунктов.
То есть я только что проделал с уортонской таблицей ровно то, за что тремя абзацами выше выговаривал авторам работы про эмоции: выбрал удобное значение из многих и вынес его как вывод.
Так что вычеркните. Ни минус четыре пункта, ни плюс десять ничего не показывают поодиночке — и именно это здесь единственный вывод.
В итоге одна фраза и три измерения.
Заявленное в работе, где выбирали лучшее из одиннадцати. Пересчитанное честно, по тем же данным —4,4. И на самом мелком шаге измерений — разбор по моделям, из которого не складывается ничего.
Никто вам не солгал. Числа в первой работе не выдуманные, они посчитаны. Просто посчитано было не то, что вам нужно.
Теперь про опоры этой главы, их четыре, и их важно разложить по статусу, потому что вся глава про это.
Технический отчёт, не проходивший рецензирования, — уортонский. Короткая работа на конференции — Добария и Кумар. Первоисточник заявки про сто пятнадцать процентов — работа, выложенная препринтом. И пересчет Вогрант, Ниперта и Хагендорфа — единственная из четырех, прошедшая рецензирование и напечатанная в журнале.
Заметьте, куда ушла эта единственная. Не под красивое число, а под его опровержение. Самое проверенное в главе — то, что показывает, чего стоит непроверенное.
Три остальные сильно слабее, и это не оплошность подбора. По приемам промтинга практически нет хороших измерений, и причина простая: мерить их дешево и никому не важно. Ошибка в совете про чаевые никому не стоит денег. Там, где ошибка стоит дорого — в медицине, например, — измеряют совсем по-другому, и в восьмой главе вы увидите рецензированный опыт с настоящей ценой ошибки: четыреста пятьдесят семь клиницистов и поставленный диагноз.
Работы этой главы говорят разное и мерили разное. Сравнивать их выводы между собой нельзя: разные наборы задач, разные модели, разные годы, и одна из них вообще не про тон, а про эмоциональные приписки. Сравнивать можно ровно одно — сколько прогонов на вопрос стояло за каждым числом. Двадцать пять у Уортона. Десять в Пенсильвании. А у работы, из которой вышло самое громкое число главы, — неизвестно. Сколько раз задавали каждый вопрос, там не сказано вовсе.
Последнее — не обвинение. Это ответ, и он такой же, какой вы получите почти всегда. Это и есть рабочий вывод, который стоит унести из главы.
Увидев число в чужом совете, найдите, сколько прогонов на вопрос за ним стояло, — прежде чем пробовать.
И чаще всего вы ничего не найдете. Числа в советах приходят без родословной, и если их проверять, дойдя до конца цепочки перепечаток, вы упираетесь в пустоту. Это и есть ответ, причем быстрый.
Чего вы точно не узнаете: работает ли приём на вашей работе. Ни одно число из чужой статьи этого не сообщит, и эта глава тоже не дает вам способа это сделать.
Проверьте прямо сегодня. Возьмите прием, который применяли не думая. — вежливое обращение, приписку про важность, любую свою привычку. Для этого можно порыться в истории запросов. Найдите, откуда взялось число, которым её обосновывают. Не оценивайте саму работу, просто дойдите до места, где число появляется впервые, — как мы сейчас прошли от строки в руководстве до одинадцати приписок и двадцати одной задачи. Это недолжно занять много времени и скорее всего кончиться либо блогом без ссылок, либо статьёй, в которой меряли на пятидесяти вопросах.
Конец ознакомительного фрагмента.
Текст предоставлен ООО «Литрес».
Прочитайте эту книгу целиком, купив полную легальную версию на Литрес.
Безопасно оплатить книгу можно банковской картой Visa, MasterCard, Maestro, со счета мобильного телефона, с платежного терминала, в салоне МТС или Связной, через PayPal, WebMoney, Яндекс.Деньги, QIWI Кошелек, бонусными картами или другим удобным Вам способом.


