Глава 6.2 — Куда движется область

Содержание

  1. Замыкая цикл ещё раз
  2. Галлюцинации и фактическая надёжность: почему извлечение и масштаб не закрыли разрыв
  3. Бенчмарки против реального мира: проблема оценки никуда не девается
  4. Агенты и стена надёжности при долгих горизонтах
  5. Смысл «выравнивания» усложняется, а не упрощается, с ростом способностей
  6. «Искры AGI»: пример того, насколько трудна оценка способностей на самом деле
  7. Чтение после этой книги: обзоры как карта движущейся цели
  8. Последний взгляд назад: старые вопросы в новой нотации
  9. Взгляд с точки зрения интервью
  10. Вопросы для самопроверки
  11. Источники

1. Замыкая цикл ещё раз

Глава 6.1 взяла всё, что построила эта книга, — архитектуры, режимы обучения, поведение при масштабировании, техники выравнивания, извлечение, агентов, оценку — и провела через дисциплину единой разобранной проектной задачи, исходя из того, что сборка компонентов в работающий продукт — это то место, где реально живёт значительная часть инженерного суждения в этой области. В это упражнение было заложено неявное допущение: что если сделать все правильные выборы компонентов и корректно их соединить, получится система, надёжно делающая то, что от неё требуется. Эта заключительная глава посвящена тем способам, которыми это допущение всё же не совсем выполняется, даже после такого тщательного дизайна, как в главе 6.1, — не потому что какая-то отдельная техника в этой книге неисправна, а потому что несколько самых трудных проблем этой области находятся выше уровня любого отдельного компонента, в разрыве между тем, что хорошо спроектированная система делает большую часть времени, и тем, что ей нужно делать каждый раз.

Эта глава намеренно не будет пытаться предсказывать будущее области с какой-либо уверенностью. Темп изменений в исследованиях LLM был достаточно быстрым и достаточно долго, что любое конкретное прогностическое утверждение здесь рискует устареть или попросту оказаться неверным к моменту прочтения — и собственные знания этой книги отражают отсечку, которую читателю стоит воспринимать как нижнюю границу, а не как потолок того, что известно к моменту чтения. Что эта глава может честно сделать — назвать открытые проблемы, сохранявшиеся на протяжении многих глав этой книги, несмотря на подлинный, существенный прогресс, объяснить, почему они сохраняются, и указать на тот вид чтения, который позволит читателю отслеживать, как они развиваются после окончания этой книги.

2. Галлюцинации и фактическая надёжность: почему извлечение и масштаб не закрыли разрыв

Глава 5.2 представила генерацию с расширением через поиск (RAG) отчасти как ответ на галлюцинации: привязать вывод модели к извлечённым фрагментам, и у неё будет меньше нужды что-либо выдумывать. Это действительно помогает и является одной из наиболее эффективных мер смягчения, доступных на практике. Но это мера смягчения, а не решение, и стоит точно понять почему. Модель с расширением через поиск всё ещё может галлюцинировать как минимум тремя различными способами: она может извлечь неверные фрагменты и уверенно синтезировать ответ из нерелевантного контекста; она может извлечь верные фрагменты и всё же неверно их прочитать или неверно атрибутировать в сгенерированном ответе; или она может смешать извлечённое содержимое с параметрическим «знанием» из предобучения способами, порождающими правдоподобно звучащее, но не привязанное к реальности утверждение, которое трудно отличить от должным образом обоснованного, не проверив источник. Ни один из этих сбоев не исправляется масштабированием базовой модели, потому что ни один из них на самом деле не является проблемой ёмкости знания — это проблемы калибровки модели относительно того, что она на самом деле знает, в противовес тому, что она выводит или достраивает по шаблону.

Этот разрыв в калибровке — если что и лежит в основе галлюцинаций, так это он, — и он никуда не делся по мере того, как модели становились крупнее и лучше выровненными. Модель, обученная на предсказании следующего токена, в точности как описывала глава 1.1, не имеет встроенного механизма, отличающего «этот токен высоковероятен, потому что он хорошо подкреплён фактом» от «этот токен высоковероятен, потому что это стилистически естественное продолжение». RLHF и другие методы выравнивания на основе предпочтений, рассмотренные в главе 4.5, могут подтолкнуть модель чаще говорить «я не знаю» в ситуациях, где оценщикам показывали примеры уместной неопределённости, но это формирует поверхностное поведение на том распределении ситуаций, которое оценщики случайно охватили, — это не даёт модели внутреннего, обобщаемого чувства собственного эпистемического состояния. Именно поэтому дисциплина оценки из главы 5.5 и архитектура RAG из главы 5.2 остаются необходимым каркасом вокруг модели, а не проблемами, которые решила сама модель, и именно поэтому опытному инженеру стоит воспринимать «мы добавили RAG» как реальную меру смягчения, но не как лицензию на прекращение измерения частоты галлюцинаций в продакшне.

3. Бенчмарки против реального мира: проблема оценки никуда не девается

Глава 5.5 уже показала, что производительность на бенчмарке и устойчивая способность в реальном мире расходятся, и разобранный пример главы 6.1 напрямую опирался на этот тезис, обсуждая, почему онлайн-метрикам нужно доверять больше, чем офлайновым. Задача этой главы — прямо сказать, что этот разрыв — не временное смущение, из которого область вот-вот инженерно выберется, — это структурное следствие того, как строятся бенчмарки. Любой фиксированный бенчмарк — это конечная, отобранная выборка задач, и модель может улучшить свой балл на этой выборке способами, не переносящимися на полное, открытое распределение того, о чём реально спрашивают пользователи, — либо через подлинное переобучение под паттерны, близкие к бенчмаркам и присутствующие в обучающих данных, либо потому что бенчмарки попросту не покрывают хвост реального использования, либо потому что бенчмарк вознаграждает вид производительности (уверенные, беглые, «формата бенчмарка» ответы), расходящийся с тем, что действительно важно в развёртывании (калиброванные, полезные, честные ответы).

Это усугубляется более сложной метапроблемой: по мере того как бенчмарки становятся хорошо известными и на них интенсивно оптимизируются — будь то через намеренное включение в обучающие данные или через более косвенное селективное давление в ходе разработки модели, — их сигнал со временем деградирует способом, который трудно обнаружить со стороны. Балл модели на бенчмарке может выглядеть отлично, при этом производительность на подлинно новых, невиданных по форме задачах заметно отстаёт, и единственный надёжный способ это заметить — тот вид непрерывного, привязанного к продакшну цикла оценки, за который выступали и глава 5.5, и глава 6.1. Нет никаких признаков того, что эта проблема близка к общему решению; если что, она усложняется по мере роста способностей моделей, поскольку более способные модели также лучше умеют производить ответы «формата бенчмарка», которые выглядят правильно, не будучи правильными, — что является тем же самым разрывом калибровки из раздела 2, проявляющимся на уровень выше, на уровне оценки, а не отдельных утверждений.

4. Агенты и стена надёжности при долгих горизонтах

Глава 5.4 представила агентов и использование инструментов как правильный рычаг, когда задача действительно требует многошагового взаимодействия с внешним миром, а разобранный проектный пример главы 6.1 использовал именно эту логику, чтобы аргументировать обращение к агентной сложности только тогда, когда её требует задача. Причину такой осторожности стоит назвать здесь напрямую: надёжность агента деградирует с длиной горизонта способом, который ещё не понят и не решён хорошо. Если модель успешна на каждом отдельном шаге многошаговой задачи с вероятностью $p$ чуть меньше единицы, вероятность завершить всю цепочку из $n$ независимых шагов без единой сбивающей с пути ошибки равна $p^n$, то есть падает мультипликативно, — например, 95%-я надёжность одного шага ($p = 0.95$), накопленная на 20-шаговой задаче, даёт лишь $0.95^{20} \approx 0.36$, то есть примерно один шанс из трёх завершить задачу без единой сбивающей ошибки, — и реальные агентные задачи регулярно включают десятки шагов, где единственный неверный вызов инструмента, неверно прочитанный результат или накапливающееся недопонимание может увести всю траекторию в сторону способом, который модель не всегда надёжно замечает или из которого не восстанавливается.

Это иная проблема, чем в разделах 2 и 3, и стоит тщательно её различать в интервью или обзоре дизайна: галлюцинация — это проблема фактической привязки на одном ходу, бенчмарк против реальности — это проблема валидности оценки, а надёжность агента — это проблема накопления ошибок, возникающая именно из сцепления множества однопроходных способностей во времени. Улучшение показателя успеха на одном шаге помогает, но поскольку вероятность сбоя накапливается мультипликативно, даже довольно большие улучшения на одном шаге дают сравнительно скромные улучшения в завершении долгосрочных задач, — и именно поэтому осторожность главы 5.4 в отношении соответствия агентной сложности реальным требованиям задачи является не стилистическим предпочтением, а прямым следствием этой структуры накопления, и почему «сделать агентный цикл длиннее и автономнее» само по себе не является стратегией, масштабирующейся так, как масштабировал рост размера модели.

5. Смысл «выравнивания» усложняется, а не упрощается, с ростом способностей

Глава 4.6 рассмотрела техники выравнивания на уровне «как заставить модель делать то, что мы хотим» — RLHF, конституционные методы и связанные подходы к формированию поведения модели относительно некоторого представления о желаемых результатах. То, что эта глава по большей части вынесла за скобки, что уместно для её места в книге, — это более сложный вопрос под самой техникой: что вообще должно означать «выровненный» и остаётся ли этот смысл стабильным по мере роста способностей? На текущих уровнях способностей значительная часть работы по выравниванию на самом деле касается поверхностного поведения — отказ от явно вредоносных запросов, соответствие полезному и честному тону, избегание явно предвзятых или небезопасных выводов, — и техники из главы 4.6 достаточно хорошо соответствуют этой цели поверхностного поведения.

Открытый вопрос — что происходит, когда моделей просят действовать с большей автономией, на более длинных горизонтах, над задачами, чьи полные последствия труднее полностью оценить в моменте ни модели, ни человеческим надзирателям, — именно те агентные условия из раздела 4. Данные о предпочтениях, собранные у человеческих оценщиков, судящих отдельные ответы, — гораздо более слабый сигнал того, был ли на самом деле хорош длинный, автономный, многошаговый курс действий, как потому что оценщики не всегда могут со стороны определить, была ли сложная последовательность действий хорошо продуманной, так и потому что понятие «чего на самом деле хотел человек» становится подлинно труднее специфицировать по мере того, как задачи становятся более открытыми. Это не та проблема, которую решают главы этой книги о выравнивании или агентах, и это не проблема, которую решила область в целом, — она честно отмечена здесь как открытый вопрос, становящийся более, а не менее насущным по мере того, как остальные техники повышения способностей из этой книги продолжают работать.

6. «Искры AGI»: пример того, насколько трудна оценка способностей на самом деле

Стоит остановиться на одном конкретном, широко обсуждаемом документе как на примере того, насколько трудно оценить, что крупная модель действительно может и не может делать, потому что сложность оценки сама по себе — одна из повторяющихся тем этой главы. В начале 2023 года группа авторов Microsoft Research опубликовала «Sparks of Artificial General Intelligence: Early Experiments with GPT-4» — статью, построенную вокруг обширного качественного зондирования способностей GPT-4 по необычно широкому кругу задач, включая рассуждение, программирование, математику и решение кросс-доменных задач, — утверждая, что широта и гибкость наблюдаемого составляют значимое свидетельство общего, а не узкого интеллекта.

Статья была чрезвычайно влиятельной в формировании общественной и исследовательской дискуссии о способностях передовых моделей, и её действительно стоит прочитать как документ о том, как выглядит тщательный, любознательный, качественный зонд способностей. Её также стоит представить сбалансированно, поскольку она вызвала существенную методологическую критику: оценка была по большей части анекдотической, а не систематической, проводилась на модели, точные обучающие данные и отсечка которой не были полностью раскрыты авторам, что вызывает опасения по поводу возможной контаминации бенчмарков или примеров, и она в значительной степени опиралась на собственное качественное суждение авторов о том, что считать впечатляющим, а не на контролируемый, воспроизводимый протокол оценки. Ни энтузиазм, ни критика не должны восприниматься как окончательно решающие вопрос — статью лучше всего понимать как честную попытку разобраться именно с проблемой валидности оценки из раздела 3, применённой к сложнейшему возможному случаю (оценка чего-то вроде общего интеллекта), а её восприятие само по себе является свидетельством того, насколько нерешёнными остаются инструменты области для такого рода оценки.

7. Чтение после этой книги: обзоры как карта движущейся цели

Учитывая всё в разделах со 2 по 6, честное, что может сделать такая книга в своём завершении, — указать на тот вид чтения, который позволит читателю отслеживать, как эти проблемы развиваются после отсечки самой этой книги, а не притворяться, что фиксированный набор глав может оставаться актуальным бесконечно. «A Survey of Large Language Models» Zhao и др. и «Challenges and Applications of Large Language Models» Kaddour и др. полезны для этого взаимодополняющими способами: первая организована вокруг технического ландшафта — архитектур, подходов к обучению, техник адаптации, оценки — способом, существенно пересекающимся с собственной структурой этой книги, и является разумным способом проверить, какие части технической картины изменились с момента написания этой книги, тогда как вторая явно организована вокруг открытых проблем и практических вызовов развёртывания, что делает её естественным спутником собственной рамки этой главы.

Стоит назвать два конкретных направления как открытые, а не устоявшиеся, поскольку обзор открытых проблем в этой главе до сих пор фокусировался на надёжности, оценке, агентах и выравнивании, не затрагивая напрямую архитектуру или парадигму обучения. Первое — архитектурный фронтир, который глава 3.6 уже задокументировала как нерешённый: гибридные стеки, комбинирующие рекуррентные слои пространства состояний с меньшинством слоёв полного внимания, — текущий лучший ответ на напряжение между точным вспоминанием внимания и эффективностью состояния фиксированного размера, но соотношение, размещение и конкретный рекуррентный механизм-победитель всё ещё активно оспариваются, а не устоялись, и ничто не исключает, что по-настоящему другая архитектурная идея вытеснит всю гибридную рамку в те же сроки, за которые устареет собственная конкретика этой книги. Второе — вопрос парадигмы обучения, который эта книга вообще не рассматривала напрямую: каждая модель, разобранная в этих главах, обучается один раз, а затем развёртывается замороженной, и любое обновление её знаний или поведения требует полностью отдельного прохода дообучения или переобучения, а не усвоения моделью нового опыта прямо по ходу работы. Непрерывное обучение (continual learning) — обновление весов развёрнутой модели на основе непрерывно поступающего опыта без катастрофического забывания того, что она уже знала, — режима отказа, который исторически и делал это трудным, — и модели мира (world models) — представления, улавливающие, как среда реально ведёт себя и эволюционирует, а не только как предсказать следующий токен пассивного текстового потока, описывающего её, — оба являются активными направлениями исследований, нацеленными на тот же самый пробел, и ни одно из них не имеет устоявшегося, проверенного в продакшене ответа так, как это есть у конвейера обучения, разобранного в части IV.

Ни один из этих обзоров, ни эта глава, не должны восприниматься как последнее слово — обзоры быстро меняющейся области сами являются снимками момента, и конкретные цифры, названия моделей и заявления о состоянии дел в любом из них устареют так же, как устареют собственные заявления этой книги. Что остаётся полезным после того, как конкретика устаревает, — это структура: знание того, каковы открытые категории проблем — надёжность, валидность оценки, устойчивость долгосрочных агентов, выравнивание при более высокой автономии, — даёт читателю каркас для того, чтобы подставлять в него новейшие попытки области решить эти проблемы, ещё долго после того, как конкретные цифры какой-либо отдельной статьи перестанут быть текущим состоянием дел.

8. Последний взгляд назад: старые вопросы в новой нотации

Стоит завершить эту книгу так же, как её открыла глава 1.1. Каждая архитектура, техника обучения, стратегия масштабирования, метод выравнивания, система извлечения и агентный фреймворк, рассмотренные на протяжении тридцати одной главы этой книги, были разными инженерными ответами на один и тот же лежащий в основе вопрос, который поставил Шеннон и формализовала глава 1.1: учитывая всё, что было раньше, что будет дальше? Эта формулировка не была упрощением, сделанным для педагогического удобства в начале книги, — она подтвердила себя как подлинно точное описание происходящего на каждом уровне стека, от механизма внимания, вычисляющего взвешенную комбинацию прошлых токенов, до модели рассуждения, тратящей дополнительные вычисления на этапе инференса, чтобы предсказать лучший следующий шаг, до агента, предсказывающего, какой вызов инструмента будет следующим в долгосрочном плане.

Обзор открытых проблем в этой заключительной главе должен оставить читателя не с пессимизмом, а со своего рода собственной калибровкой: галлюцинация, под современной терминологией, — это всё та же старая проблема предсказательной модели, порождающей беглое, высоковероятное продолжение, которое просто оказывается неправдой, — проблема столь же старая, как сама статистическая языковая модель, а не дефект, уникальный для трансформеров. Разрыв валидности оценки, под современными бенчмарками, — это всё та же старая проблема любого измерения, расходящегося с тем, что оно призвано измерять, как только измеряемая сторона может адаптироваться к измерению. Вопрос выравнивания, под современными моделями вознаграждения, — это всё та же старая проблема специфицирования того, чего вы на самом деле хотите, достаточно точно, чтобы оптимизация по спецификации не расходилась с оптимизацией по замыслу. Ни одна из них не является новой проблемой, с которой область никогда не сталкивалась, — это старые, трудные проблемы, которые масштаб сделал неизмеримо более значимыми, потому что системы, построенные на техниках этой книги, теперь достаточно способны и достаточно широко развёрнуты, чтобы ошибиться в этих старых вопросах теперь действительно важно в масштабе, в котором это раньше не имело значения. Именно это, больше чем любая конкретная техника из тридцати предыдущих глав, — честная нота, на которой стоит закончить: инженерия продвинулась колоссально, вопросы под ней не изменились почти настолько же, и читатель, понимающий это различие, лучше подготовлен встретить то, чем область окажется к моменту, когда он дочитает это предложение, чем читатель, который вынес из книги мысль, что что-либо из этого когда-либо было полностью решено.

9. Взгляд с точки зрения интервью

«Почему увеличение размера модели в конечном счёте не решает просто проблему галлюцинаций?» Сильный ответ называет аргумент о калибровке из раздела 2: галлюцинация — это принципиально не нехватка ёмкости знаний, которую исправляют больше параметров или данных, это несоответствие между тем, что бегло/вероятно, и тем, что правда, и у более крупной модели, обученной на той же цели предсказания следующего токена, нет нового механизма, заставляющего эти вещи совпадать. Сильный ответ также отмечает, что RAG и настройка выравнивания измеримо помогают, но являются мерами смягчения, наслаиваемыми поверх модели, а не исправлениями лежащего в основе разрыва калибровки, и что именно поэтому непрерывная продакшн-оценка частоты галлюцинаций остаётся необходимой независимо от масштаба модели.

«Вы строите долгосрочного автономного агента. Почему он может выйти из строя, даже если точность каждого отдельного шага 95%?» Сильный ответ выполняет реальную арифметику по существу: независимые показатели успеха на шагах накапливаются мультипликативно, поэтому 20-шаговая задача при 95%-й точности на шаг успешно завершается от начала до конца лишь примерно в трети случаев (0.95^20 ≈ 0.36), а реальные шаги агента даже не независимы — ранняя ошибка может каскадно повлиять и сделать более поздние шаги более склонными к сбою. Ответ должен связать это с осторожностью главы 5.4 в отношении масштабирования агентной автономии под реальные требования задачи, поскольку именно эта структура накопления — прямая причина ненадёжности длинных автономных цепочек способами, которые улучшение любого отдельного компонента исправляет лишь частично.

«Каково ваше честное мнение о статье "Sparks of AGI" — была ли она права?» Сильный ответ избегает занятия чёткой стороны в ту или иную сторону и вместо этого называет реальную эпистемическую ситуацию: это был влиятельный, обширный качественный зонд способностей, обнаруживший подлинно удивительное поведение, и он также был методологически рыхлым по стандартам строгой оценки — анекдотическим, несистематическим, проведённым на модели без полной прозрачности обучающих данных, что ограничивает то, что из него можно заключить. Сильнейшие ответы отмечают, что сама полемика является свидетельством в пользу более широкого тезиса раздела 3: строго оценивать передовые способности подлинно трудно, и у области всё ещё нет полностью удовлетворительных инструментов для этого.

«Как бы вы думали о «выравнивании» иначе для однопроходного чат-бота против высокоавтономного долго работающего агента?» Сильный ответ различает выравнивание на уровне поверхностного поведения (соответствие тону, отказ от вредоносных однопроходных запросов, для чего методы в стиле RLHF из главы 4.6 достаточно хорошо подходят) от более сложной проблемы оценки того, действительно ли весь автономный курс действий на долгом горизонте соответствовал замыслу, где человеческие оценщики уже не могут легко судить каждый шаг изолированно, а данные о предпочтениях, собранные ход за ходом, становятся гораздо более слабым суррогатом того, была ли хороша общая траектория, — открытая проблема, которую эта книга отмечает, но не решает.

«Если бы вам пришлось делать ставку на то, какая из проблем — галлюцинации, валидность оценки, надёжность агентов или спецификация выравнивания — больше всего улучшится только за счёт лучшего масштабирования и большего количества данных, а какая требует принципиально иного подхода, — как бы вы рассуждали об этом?» Сильный ответ избегает ложно-уверенного прогноза и вместо этого рассуждает структурно: проблемы, принципиально связанные с калибровкой или спецификацией (галлюцинации, выравнивание), кажутся менее вероятными для решения одним масштабом, потому что масштаб улучшает беглость и охват знаний, не улучшая напрямую самопознание о неопределённости или спецификацию замысла; проблемы, частично связанные с охватом (некоторый срез валидности оценки, некоторый срез точности одного шага агента), могут несколько улучшиться от масштаба и лучших данных, но даже там динамика накопления и адаптации к измерению из разделов 3 и 4 предполагает, что один только масштаб не закроет разрыв полностью. Суть сильного ответа здесь — в процессе рассуждения и эпистемической честности, а не в получении уверенного окончательного числа.

10. Вопросы для самопроверки

  1. Почему генерацию с расширением через поиск лучше описывать как меру смягчения галлюцинаций, а не как решение этой проблемы, и какие конкретные сбои могут по-прежнему происходить даже при хорошо функционирующем слое извлечения?
  2. Какова лежащая в основе причина того, что модель может улучшить свой балл на бенчмарке, не становясь более надёжной на реальных задачах, и почему этот разрыв со временем становится труднее обнаружить, а не легче?
  3. Если у многошаговой агентной задачи показатель успеха на шаг равен p, а шагов n, почему сквозная надёжность падает быстрее, чем можно интуитивно предположить, и что это подразумевает о ценности улучшения одной лишь точности отдельного шага?
  4. Что сделало «Sparks of Artificial General Intelligence» одновременно влиятельной и методологически спорной, и почему эта глава представляет её без занятия чёткой стороны?
  5. Почему данные о предпочтениях, собранные у человеческих оценщиков, судящих отдельные ответы, могут быть более слабым сигналом того, была ли «выровненной» длинная автономная траектория агента, чем при оценке одного хода чат-бота?
  6. В каком смысле галлюцинации, валидность оценки и спецификация выравнивания описываются в этой главе как «старые проблемы», и почему книга утверждает, что эта формулировка важнее, чем восприятие их как совершенно новых сбоев, специфичных именно для трансформеров?
  7. Оглядываясь на формулировку предсказания следующего токена из главы 1.1, как эта заключительная глава аргументирует, что эта формулировка применима даже к наиболее продвинутому материалу книги — рассуждению, агентам и оценке?

11. Источники

  • Bubeck, S., Chandrasekaran, V., Eldan, R., et al. (2023, Microsoft Research). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712. https://arxiv.org/abs/2303.12712
  • Zhao, W. X., Zhou, K., Li, J., et al. (2023). A Survey of Large Language Models. arXiv:2303.18223. https://arxiv.org/abs/2303.18223
  • Kaddour, J., Harris, J., Mozes, M., Bradley, H., Raileanu, R., & McHardy, R. (2023). Challenges and Applications of Large Language Models. arXiv:2307.10169. https://arxiv.org/abs/2307.10169

Тест для самопроверки

Проверьте понимание главы с помощью короткого теста — вопросы по теории и небольшие расчёты.

Почему RAG лучше описывать как смягчение галлюцинаций, а не полное их решение?

Объяснение: Это проблемы калибровки — того, что модель на самом деле знает в сравнении с тем, что выводит — а не проблемы ёмкости знаний, которые исправляются масштабированием модели.

Согласно этой главе, почему разрыв между производительностью на бенчмарках и надёжностью в реальном мире, как правило, становится труднее обнаружить по мере улучшения моделей, а не легче?

Объяснение: Единственный надёжный способ заметить это — непрерывная оценка, привязанная к продакшену, а не доверие растущему баллу бенчмарка на слово.

Почему «Искры Artificial General Intelligence» представлены в этой главе без принятия чёткой стороны в вопросе, была ли статья права?

Объяснение: Статью лучше всего понимать как честную попытку разобраться с проблемой валидности оценки, применённую к самому трудному возможному случаю.

Согласно заключительному аргументу этой главы, каково отношение между проблемами галлюцинаций, валидности оценки и спецификации выравнивания и остальным материалом книги?

Объяснение: Инженерия продвинулась колоссально; вопросы под ней изменились гораздо меньше.

Как прямо утверждается в этой главе, агентная задача из 20 шагов с долей успеха 95% на каждом шаге завершается успешно от начала до конца с какой примерной вероятностью? (Округлите до 2 знаков после запятой.)

Объяснение: 0.95^20 ≈ 0.358 ≈ 0.36 — «успешна от начала до конца лишь примерно в трети случаев», именно как утверждает глава.

Используя ту же логику накопления ошибок, какова примерная вероятность успеха от начала до конца для задачи из 15 шагов с долей успеха 95% на шаг? (Округлите до 2 знаков после запятой.)

Объяснение: 0.95^15 ≈ 0.463 ≈ 0.46.

Какова примерная вероятность успеха от начала до конца для задачи из 30 шагов с долей успеха 97% на шаг? (Округлите до 2 знаков после запятой.)

Объяснение: 0.97^30 ≈ 0.401 ≈ 0.40.

Если доля успеха на шаг улучшится с 95% до 99%, какова новая примерная вероятность успеха от начала до конца для задачи из 20 шагов? (Округлите до 2 знаков после запятой.)

Объяснение: 0.99^20 ≈ 0.818 ≈ 0.82 — иллюстрирует, насколько сильно должна улучшиться надёжность одного шага, прежде чем надёжность на длинных горизонтах ощутимо возрастёт.