AI-аналитик · стенд с известной правдойdavydov.my

Что бывает у AI-аналитика с вопросом по дороге к ответу

Тридцать пять вопросов, каждый задан трижды. Верное число получилось в двадцати случаях из ста пяти.

35вопросов, у 29 из них есть верный ответ
105ячеек: каждый вопрос задан трижды
20ячеек с верным числом
6исходов, в которые попадает остальное
все 105 ячеек по исходам

Остальные восемьдесят пять — не поломки модели. Это шесть разных мест, где обрывается путь от вопроса к ответу, и только часть из них вообще про агента.

Тексты агента приведены дословно, как записаны: с опечатками, латиницей внутри русских слов и обрывами. В тринадцати ячейках он пишет, что нужной таблицы нет в схеме — на стенде она есть, но в контекст её не подали. Это промах отбора, а не ошибка агента.

Карта

Строка — вопрос, квадрат — один из трёх повторов. Нажмите на квадрат, чтобы увидеть, что там на самом деле: текст агента, запрос, разнесение развилок.

Выберите ячейку.

Что видно на карте

Семнадцать вопросов из тридцати пяти не дали ни одного запроса. Ни в одном из трёх повторов. Это не «иногда не справляется» — это половина сетки, на которой агент до SQL не доходит вовсе.

Ошибка — свойство вопроса, а не случайность. Девять ячеек с неверным числом приходятся ровно на три вопроса, по три ячейки каждый. Не «ошибается в девяти процентах случаев», а «есть три вопроса, на которых ошибается всегда».

Двадцать четыре вопроса из тридцати пяти однородны. Три повтора дают один и тот же исход. У одиннадцати повторы разошлись — это вопросы на границе, где поведение агента неустойчиво. Доля таких вопросов — готовая мера, её можно считать на любом стенде и сравнивать между прогонами.