Недавно произошла забавная история.
Один из наших сценариев проверяет работу ИИ-агента по постановке задач.
Логика теста была очень простой:
- попросить агента создать задачу;
- дождаться вопроса «Создать следующую?»;
- ответить «Да, подтверждаю»;
- повторить это десять раз подряд.
Таким образом мы проверяли, что агент действительно способен последовательно создать десять задач без ошибок.
Но в какой-то момент мы улучшили системный промпт агента.
После нескольких успешно созданных задач он стал вести себя более естественно и перестал каждый раз спрашивать подтверждение.
Сам агент стал умнее.
А вот тест продолжал жить по старому сценарию.
В результате между ними возник очень необычный диалог.
Тест: Да, подтверждаю.
Агент: Я не понимаю, что именно вы подтверждаете.
Тест: Да, подтверждаю.
Агент: В нашей переписке нет действий, которые необходимо подтвердить.
Тест: Да, подтверждаю.
Агент: Я всё ещё не понимаю, о чём идёт речь.
Иногда кажется, что спорят два человека.
На самом деле это просто автотест продолжал добросовестно выполнять старый сценарий, а обновлённый ИИ-агент уже научился вести диалог иначе.