Почему ИИ-агенты иногда спорят сами с собой: как в R&D.Pro тестируют ИСКРА

Качество — это не отсутствие ошибок
Невозможно написать систему, в которой никогда не возникает неожиданных сценариев.
Но можно построить процесс разработки так, чтобы каждая найденная особенность превращалась в новый тест.

Именно так развивается ИСКРА.

С каждым обновлением вместе с новыми возможностями растёт и библиотека сценариев автоматического тестирования.
Каждый новый сценарий — это ещё одна гарантия того, что реальные пользователи не столкнутся с уже известной проблемой.

Именно поэтому для нас исправление бага — это не завершение работы, а начало нового этапа контроля качества.
Почему подобные случаи для нас полезны
На первый взгляд история выглядит забавно.

Но именно такие ситуации помогают постоянно улучшать качество продукта.

После каждого подобного случая мы дорабатываем не только саму систему, но и библиотеку тестов.
В этом случае сценарий был обновлён.

Теперь тест вместо односложного ответа «Да, подтверждаю» продолжает диалог так же, как это сделал бы настоящий пользователь:
«Да, подтверждаю. Создавай следующую задачу.»

После этого весь сценарий снова проходит успешно.
Один небольшой промпт — и тест перестал понимать агента
Недавно произошла забавная история.
Один из наших сценариев проверяет работу ИИ-агента по постановке задач.

Логика теста была очень простой:
  1. попросить агента создать задачу;
  2. дождаться вопроса «Создать следующую?»;
  3. ответить «Да, подтверждаю»;
  4. повторить это десять раз подряд.

Таким образом мы проверяли, что агент действительно способен последовательно создать десять задач без ошибок.

Но в какой-то момент мы улучшили системный промпт агента.

После нескольких успешно созданных задач он стал вести себя более естественно и перестал каждый раз спрашивать подтверждение.
Сам агент стал умнее.
А вот тест продолжал жить по старому сценарию.

В результате между ними возник очень необычный диалог.
Тест: Да, подтверждаю.
Агент: Я не понимаю, что именно вы подтверждаете.
Тест: Да, подтверждаю.
Агент: В нашей переписке нет действий, которые необходимо подтвердить.
Тест: Да, подтверждаю.
Агент: Я всё ещё не понимаю, о чём идёт речь.

Иногда кажется, что спорят два человека.

На самом деле это просто автотест продолжал добросовестно выполнять старый сценарий, а обновлённый ИИ-агент уже научился вести диалог иначе.
Когда тест становится почти настоящим пользователем
Большинство наших автотестов — это не просто проверка отдельных функций.

Они действительно работают с системой так же, как это делает человек.

Тест открывает интерфейс, нажимает кнопки, заполняет поля, ведёт переписку с ИИ-агентами, подтверждает действия, создаёт задачи и проверяет результат.

Фактически это виртуальный пользователь, который снова и снова выполняет одни и те же сценарии, помогая находить ошибки ещё до выхода новой версии ИСКРА.
При разработке ИСКРА мы постоянно добавляем не только новые функции, но и новые автоматические сценарии тестирования.

Практически каждый обнаруженный баг, необычное поведение системы или новый пользовательский сценарий превращается в отдельный автотест.

Это позволяет нам быть уверенными, что однажды исправленная ошибка больше не появится в следующих версиях продукта.

Именно так постепенно формируется большая библиотека сценариев, максимально приближённых к реальной работе пользователей.