Первый вопрос в любом ИИ-проекте — не "какую модель выбрать", а "как мы поймём, что она работает". На этапе аналитики мы разбираем данные заказчика и определяем метрику до того, как написана первая строчка кода. Дальше развилка: если метрику можно измерить количественно и заранее понятно, какое значение будет означать успех, — мы фиксируем конкретную цель. Если такой уверенности нет, мы всё равно фиксируем формулу расчёта, но вместо абсолютного целевого значения отслеживаем рост метрики от итерации к итерации — так видно прогресс даже там, где заранее невозможно сказать, какое число окажется "достаточно хорошим".
Показательный пример первого сценария — проект по классификации почтовых обращений для компании, занимающейся спецтехникой: мы сразу зафиксировали, что точность ниже 80% будем считать провалом проекта, и в итоге вышли на 87%. А вот с задачами на базе RAG так честно поступить обычно не получается: то, что считается хорошим показателем, сильно зависит от конкретной задачи — для одних сценариев приемлемым результатом будет 60%, а для других планка начинается только от 85% и выше. Это не случайность конкретного проекта, а системная особенность подобных систем: помимо точности им требуется более широкая оценка — соответствие контексту, обоснованность ответа, полнота — а не единственная универсальная цифра.