Оценка LLM‑системы
Агентная LLM-система для работы с документами.
- Выстроил процесс оценки с нуля: прогнал 11 бенчмарков, затем перешёл на доменное тестирование на реальных кейсах — 10+ годовых отчётов публичных компаний с генерацией вопросов и разметкой поведения. Воспроизводимый процесс вместо разовых прогонов.
- Провёл сравнительный бенчмаркинг агентной системы против базовой модели: установил, что польза зависит от типа задачи — система даёт прирост там, где данные нужно извлекать из документов, и избыточна там, где контекст дан напрямую. Оформил как архитектурный вывод для пересмотра приоритетов, а не как абстрактную метрику.
- Реализовал трассировку рассуждений и вызовов функций: оценка перешла с самоотчётов системы на телеметрию.
- Спроектировал и провёл red-team по ответам системы: 7 сценариев атак, защита выдержала. Отдельно локализовал деградацию латентности до операции записи в векторное хранилище.
- Руководил командой из 3 стажёров: декомпозиция задач и ТЗ, код-ревью, обратная связь. Формировал и приоритизировал задачи для штатных инженеров по результатам тестирования.
