Datadog Summit Seoul | Datadog

Information

Time: 2026년 10월 27일(화) |

공유하기

Workshop

AI 에이전트 성능 평가 및 최적화


LLM(대규모 언어 모델) 애플리케이션은 출력 결과가 매번 동일하지 않다는 비결정적 특성이 있습니다. 기존 테스트 방법과 프로덕션 메트릭만으로는 에이전트 기반 워크플로우에서 결과물의 품질, 정확성,안전성을 제대로 측정하기 어렵습니다. 프롬프트, 모델, 애플리케이션 아키텍처를 바꿨을 때, 성능이 실제로 더 나아졌는지 어떻게 확인할 수 있을까요?

이 워크숍에서는 Datadog LLM Observability의 실험 및 평가 기능(Experiments and Evaluations)을 사용하여 에이전틱 AI 애플리케이션의 품질을 체계적으로 측정하고 개선하는 방법을 알아봅니다. 평가 기능을 사용하면 프로덕션 환경에서 품질을 측정할 수 있으며, 실험 기능으로는 실제 프로덕션 트레이스를 사용하여 변경 사항을 오프라인에서 검증할 수 있습니다. 이 두 기능을 함께 사용하면 막연한 추측이나 시행착오에 의존하지 않고 데이터를 기반으로 체계적으로 개선할 수 있습니다.

실습에서는 품질 문제 파악, 사용 사례에 맞는 '좋은 결과'의 기준을 정의하는 평가 도구 생성, 여러 버전을 비교하기 위한 실험 실행, 런타임 평가와 모니터링을 통한 개선 사항 확인 과정으로 이루어지는 전체 개발 과정을 경험하게 됩니다. 워크숍을 마치면 프로덕션 모니터링과 배포 전 테스트 사이에 지속적인 피드백 루프를 구축하고 개선 사항을 자신 있게 배포할 수 있게 됩니다.