LLM App Observability & Evals
Weave
LLM·생성형 AI 애플리케이션을 추적·평가·보호하는 GenAI 개발 툴킷입니다.
LLM 앱의 모든 호출(프롬프트·응답·토큰·비용·지연)을 추적하고, 데이터셋 기반 평가(LLM-as-a-judge)로 품질을 정량화합니다. 프로덕션에서는 가드레일과 온라인 평가로 안전성·품질을 실시간 모니터링합니다.
Weave란
생성형 AI 앱은 출력이 비결정적이라 '잘 동작하는지'를 눈으로 확인하기 어렵습니다. W&B Weave는 LLM 애플리케이션의 실행을 추적하고, 체계적 평가로 품질을 수치화하며, 프로덕션에서 가드레일로 보호하는 GenAI 전용 개발·관측 도구입니다. Models가 학습을 위한 것이라면 Weave는 LLM 앱을 위한 것입니다.
핵심 기능
Tracing
프롬프트·응답·툴 호출·토큰·비용·지연을 트리로 추적
Evaluations
데이터셋 + LLM-as-a-judge/사용자 정의 스코어러로 품질 평가
Playground
여러 모델·프롬프트를 나란히 비교 실험
Guardrails · Online Evals
PII·유해성 필터와 실시간 품질 모니터링
Models vs Weave
| 구분 | W&B Models | W&B Weave |
|---|---|---|
| 대상 | ML 학습·모델 | LLM·생성형 AI 앱 |
| 핵심 | 실험·스윕·레지스트리 | 트레이싱·평가·가드레일 |
| 단위 | run·model·artifact | trace·evaluation·dataset |
무엇에 쓰나
LLM 앱 디버깅
실패 호출을 추적해 원인 분석
품질 회귀 방지
배포 전 평가로 품질 저하 조기 감지
프로덕션 안전
가드레일·온라인 평가로 안전·품질 유지