1. Add evals to init_tracing
Pass scorer names toinit_tracing() and every trace is automatically evaluated. No extra code required.
evals:
session_evals to run scorers when a session ends (via end_session()):
2. create_scorer
Create custom scorers programmatically. Full signature and options:
output_type and scoring
- numeric — Use
min_scoreandmax_score. Judge returns a number in that range. - categorical — Use
choices. Judge picks one label; each label has a score.
3. evaluate
Score a specific trace after it completes:4. evaluate_spans
Run span-level scorers on matching spans within a trace. Usespan_type to target LLM or tool spans: