Executes evaluation test cases against targets with configurable concurrency, scoring, progress tracking, and cost/token metrics collection.
import { classifyRunFailure } from '../observability/status.js'
import type { RunCostSummary, StoredRun, TraceStore } from '../observability/store.js'
import type {
AgentRunResult,
ConsensusResult,
RunIdentity,
TeamRunResult,
TokenUsage,
TraceAttributeValue,
} from '../types.js'
import { redactSensitiveText } from '../utils/redaction.js'
import type { EvalCase } from './evalcase.js'
import type { EvalSet } from './evalset.js'
import { aggregateEvalRecords } from './report.js'
import type { EvalRunReport } from './report.js'
import type { EvalRecord } from './record.js'
import type { ScoreResult, Scorer, ScorerContext } from './scorer.js'
import type { EvalStore } from './store.js'
import type { EvalTarget, TargetOutput } from './target.js'
const DEFAULT_REPEATS = 1
const DEFAU
... (truncated -- full source via MCP)
See the full source, get the GitHub permalink, and search 40K more like it.
Get a free API key