runEvalSet (runner.ts)

open-multi-agent · ai

Executes evaluation test cases against targets with configurable concurrency, scoring, progress tracking, and cost/token metrics collection.

import { classifyRunFailure } from '../observability/status.js'
import type { RunCostSummary, StoredRun, TraceStore } from '../observability/store.js'
import type {
  AgentRunResult,
  ConsensusResult,
  RunIdentity,
  TeamRunResult,
  TokenUsage,
  TraceAttributeValue,
} from '../types.js'
import { redactSensitiveText } from '../utils/redaction.js'
import type { EvalCase } from './evalcase.js'
import type { EvalSet } from './evalset.js'
import { aggregateEvalRecords } from './report.js'
import type { EvalRunReport } from './report.js'
import type { EvalRecord } from './record.js'
import type { ScoreResult, Scorer, ScorerContext } from './scorer.js'
import type { EvalStore } from './store.js'
import type { EvalTarget, TargetOutput } from './target.js'

const DEFAULT_REPEATS = 1
const DEFAU

... (truncated -- full source via MCP)

See the full source, get the GitHub permalink, and search 40K more like it.

Get a free API key