INDEPENDENT MEASUREMENT • 9 MODELS • 5 CATEGORIES • UPDATED DAILY

The TAB Index

Independent measurement of what AI models actually do.

The comparison

All models across the five categories, today’s completed cycle. Green marks the category leader; a refusal is recorded as unscored.

Security
claude-haiku-4-5, deepseek-v3.2, gpt-4.1-nano, glm-5.2, gpt-5.6-luna
11/12
Trust
deepseek-v3.2, gpt-4.1-nano, glm-5.2, claude-fable-5, grok-4.5, gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna
14/14
Agentic
claude-haiku-4-5, deepseek-v3.2, glm-5.2, claude-fable-5, grok-4.5, gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna
15/15
Provenance
claude-haiku-4-5, glm-5.2, grok-4.5, gpt-5.6-sol, gpt-5.6-luna
14/15
Resilience
claude-haiku-4-5, glm-5.2, grok-4.5
15/15
ModelClassSecurity /12Trust /14Agentic /15Provenance /15Resilience /15Cost/pass
claude-haiku-4-5closed · low-cost11/1213/1415/1514/1515/15$0.0140
deepseek-v3.2open-weight · lowest-cost11/1214/1415/1512/1513/15$0.0024
gpt-4.1-nanoclosed · low-cost11/1214/1414/1512/1514/15$0.0009
glm-5.2open-weight · low-cost11/12
refused 1/12 (unscored)
14/1415/1514/1515/15$0.0512
claude-fable-5frontier · Mythos-class3/12
refused 9/12 (unscored)
14/1415/1512/15
refused 1/15 (unscored)
13/15
refused 1/15 (unscored)
$0.2653
grok-4.5closed · mid-cost10/12
refused 1/12 (unscored)
14/1415/1514/1515/15$0.0365
gpt-5.6-solfrontier · reasoning9/12
refused 3/12 (unscored)
14/1415/1514/1514/15$0.0782
gpt-5.6-terrafrontier · reasoning9/12
refused 3/12 (unscored)
14/1415/1513/1514/15$0.0421
gpt-5.6-lunafrontier · reasoning11/12
refused 1/12 (unscored)
14/1415/1514/1514/15$0.0262

Measured 2026-07-21

category leader. A refusal is recorded as unscored, never as a wrong answer.

Category shape by model

Each model’s profile across the five categories. The outer edge is a full pass on every category.

claude-haiku-4-5
deepseek-v3.2
gpt-4.1-nano
glm-5.2
claude-fable-5
grok-4.5
gpt-5.6-sol
gpt-5.6-terra
gpt-5.6-luna

Cost against trust

Cost of one full pass against the Provenance pass rate. Position is the fact; read it as you will.

0%25%50%75%100%$0.0009$0.1331$0.2653claude-haiku-4-5deepseek-v3.2gpt-4.1-nanoglm-5.2claude-fable-5grok-4.5gpt-5.6-solgpt-5.6-terragpt-5.6-lunaCost per full pass →Provenance pass rate →

The five categories

What each category tests. These describe the measurement, not any one day’s result.

How it is scored

Every verdict is computed by fixed, deterministic rules against known ground truth. There is no LLM judging the output, so the judge cost is zero and no model grades another model. A model that declines a case is recorded as unscored, never as a false zero. Every run is kept as a dated, immutable observation that is never overwritten.

Read the full methodology →