Demo -- read-only snapshot of the live system as of 2026-07-16T01:45:31Z; no live data, paper units only.
Skip to main content
← receipts / scoreboard

soccer_intl/brier

The ledger row, decomposed. Every figure below is read from a staged artifact on disk (cited per panel); this drill describes calibration and sharpness only -- no dollar edge, ROI, or bankroll is claimed.

model
0.2961 (Brier)
market
0.2030 (Brier)
delta (95% ci)
-0.0931 [-0.1570, -0.0336]
n
22

verdict UNDERPOWERED -- source scripts/platformkit/benchmarks/crps_market/last_run_ingame_soccer.json

Murphy decomposition (model)

RELIABILITYreliability = 0.0928 (lower better)0.0928RESOLUTIONresolution = 0.0382 (higher better)0.0382UNCERTAINTYuncertainty = 0.2389 (baseline)0.2389

Brier = reliability - resolution + uncertainty (10-bin). Lower reliability and higher resolution are better; uncertainty is the irreducible base-rate floor. Descriptive, not an edge claim. Source: murphy_decomposition.json.

reliability curve (model vs market)

as of 2026-07-23T03:21:27.493056+00:00
.00.00.25.25.50.50.75.75.00.00market: predicted 0.049, observed 0.167, n=1421market: predicted 0.154, observed 0.223, n=1186market: predicted 0.241, observed 0.596, n=1482market: predicted 0.351, observed 0.640, n=963market: predicted 0.448, observed 0.774, n=623market: predicted 0.551, observed 0.864, n=721market: predicted 0.649, observed 0.856, n=791market: predicted 0.736, observed 0.869, n=552market: predicted 0.841, observed 0.919, n=929market: predicted 0.925, observed 1.000, n=335model: predicted 0.045, observed 0.496, n=2012model: predicted 0.145, observed 0.419, n=1578model: predicted 0.247, observed 0.448, n=1670model: predicted 0.349, observed 0.717, n=773model: predicted 0.453, observed 0.824, n=684model: predicted 0.547, observed 0.700, n=634model: predicted 0.645, observed 0.660, n=446model: predicted 0.751, observed 0.963, n=296model: predicted 0.846, observed 0.988, n=577model: predicted 0.946, observed 1.000, n=333PREDICTED

Predicted probability (x) vs observed frequency (y) against the perfect-calibration ideal (dashed). Amber = model, blue = market. Hover a point for its bin count. Source: calibration_stability.json.

bootstrap CI per bin (model)

as of 2026-07-23T03:21:27.493056+00:00
binngapgap 95% ciexcludes 0?
0.0-0.120120.4517[0.238, 0.633]yes -- gap real
0.1-0.215780.2743[0.111, 0.457]yes -- gap real
0.2-0.316700.2004[0.012, 0.452]yes -- gap real
0.3-0.47730.3679[0.139, 0.543]yes -- gap real
0.4-0.56840.3707[0.073, 0.532]yes -- gap real
0.5-0.66340.1533[-0.001, 0.398]no -- within noise
0.6-0.74460.0148[-0.146, 0.268]no -- within noise
0.7-0.82960.2120[0.043, 0.260]yes -- gap real
0.8-0.95770.1422[0.078, 0.163]yes -- gap real
0.9-1.03330.0543[0.033, 0.082]yes -- gap real
8/10 eligible bins have a calibration-gap 95% CI (cluster bootstrap on game_id) that excludes 0; the rest are within noise. Model Brier 0.2279. Brier skill vs climatology -0.313, vs market -0.597 (at or below 0 -- the model does not beat the market Brier; that null is the point). Source: calibration_stability.json + brier_skill_scores.json.