Demo -- read-only snapshot of the live system as of 2026-07-16T01:45:31Z; no live data, paper units only.
Skip to main content
← receipts / scoreboard

mlb

The ledger row, decomposed. Every figure below is read from a staged artifact on disk (cited per panel); this drill describes calibration and sharpness only -- no dollar edge, ROI, or bankroll is claimed.

model
0.4873 (CRPS)
market
2.2813 (CRPS)
delta (95% ci)
1.7940 [0.8721, 3.0590]
n
21

verdict UNDERPOWERED -- source scripts/platformkit/benchmarks/crps_market/last_run_ingame_mlb.json

Murphy decomposition (model)

RELIABILITYreliability = 0.0127 (lower better)0.0127RESOLUTIONresolution = 0.0236 (higher better)0.0236UNCERTAINTYuncertainty = 0.2481 (baseline)0.2481

Brier = reliability - resolution + uncertainty (10-bin). Lower reliability and higher resolution are better; uncertainty is the irreducible base-rate floor. Descriptive, not an edge claim. Source: murphy_decomposition.json.

reliability curve (model vs market)

as of 2026-07-23T03:21:27.493056+00:00
.00.00.25.25.50.50.75.75.00.00market: predicted 0.053, observed 0.032, n=4176market: predicted 0.149, observed 0.173, n=3827market: predicted 0.247, observed 0.173, n=2997market: predicted 0.360, observed 0.236, n=4788market: predicted 0.450, observed 0.387, n=15028market: predicted 0.550, observed 0.450, n=26309market: predicted 0.643, observed 0.584, n=8350market: predicted 0.742, observed 0.667, n=4357market: predicted 0.851, observed 0.810, n=4001market: predicted 0.948, observed 0.956, n=5153model: predicted 0.051, observed 0.233, n=5127model: predicted 0.159, observed 0.253, n=4495model: predicted 0.245, observed 0.303, n=4708model: predicted 0.361, observed 0.283, n=7071model: predicted 0.457, observed 0.392, n=14736model: predicted 0.544, observed 0.462, n=17652model: predicted 0.646, observed 0.575, n=9214model: predicted 0.748, observed 0.674, n=5364model: predicted 0.847, observed 0.734, n=5866model: predicted 0.954, observed 0.663, n=4753PREDICTED

Predicted probability (x) vs observed frequency (y) against the perfect-calibration ideal (dashed). Amber = model, blue = market. Hover a point for its bin count. Source: calibration_stability.json.

bootstrap CI per bin (model)

as of 2026-07-23T03:21:27.493056+00:00
binngapgap 95% ciexcludes 0?
0.0-0.151270.1819[0.104, 0.274]yes -- gap real
0.1-0.244950.0937[0.006, 0.190]yes -- gap real
0.2-0.347080.0578[-0.030, 0.168]no -- within noise
0.3-0.47071-0.0785[-0.168, 0.019]no -- within noise
0.4-0.514736-0.0653[-0.165, 0.040]no -- within noise
0.5-0.617652-0.0818[-0.174, 0.014]no -- within noise
0.6-0.79214-0.0711[-0.186, 0.054]no -- within noise
0.7-0.85364-0.0737[-0.186, 0.036]no -- within noise
0.8-0.95866-0.1138[-0.221, -0.020]yes -- gap real
0.9-1.04753-0.2909[-0.402, -0.182]yes -- gap real
4/10 eligible bins have a calibration-gap 95% CI (cluster bootstrap on game_id) that excludes 0; the rest are within noise. Model Brier 0.2377. Brier skill vs climatology 0.042, vs market -0.150 (at or below 0 -- the model does not beat the market Brier; that null is the point). Source: calibration_stability.json + brier_skill_scores.json.