LQBench-QGI Measurement, Calibration & Demonstration Specification 0.3
A public, machine-readable proposal for measuring, calibrating, demonstrating and publishing evidence for quantitative intelligence across domains.
This document defines how QGI claims could be calibrated, demonstrated and supported by public evidence. It does not certify LargeQuant or any other system as QGI, and it publishes no universal QGI score.
Task families + baselines + holdouts + evidence.
— No level is awarded by Public QGI R8.
— Numeric level thresholds remain intentionally unassigned until reference tasks are executed against reproducible baselines and independently reviewed.
— A future level claim must report the complete dimension vector, domain coverage, held-out transfer results, uncertainty quality and resource envelope.
— Cross-domain claims require held-out task families from materially different quantitative systems.
— Evidence, uncertainty and reproducibility are gating requirements rather than optional bonus metrics.
A benchmark run is valid only inside explicit task, evidence and evaluation contracts.
Task manifest
task_idtask_versiontask_familydomainstate_definitionobjectiveconstraintsinput_contractallowed_models_toolsoutput_contractprimary_metricsecondary_metricsuncertainty_requirementevidence_requirementresource_budgetheld_out_regimereproducibility_procedurefailure_conditions
Evidence manifest
task_manifest_hashdataset_and_source_lineagemodel_solver_simulator_versionsruntime_environmentrandomness_and_seed_policyraw_outputsderived_metricsuncertainty_and_calibrationresource_accountingexecution_evidenceprovenance_and_signatures
Evaluation manifest
evaluation_idprotocol_versionsystem_idsystem_versiontask_manifest_hashbaseline_idsheld_out_regimerun_countresource_budgetenvironment_hashevidence_bundle_idstarted_atcompleted_at
Protocol, demonstration manifests and evidence packets are separate from claims.
calibrated_thresholds, public_demonstrations, results and certifications remain empty in Public QGI R4.