Skip to content
Open research specification / LQBENCH-QGI/0.7

LQBench-QGI Measurement, Calibration & Demonstration Specification 0.3

A public, machine-readable proposal for measuring, calibrating, demonstrating and publishing evidence for quantitative intelligence across domains.

Statuscross-domain-transfer-and-generality-evidence-enabled-no-qgi-certification
ProtocolLQBENCH-QGI/0.7
AuthorityPUBLIC-QGI-R8
Calibrated thresholdsNone
Specification boundary

This document defines how QGI claims could be calibrated, demonstrated and supported by public evidence. It does not certify LargeQuant or any other system as QGI, and it publishes no universal QGI score.

Calibration objects

Task families + baselines + holdouts + evidence.

Task families8
Baseline classes5
Held-out regimes6
Resource fields9

— No level is awarded by Public QGI R8.

— Numeric level thresholds remain intentionally unassigned until reference tasks are executed against reproducible baselines and independently reviewed.

— A future level claim must report the complete dimension vector, domain coverage, held-out transfer results, uncertainty quality and resource envelope.

— Cross-domain claims require held-out task families from materially different quantitative systems.

— Evidence, uncertainty and reproducibility are gating requirements rather than optional bonus metrics.

Protocol structure

A benchmark run is valid only inside explicit task, evidence and evaluation contracts.

Task manifest

  1. task_id
  2. task_version
  3. task_family
  4. domain
  5. state_definition
  6. objective
  7. constraints
  8. input_contract
  9. allowed_models_tools
  10. output_contract
  11. primary_metric
  12. secondary_metrics
  13. uncertainty_requirement
  14. evidence_requirement
  15. resource_budget
  16. held_out_regime
  17. reproducibility_procedure
  18. failure_conditions

Evidence manifest

  1. task_manifest_hash
  2. dataset_and_source_lineage
  3. model_solver_simulator_versions
  4. runtime_environment
  5. randomness_and_seed_policy
  6. raw_outputs
  7. derived_metrics
  8. uncertainty_and_calibration
  9. resource_accounting
  10. execution_evidence
  11. provenance_and_signatures

Evaluation manifest

  1. evaluation_id
  2. protocol_version
  3. system_id
  4. system_version
  5. task_manifest_hash
  6. baseline_ids
  7. held_out_regime
  8. run_count
  9. resource_budget
  10. environment_hash
  11. evidence_bundle_id
  12. started_at
  13. completed_at
Machine-readable publication

Protocol, demonstration manifests and evidence packets are separate from claims.

EMPTY BY DESIGN

calibrated_thresholds, public_demonstrations, results and certifications remain empty in Public QGI R4.

Definition → measurement → calibration → demonstration → evidence.

Demonstration framework