Skip to content
QGI measurement / LQBENCH-QGI/0.7

Measure capabilities across systems. Calibrate them under held-out conditions.

The LargeQuant QGI measurement layer evaluates a vector of quantitative capabilities across materially different domains. R4 carries the calibrated measurement framework into pre-registered demonstrations and evidence publication without collapsing results into one unsupported score.

Capability vector

Eleven dimensions of quantitative cognition.

PROPOSED FRAMEWORK
REP

Quantitative representation

Can the system identify variables, units, state, relationships and missing information needed to represent the problem quantitatively?

MOD

Model selection & construction

Can it select, construct or reject an appropriate quantitative model family under explicit assumptions?

SIM

Simulation

Can it operate deterministic, stochastic or domain-specific simulators correctly and preserve their conditions?

PRE

Prediction

Can it produce out-of-sample predictions with explicit error, calibration and failure conditions?

OPT

Optimisation

Can it search under explicit objectives and constraints without silently relaxing the problem?

UNC

Uncertainty & calibration

Can it quantify what is not known and remain calibrated as models, evidence and domains change?

EXP

Experiment design

Can it select measurements, simulations or interventions that reduce uncertainty or discriminate between hypotheses?

EVD

Evidence & reproducibility

Can a result be traced to exact inputs, methods, runtime, outputs, uncertainty and signed provenance?

MEM

Scientific memory

Can it retain hypotheses, failures, contradictions, evidence and unresolved questions without rewriting history?

XFR

Cross-domain transfer

Can the same intelligence architecture adapt to materially different quantitative systems rather than memorising one benchmark family?

AUT

Bounded autonomy

Can it close objective → experiment → evidence → decision loops under explicit budgets, guards and stop conditions?

Domain coverage

Generality requires materially different quantitative systems.

STOCHASTIC / ECONOMIC

Stochastic & economic systems

forecastingriskmarket dynamicsresource allocation
PHYSICAL / DYNAMICAL

Physical & dynamical systems

state evolutioncontrolphysics simulationtrajectory prediction
ENGINEERING / DESIGN

Engineering & design systems

constraint optimisationresponse surfacesreliabilitydigital twins
MOLECULAR / BIOLOGICAL

Molecular & biological systems

property predictionassay reasoningcandidate rankingbiological uncertainty
MATERIALS / SCIENTIFIC

Materials & scientific systems

compositionmultifidelity simulationexperimental designscientific discovery
No shortcut to “general”.

A system that dominates one domain remains specialised until transfer is demonstrated under held-out task-family, domain or regime conditions.

R4 calibration additions

Measurement becomes stronger when the comparison and resource envelope are explicit.

8

Task families

Reusable quantitative problem structures that can be instantiated across domains.

5

Baseline classes

Naive, classical, specialised, general-purpose and domain-authority references.

6

Held-out regimes

Task, domain, parameter, noise, objective and tool shifts.

9

Resource fields

Compute and tool-use accounting alongside capability metrics.

Task contract

What problem was actually posed?

task_idtask_versiontask_familydomainstate_definitionobjectiveconstraintsinput_contractallowed_models_toolsoutput_contractprimary_metricsecondary_metricsuncertainty_requirementevidence_requirementresource_budgetheld_out_regimereproducibility_procedurefailure_conditions
Evidence contract

How was the result produced?

task_manifest_hashdataset_and_source_lineagemodel_solver_simulator_versionsruntime_environmentrandomness_and_seed_policyraw_outputsderived_metricsuncertainty_and_calibrationresource_accountingexecution_evidenceprovenance_and_signatures

Measurement now feeds evidence-producing demonstrations.

R4 defines how demonstrations must be registered and how evidence must be published. Public result arrays and calibrated level thresholds remain empty until real runs exist.

QGI demonstrations