SkillOptimizer
Research hub
Null resultAI usage (tokens)

Improvement on a random draw

On a random draw of skills, how often does any improvement reach a test?

measured-local2026-09-190d3b836
  • docs/experiments/COMPILER-LOOP-NULL-2026-09-19.md · 0d3b836 · 2026-09-19

Headline figures

8

Rounds run

measured-local · 2026-09-19

2of 8

Rounds that compiled anything

measured-local · n=8 · 2026-09-19

64

Skills drawn

measured-local · 2026-09-19

3of 64

Reached a comparison

measured-local · n=64 · 2026-09-19

4.7%

Share that reached a comparison

measured-local · 2026-09-19

30of 64

No deterministic work any generator could find

measured-local · n=64 · 2026-09-19

46.9%

Share with no deterministic work found

measured-local · 2026-09-19

0of 3

Accepted

measured-local · n=3 · 2026-09-19

Notes

  • The loop stopped at its eight-round limit, neither converged nor gave up: only rounds that compiled something count toward its registered thresholds.
  • Two skills lost their artifact to an instrument defect: scaffold files were dropped before reaching the container. They are the artifact_not_installed outcome, kept as that status rather than counted as skills with nothing to compile.
  • 46.9 percent is a property of this corpus as seen by three deterministic detectors, not of agent skills in general.

Tables

Random-draw loop, outcome per skill drawn

n: Skills with this outcome. 8 rows.

outcomeskillssharenevidence_classdatecommit
no_artifact300.468830measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
unmeasurable130.203113measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
no_baseline_advantage80.1258measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
tasks_not_discriminating60.09386measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
compared30.04693measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
artifact_not_installed20.03132measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
artifact_refused10.01561measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
insufficient_repetitions10.01561measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628

Random-draw loop, per round

n: Skills drawn in the round. 8 rows.

rounddrawncompiledacceptedrules_addednevidence_classdatecommit
181008measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
280008measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
380008measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
480008measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
582008measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
680008measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
780008measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
880008measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628

Random-draw loop, the comparisons

n: Runs per arm behind the row: repetitions times tasks compared, or the graded runs of the eligibility check when the skill was not compared. 3 rows.

skillnameshapeinstallsstatusstatus_supersededdecisionacceptedartifactsskill_md_unchangedtoken_reductionspread_minspread_maxstraddles_zeronet_call_changetokens_nonetokens_originaltokens_optimizedscore_nonescore_originalscore_optimizedmission_preservedretention_bandRtasksnevidence_classdatecommit
webiny-api-architectAPI Architecture Patternsreference-lookup1compared—inconclusive_repetitions_straddle_zeroNohookYes0.229-0.25950.4176Yes-274,934129,805100,07500.60.8Yesfull313measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
axiom-swiftSwift Language & Platformreference-lookup—compared—inconclusive_repetitions_straddle_zeroNohookYes0.0057-0.00570.0206Yes-121,05055,93055,6100.411Yesfull313measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628
aws-cloudformationCloudFormationworkflow—compared—rejected_not_cheaperNohookYes-0.4342-0.7728-0.2091No092,266215,759309,4370.811Yesfull326measured-local2026-09-190d3b836079506c06e00a5ae5fa4d0eede75aa628