# Agentic AI Wars — la guerre des harnesses

> Whitepaper JST6 · 2026  
> Thèse : la performance d’un agent dépend autant de son environnement d’exécution (harness) que du LLM.

## Thèse

Manifeste sur la maturité de l’ingénierie des agents — pas un catalogue de frameworks.

Preuve phare (ARC-AGI-3) : GPT-5.6-sol brut 13,3 % → dans NOOA 85,1 % (×6,4).

## I. Crise de croissance

Gen-1 (prompts, outils JSON, multi-agents bavards) s’effondre sous coût tokens + fiabilité.

SWE-bench Verified (GPT-5.5 xhigh) :

| Harness | Réussite | Appels | Tokens |
|---------|----------|--------|--------|
| NOOA | 82,2 % | 28 | ~1,1M |
| OpenCode | 78,6 % | 28 | 1,3M |
| PI | 78,2 % | 66 | 2,2M |

Cause : pass-by-value textuel.

## II. Frontière d’ingénierie

### Quatre combats

1. **Interface** — DSL/graphes vs Code-as-Action (NOOA, smolagents)
2. **Contexte** — Pass-by-Value vs Pass-by-Reference (22k–72k tok, zéro compaction)
3. **Mémoire** — Markdown vs SQLite (+11,8 pts ARC)
4. **Industrie** — sandboxes (OpenShell/Landlock, gVisor, Docker) + efficience

### Six dimensions (NVIDIA)

Typed I/O · Pass-by-Reference · Code-as-Action · Loop Engineering · Object State · Harness APIs

### Paradigme

Multi-agents collaboratifs (CrewAI, DreamTeam) vs mono-agent + skills programmables (NOOA).

## Preuves

- **Terminal-Bench** : NOOA 73 % (+12,3 pts) · terminaison `TaskResult`
- **CyberGym L1** : 86,8 % open-source · +21,9 pts vs Codex brut
- **ARC** : mémoire SQLite 50,2 % vs Markdown 38,4 %

## III. Horizon industriel

Gouvernance (iASSET) · sandboxes · coût tokens · mémoire capitalisable.

## Sources

1. arXiv:2607.20709 — NVIDIA NOOA / harness engineering  
2. arXiv:2605.09650 — DreamTeam  
3. gitlab.com/zot-lab/iasset — cadrage JST6  
4. Guide de données Agentic AI Wars (interne)
