Chaque chiffre de cette page provient d’un vrai run payant contre le
harnais exact dans
eval/
— jamais un proxy, jamais trié sur le volet. Reproductible par vous-même :
voir eval/README.md.Où on en est aujourd’hui
30,6 % de précision de réponse sur un échantillon stratifié de 180 questions LoCoMo, mesuré le 17/08/2026 sous un protocole figé pour rester comparable aux chiffres publiés de Mem0/Zep (mêmes prompts de question, de contexte et de jugement ;gpt-4o-mini pour la lecture comme pour le jugement, température 0).
Ce n’est pas un chiffre qu’on met en avant comme argument concurrentiel.
Les résultats académiques publiés placent les systèmes de mémoire non-graphe
crédibles dans la fourchette 65-70 % sur LoCoMo — le papier de Mem0
lui-même rapporte 66,9 %
(arXiv:2504.19413). On n’y est pas
encore, et cette page le dit clairement plutôt que de choisir une métrique
plus flatteuse.
Ce qu’on a réellement, c’est une trajectoire mesurée sur ce même protocole
figé, et un harnais assez honnête pour montrer ses propres points faibles.
La trajectoire
Toutes les catégories ont progressé, le temporal le plus (+14,2 points) —
l’effet direct de la résolution des dates relatives (“la semaine dernière”)
en plages exactes dès l’écriture, plutôt que de laisser ce calcul au modèle
de lecture (un LLM livré à lui-même sur des dates brutes ne réussit ce
calcul que 13,5-16 % du temps, benchmark
Test-of-Time).
Les deux runs utilisent des tailles d’échantillon différentes (1540
complet vs. un échantillon stratifié de 180 questions respectant les
vraies proportions de catégories LoCoMo). Les deux sont de vraies mesures
payantes sur le protocole figé identique, pas un proxy — mais un
échantillon de 180 questions porte une marge d’erreur plus large que
1540. Considérez la direction et l’ampleur de la trajectoire comme
solides ; considérez le point d’arrivée exact comme ±7 points jusqu’au
prochain run complet.
Ce que ça coûte
0,082 par requête, 0,0025 $ par conversation ingérée. Détail complet, config du run incluse (checksum du dataset figé, prompts, prix des modèles) qui rend ce chiffre reproductible :eval/results/
(gitignored dans le dépôt — généré localement quand vous lancez le
harnais).
Le protocole de calibration fige le budget de contexte à 900 tokens pour
rester comparable aux chiffres publiés Mem0/Zep — pas le défaut produit
réel de 2000 tokens (relevé dans
v0.2.0 sur la base de courbes
précision/budget qui ne s’appliquent pas à ce protocole figé). Le chiffre
ci-dessus est Haki mesuré sous un budget plus strict que ce qu’il livre
réellement.Ce qui est encore cassé
Déclaré comme issues suivies et étiquetées — pas caché, pas corrigé silencieusement entre deux versions :Accuracy temporal en retrait
26,3 % vs. 32,7 % — l’ancrage temporel a comblé une partie de l’écart, pas tout.
Écart aux chiffres publiés Mem0/Zep
Ce qu’on sait et ce qu’on ne sait pas encore sur les ~35 points restants.
Count et open-domain : échantillon trop petit
n=3 et n=11 — pas encore assez pour en tirer une conclusion seule.
Latence du reranker, pas encore isolée
+33,4 points mesurés, mais opt-in car le coût de latence exact n’est pas quantifié isolément.
known-limitation.
Méthodologie
- Dataset : LoCoMo, figé par checksum SHA-256 — le même jeu de 1540 questions à chaque run, jamais une cible mouvante.
- Protocole :
mem0_calibrationdanseval/configs/— reproduit l’ordre exact question-puis-contexte de Mem0 et son prompt de jugement, pour que le chiffre obtenu soit comparable à ce que Mem0 et Zep publient dans leurs propres conditions, pas juste cohérent en interne. - Modèles :
gpt-4o-minipour le modèle de réponse comme pour le juge, température 0. - Ce qui est mesuré au-delà de l’accuracy : taux d’abstention, fuite de contradiction, tokens de contexte par paquet, latence p50/p95, coût par requête et par ingestion — des métriques que le secteur publie rarement à côté d’un chiffre vitrine.
- Reproduisez-le vous-même : commandes exactes dans
eval/README.md. Aucun compte requis — ça tourne contre votre propre instance auto-hébergée.

