Skip to main content
Chaque chiffre de cette page provient d’un vrai run payant contre le harnais exact dans eval/ — jamais un proxy, jamais trié sur le volet. Reproductible par vous-même : voir eval/README.md.

Où on en est aujourd’hui

30,6 % de précision de réponse sur un échantillon stratifié de 180 questions LoCoMo, mesuré le 17/08/2026 sous un protocole figé pour rester comparable aux chiffres publiés de Mem0/Zep (mêmes prompts de question, de contexte et de jugement ; gpt-4o-mini pour la lecture comme pour le jugement, température 0). Ce n’est pas un chiffre qu’on met en avant comme argument concurrentiel. Les résultats académiques publiés placent les systèmes de mémoire non-graphe crédibles dans la fourchette 65-70 % sur LoCoMo — le papier de Mem0 lui-même rapporte 66,9 % (arXiv:2504.19413). On n’y est pas encore, et cette page le dit clairement plutôt que de choisir une métrique plus flatteuse. Ce qu’on a réellement, c’est une trajectoire mesurée sur ce même protocole figé, et un harnais assez honnête pour montrer ses propres points faibles.

La trajectoire

Toutes les catégories ont progressé, le temporal le plus (+14,2 points) — l’effet direct de la résolution des dates relatives (“la semaine dernière”) en plages exactes dès l’écriture, plutôt que de laisser ce calcul au modèle de lecture (un LLM livré à lui-même sur des dates brutes ne réussit ce calcul que 13,5-16 % du temps, benchmark Test-of-Time).
Les deux runs utilisent des tailles d’échantillon différentes (1540 complet vs. un échantillon stratifié de 180 questions respectant les vraies proportions de catégories LoCoMo). Les deux sont de vraies mesures payantes sur le protocole figé identique, pas un proxy — mais un échantillon de 180 questions porte une marge d’erreur plus large que 1540. Considérez la direction et l’ampleur de la trajectoire comme solides ; considérez le point d’arrivée exact comme ±7 points jusqu’au prochain run complet.

Ce que ça coûte

0,082 autotalpourlerunstratifieˊde180questions0,00036au total pour le run stratifié de 180 questions -- 0,00036 par requête, 0,0025 $ par conversation ingérée. Détail complet, config du run incluse (checksum du dataset figé, prompts, prix des modèles) qui rend ce chiffre reproductible : eval/results/ (gitignored dans le dépôt — généré localement quand vous lancez le harnais).
Le protocole de calibration fige le budget de contexte à 900 tokens pour rester comparable aux chiffres publiés Mem0/Zep — pas le défaut produit réel de 2000 tokens (relevé dans v0.2.0 sur la base de courbes précision/budget qui ne s’appliquent pas à ce protocole figé). Le chiffre ci-dessus est Haki mesuré sous un budget plus strict que ce qu’il livre réellement.

Ce qui est encore cassé

Déclaré comme issues suivies et étiquetées — pas caché, pas corrigé silencieusement entre deux versions :

Accuracy temporal en retrait

26,3 % vs. 32,7 % — l’ancrage temporel a comblé une partie de l’écart, pas tout.

Écart aux chiffres publiés Mem0/Zep

Ce qu’on sait et ce qu’on ne sait pas encore sur les ~35 points restants.

Count et open-domain : échantillon trop petit

n=3 et n=11 — pas encore assez pour en tirer une conclusion seule.

Latence du reranker, pas encore isolée

+33,4 points mesurés, mais opt-in car le coût de latence exact n’est pas quantifié isolément.
Liste complète, et commentez si vous êtes tombé sur quelque chose de non listé : issues known-limitation.

Méthodologie

  • Dataset : LoCoMo, figé par checksum SHA-256 — le même jeu de 1540 questions à chaque run, jamais une cible mouvante.
  • Protocole : mem0_calibration dans eval/configs/ — reproduit l’ordre exact question-puis-contexte de Mem0 et son prompt de jugement, pour que le chiffre obtenu soit comparable à ce que Mem0 et Zep publient dans leurs propres conditions, pas juste cohérent en interne.
  • Modèles : gpt-4o-mini pour le modèle de réponse comme pour le juge, température 0.
  • Ce qui est mesuré au-delà de l’accuracy : taux d’abstention, fuite de contradiction, tokens de contexte par paquet, latence p50/p95, coût par requête et par ingestion — des métriques que le secteur publie rarement à côté d’un chiffre vitrine.
  • Reproduisez-le vous-même : commandes exactes dans eval/README.md. Aucun compte requis — ça tourne contre votre propre instance auto-hébergée.
Rapport généré le 17/08/2026. Prochaine révision au prochain run complet.