Le problème
La fenêtre de contexte d'un modèle de langage est finie. Toute approche pour lui donner une mémoire au-delà de cette fenêtre paie l'un de deux coûts : soit le modèle doit deviner son chemin de retour vers ce qu'il savait — en régénérant le texte récupéré token par token, ce qui veut dire qu'il peut énoncer un fait vrai de façon fausse même quand la récupération elle-même était correcte — soit le système accepte silencieusement qu'une partie de l'information dérive, se dégrade ou disparaisse à mesure que les conversations s'allongent.
La plupart des couches de mémoire construites aujourd'hui pour les modèles de langage choisissent le premier coût, parce que c'est le plus facile à construire : récupérer du texte, le remettre dans le prompt, laisser le modèle parler. Ça marche, et c'est pour ça que les approches par récupération augmentée sont la norme. Cela veut aussi dire que le mode d'échec est silencieux — une réponse subtilement fausse ressemble exactement à une bonne réponse jusqu'à ce que quelqu'un vérifie.
Ce que MH-X vise
Un modèle peut-il se souvenir de quelque chose qu'on lui a dit plus tôt sans jamais le régénérer — en lisant le fait plutôt qu'en le reconstruisant à partir d'une supposition — tout en restant adressable comme une personne le demanderait, en langage ordinaire, tolérant à la reformulation ? Trois propriétés sont poursuivies ensemble, délibérément, parce qu'aucune d'elles seule n'est difficile.
Rien n'est renvoyé dans une conversation sans avoir été vérifié, sur le moment, contre ce qui a réellement été stocké. Quand la vérification échoue, le système le dit au lieu de répondre.
Le même mécanisme de mémoire a été exercé sur deux piles d'inférence construites indépendamment et deux tailles de modèle très différentes, sans dépendre de l'API ou de la couche de service d'un seul fournisseur.
Le coût de stockage à long terme reste proche de la taille du texte brut lui-même ; la représentation plus coûteuse n'est construite que pour les éléments qui sont effectivement redemandés.
Mesuré, pas supposé.
Contenu précédemment stocké reconstruit exactement, confirmé en redémarrant le processus qui le détient — validé indépendamment sur deux moteurs d'inférence sans rapport et sur des modèles écartés d'un facteur d'environ 24x en nombre de paramètres.
Surcoût pour le contenu conservé mesuré à un petit multiple quasi constant de la taille du texte d'origine — la base pour conserver un historique accumulé très large sans coût proportionnel de stockage spécialisé.
Une étape dédiée rejette purement et simplement une réponse qui ne correspond pas, mesurée pour attraper les erreurs de récupération avant qu'elles n'atteignent une conversation, plutôt qu'après.
Une faille identifiée par comparaison directe avec un système interne existant a été fermée le jour même : la mémoire est maintenant scindée pour pouvoir être oubliée sur demande, séparément de ce qui est censé persister.
Fidèle à la façon dont chaque page de ce site est écrite : un résultat sans ses limites n'est pas un résultat.
- Le rappel au milieu d'une conversation longue et déjà en cours est aujourd'hui mesurablement moins fiable que le rappel au début d'une conversation nouvelle — une régression identifiée, pas cachée, et le problème ouvert actuel de cet axe.
- Tout ce qui précède provient d'une seule journée intensive de mesure disciplinée sur des modèles ouverts de petite à moyenne taille. Cela n'a pas été exécuté à l'échelle de production, ni comparé aux systèmes à récupération augmentée déjà largement utilisés.
- Ceci est un journal de recherche, pas une capacité livrée. Rien ici n'est une promesse de produit.
MH-X se place aux côtés de DAS et ACE comme infrastructure d'apprentissage continu et de mémoire alimentant MH-AI — mesuré de la même façon, tenu à la même exigence.
Voir MH-AI →Ne jamais présenter comme prouvé ce qui n'a pas été mesuré — y compris quand la mesure est une limite, pas une victoire.