RECHERCHEMOUHN · MH-X — INFRASTRUCTURE DE MÉMOIRE

Une mémoire à laquelle un modèle peut faire confiance sans la reconstruire.

La plupart des façons de donner une mémoire à un modèle de langage au-delà de sa fenêtre de contexte paient l'un de deux coûts : le modèle regénère ce qu'il savait et peut le formuler faux même quand la récupération était correcte, ou le système accepte silencieusement que l'information dérive à mesure que les conversations s'allongent. MH-X est un axe de recherche qui se demande si les deux coûts peuvent être évités à la fois.

Le problème

La fenêtre de contexte d'un modèle de langage est finie. Toute approche pour lui donner une mémoire au-delà de cette fenêtre paie l'un de deux coûts : soit le modèle doit deviner son chemin de retour vers ce qu'il savait — en régénérant le texte récupéré token par token, ce qui veut dire qu'il peut énoncer un fait vrai de façon fausse même quand la récupération elle-même était correcte — soit le système accepte silencieusement qu'une partie de l'information dérive, se dégrade ou disparaisse à mesure que les conversations s'allongent.

La plupart des couches de mémoire construites aujourd'hui pour les modèles de langage choisissent le premier coût, parce que c'est le plus facile à construire : récupérer du texte, le remettre dans le prompt, laisser le modèle parler. Ça marche, et c'est pour ça que les approches par récupération augmentée sont la norme. Cela veut aussi dire que le mode d'échec est silencieux — une réponse subtilement fausse ressemble exactement à une bonne réponse jusqu'à ce que quelqu'un vérifie.

Ce que MH-X vise

Un modèle peut-il se souvenir de quelque chose qu'on lui a dit plus tôt sans jamais le régénérer — en lisant le fait plutôt qu'en le reconstruisant à partir d'une supposition — tout en restant adressable comme une personne le demanderait, en langage ordinaire, tolérant à la reformulation ? Trois propriétés sont poursuivies ensemble, délibérément, parce qu'aucune d'elles seule n'est difficile.

Vérifiée, pas supposée

Rien n'est renvoyé dans une conversation sans avoir été vérifié, sur le moment, contre ce qui a réellement été stocké. Quand la vérification échoue, le système le dit au lieu de répondre.

Portable entre moteurs

Le même mécanisme de mémoire a été exercé sur deux piles d'inférence construites indépendamment et deux tailles de modèle très différentes, sans dépendre de l'API ou de la couche de service d'un seul fournisseur.

Peu coûteuse à conserver

Le coût de stockage à long terme reste proche de la taille du texte brut lui-même ; la représentation plus coûteuse n'est construite que pour les éléments qui sont effectivement redemandés.

CE QUI A ÉTÉ MESURÉ JUSQU'ICI

Mesuré, pas supposé.

Reconstruction exacte

Contenu précédemment stocké reconstruit exactement, confirmé en redémarrant le processus qui le détient — validé indépendamment sur deux moteurs d'inférence sans rapport et sur des modèles écartés d'un facteur d'environ 24x en nombre de paramètres.

Coût de stockage

Surcoût pour le contenu conservé mesuré à un petit multiple quasi constant de la taille du texte d'origine — la base pour conserver un historique accumulé très large sans coût proportionnel de stockage spécialisé.

La vérification attrape les erreurs tôt

Une étape dédiée rejette purement et simplement une réponse qui ne correspond pas, mesurée pour attraper les erreurs de récupération avant qu'elles n'atteignent une conversation, plutôt qu'après.

Faille de confidentialité fermée le jour même

Une faille identifiée par comparaison directe avec un système interne existant a été fermée le jour même : la mémoire est maintenant scindée pour pouvoir être oubliée sur demande, séparément de ce qui est censé persister.

Ce qui n'est pas encore vrai

Fidèle à la façon dont chaque page de ce site est écrite : un résultat sans ses limites n'est pas un résultat.

  • Le rappel au milieu d'une conversation longue et déjà en cours est aujourd'hui mesurablement moins fiable que le rappel au début d'une conversation nouvelle — une régression identifiée, pas cachée, et le problème ouvert actuel de cet axe.
  • Tout ce qui précède provient d'une seule journée intensive de mesure disciplinée sur des modèles ouverts de petite à moyenne taille. Cela n'a pas été exécuté à l'échelle de production, ni comparé aux systèmes à récupération augmentée déjà largement utilisés.
  • Ceci est un journal de recherche, pas une capacité livrée. Rien ici n'est une promesse de produit.

Ne jamais présenter comme prouvé ce qui n'a pas été mesuré — y compris quand la mesure est une limite, pas une victoire.