Conditionner
Produire les paramètres du postérieur à partir de la représentation courante.
L’intelligence variationnelle, construite à partir du neurone
JWAYU 杰维宇 développe des modèles de langage dans lesquels l’incertitude n’est pas limitée à la sortie. Elle devient une composante du calcul interne grâce à EVE — Elemental Variational Expanse.

Notre thèse
Les modèles de langage actuels sont remarquablement performants, mais leur calcul interne reste largement déterministe. JWAYU part d’une autre hypothèse : lorsque l’ambiguïté est inhérente à l’intelligence, l’unité de calcul doit pouvoir la représenter.
EVE — Elemental Variational Expanse
C’est une unité probabiliste locale dotée d’un prior explicite, d’un postérieur amorti et d’une régularisation variationnelle au niveau de l’unité. Son activation n’est plus seulement une valeur : elle est produite à partir d’une distribution apprise.
Produire les paramètres du postérieur à partir de la représentation courante.
Représenter un ensemble continu d’états latents plausibles.
Utiliser un échantillon reparamétré dans le passage avant.
Contraindre le postérieur par rapport au prior et rendre son fonctionnement interne mesurable.
Recherche en accès ouvert
Du neurone variationnel aux Transformers, puis au contrôle fondé sur l’incertitude interne.
L’article sépare quatre axes du calcul neuronal probabiliste, formalise un critère explicite de neurone variationnel au niveau de l’unité et l’illustre par des expériences EVE contrôlées, dont une comparaison fraîche sur 50 seeds à capacité exactement appariée.
Lire →Les réseaux neuronaux propagent généralement des activations cachées ponctuelles. Cet article étudie une granularité plus fine : le neurone lui-même comme unité de calcul fondée sur une distribution. EVE associe à chaque unité un postérieur conditionné par l’entrée, un prior local, un échantillonnage reparamétré, une régularisation KL et des diagnostics internes. L’évaluation isole d’abord l’unité, puis étudie sa composition dans un MLP profond et son intégration au bloc feed-forward d’un Transformer. Les résultats améliorent plusieurs métriques probabilistes tout en maintenant une précision ponctuelle comparable.
Lire →Cet article développe la thèse architecturale selon laquelle le neurone peut être traité comme une distribution plutôt que comme une activation ponctuelle. Il distingue ce calcul probabiliste local d’une incertitude portée uniquement par les poids, les ensembles, les sorties ou les variables latentes globales. Il situe également EVE par rapport à l’inférence variationnelle, à la stochasticité et aux réseaux bayésiens : le changement proposé concerne d’abord la granularité de l’unité de calcul.
Lire →Cet article étudie le neurone comme état latent local et sépare l’apprentissage du postérieur de sa lecture. Après l’entraînement, le postérieur EVE est gelé et seule la règle de lecture varie. Ce protocole vérifie si le même état latent contient une information prédictive exploitable au-delà de sa moyenne. Sur une tâche contrôlée de prévision multimodale, des lectures structurées améliorent les métriques probabilistes sans réentraîner le postérieur.
Lire →Cet article méthodologique propose un neurone variationnel local dont l’activité probabiliste interne peut être mesurée et contrôlée. Chaque unité comporte une variable latente scalaire, un prior normal standard, un postérieur gaussien amorti, un échantillon reparamétré et un terme KL local. Le protocole suit notamment la divergence KL, le carré de la moyenne postérieure, la proportion d’unités hors de la plage d’activité et, en option, une persistance autorégressive, puis relie ces diagnostics à l’erreur de prédiction.
Lire →Cette publication introduit un neurone variationnel distributionnel conçu comme une unité probabiliste locale. Chaque unité porte un prior, un postérieur amorti, un échantillon reparamétré et une régularisation ELBO locale.
Lire →Cette publication cartographie l’espace de conception d’EVE. Elle étudie l’effet de la dimension latente, du contrôle local de capacité et de la persistance temporelle sur le fonctionnement interne mesurable du neurone.
Lire →Cette publication intègre des unités EVE dans les blocs feed-forward d’un Transformer tout en conservant son architecture générale. Elle compare les variantes déterministe et variationnelle à l’aide de métriques prédictives et probabilistes.
Lire →Cette publication étudie l’incertitude interne comme signal opérationnel. Elle l’utilise pour réguler l’apprentissage, sélectionner des points de contrôle et guider des interventions au moment de l’inférence.
Lire →EVE représente certaines activations cachées sous la forme de distributions postérieures conditionnées par l’entrée. Cette architecture rend l’incertitude interne observable et exploitable pour le suivi de la fiabilité et pour un calcul tenant compte de l’incertitude.
Lire →EVE rend l’activité postérieure interne directement mesurable pendant le calcul d’un modèle de langage. L’étude compare la qualité prédictive, la calibration et le risque dans la queue de distribution à ceux de modèles déterministes, de MC Dropout et d’ensembles.
Lire →L’article propose un tableau de mesure de l’activité postérieure locale : divergence KL, échelle postérieure, énergie de la moyenne et proportion d’unités actives. Ces mesures internes sont mises en relation avec le comportement prédictif, la calibration et la robustesse.
Lire →Cette étude contrôlée, menée avec cinq initialisations aléatoires appariées, évalue EVE comme mécanisme à petite échelle pour produire et mesurer une activité probabiliste interne. Elle examine conjointement la vraisemblance, la précision, la calibration, le risque extrême et les diagnostics postérieurs.
Lire →