Conditionner
Produire les paramètres du postérieur à partir de la représentation courante.
L’intelligence variationnelle, depuis le neurone
JWAYU 杰维宇 développe des modèles dans lesquels l’incertitude n’est pas seulement estimée à la sortie. Elle devient une composante du calcul interne grâce à EVE, l’Elemental Variational Expanse.

Notre thèse
Les modèles actuels restent largement déterministes dans leur calcul interne. JWAYU part d’une autre hypothèse : lorsque l’ambiguïté appartient à l’intelligence, l’unité de calcul doit pouvoir la représenter.
EVE - Elemental Variational Expanse
Une unité probabiliste locale dotée d’un prior explicite, d’un postérieur amorti et d’une régularisation variationnelle. Son activation est produite à partir d’une distribution apprise.
Produire les paramètres du postérieur à partir de la représentation courante.
Porter un ensemble continu d’états latents plausibles.
Utiliser un échantillon reparamétré dans le passage avant.
Régulariser le postérieur et mesurer son régime interne.
Recherche ouverte
Du neurone variationnel aux Transformers, puis au contrôle fondé sur l’incertitude interne.
Cette publication introduit un neurone variationnel distributionnel conçu comme une brique probabiliste locale. Chaque unité porte un prior, un postérieur amorti, un échantillon reparamétré et une régularisation ELBO locale.
Cette publication cartographie l’espace de conception d’EVE. Elle étudie l’effet de la dimension latente, du contrôle local de capacité et de la persistance temporelle sur le régime interne mesurable du neurone.
Cette publication intègre des unités EVE dans les blocs feed-forward d’un Transformer tout en conservant son architecture générale. Elle compare les variantes déterministe et variationnelle sur des métriques prédictives et probabilistes.
Cette publication étudie l’incertitude interne comme signal opérationnel. Elle l’utilise pour réguler l’apprentissage, sélectionner des checkpoints et guider des interventions au moment de l’inférence.
EVE représente certaines activations cachées comme des distributions postérieures conditionnées par l’entrée. Cette architecture rend l’incertitude interne observable et exploitable pour le suivi de fiabilité et le calcul sensible à l’incertitude.
EVE rend l’activité postérieure interne directement mesurable pendant le calcul d’un modèle de langage. L’étude compare la qualité prédictive, la calibration et le risque de queue à des références déterministes, MC Dropout et ensemble.
L’article propose un tableau de mesure de l’activité postérieure locale : divergence KL, échelle postérieure, énergie de la moyenne et fraction d’unités actives. Ces mesures internes sont mises en relation avec le comportement prédictif, la calibration et la robustesse.
Cette étude contrôlée sur cinq graines évalue EVE comme mécanisme à petite échelle pour produire et mesurer une activité distributionnelle interne. Elle examine conjointement la vraisemblance, la précision, la calibration, le risque extrême et les diagnostics postérieurs.
Contact