Variational Neurons in Transformers for Language Modeling
DOI: 10.48550/arXiv.2603.28219
Résumé
Cette publication intègre des unités EVE dans les blocs feed-forward d’un Transformer tout en conservant son architecture générale. Elle compare les variantes déterministe et variationnelle à l’aide de métriques prédictives et probabilistes.
Cette page propose une présentation en français. Le titre bibliographique officiel, l’abstract complet, le manuscrit et les métadonnées Google Scholar restent disponibles sur la page scientifique anglaise de référence.