Variational Neurons in Transformers for Language Modeling
Résumé
Cette publication intègre des unités EVE dans les blocs feed-forward d’un Transformer tout en conservant son architecture générale. Elle compare les variantes déterministe et variationnelle sur des métriques prédictives et probabilistes.
Cette page est une présentation localisée. Le titre bibliographique, l’abstract intégral, le PDF et les métadonnées Google Scholar sont conservés sur la page anglaise de référence.