Condicionar
Producir los parámetros del posterior a partir de la representación actual.
Inteligencia variacional, construida desde la neurona
JWAYU 杰维宇 desarrolla modelos de lenguaje en los que la incertidumbre no se limita a la salida. Pasa a formar parte del cálculo interno gracias a EVE — Elemental Variational Expanse.

Nuestra tesis
Los modelos de lenguaje actuales son extraordinariamente capaces, pero su cálculo interno sigue siendo en gran medida determinista. JWAYU parte de otra premisa: cuando la ambigüedad es inherente a la inteligencia, la propia unidad de cálculo debe poder representarla.
EVE — Elemental Variational Expanse
Es una unidad probabilística local con un prior explícito, un posterior amortizado y regularización variacional a escala de unidad. La activación deja de ser solo un valor: se genera a partir de una distribución aprendida.
Producir los parámetros del posterior a partir de la representación actual.
Representar un conjunto continuo de estados latentes plausibles.
Utilizar una muestra reparametrizada durante la pasada hacia delante.
Restringir el posterior respecto al prior y hacer medible su funcionamiento interno.
Investigación de acceso abierto
Desde la neurona variacional hasta los Transformers y el control basado en la incertidumbre interna.
Las redes neuronales suelen propagar activaciones ocultas de valor puntual. Este artículo estudia una granularidad más fina: el propio neurón como unidad de cálculo basada en una distribución. EVE dota a cada unidad de un posterior condicionado por la entrada, un prior local, muestreo reparametrizado, regularización KL y diagnósticos internos. La evaluación aísla primero la unidad y después analiza su composición en un MLP profundo y su integración en el bloque feed-forward de un Transformer. Los resultados mejoran varias métricas probabilísticas y mantienen una precisión puntual comparable.
Leer →Este artículo desarrolla la tesis arquitectónica de que un neurón puede tratarse como una distribución, y no solo como una activación puntual. Distingue este cálculo probabilístico local de la incertidumbre situada únicamente en los pesos, los ensembles, las salidas o las variables latentes globales. También sitúa EVE frente a la inferencia variacional, la estocasticidad y las redes bayesianas: el cambio propuesto afecta ante todo a la granularidad de la unidad de cálculo.
Leer →Este artículo estudia el neurón como un estado latente local y separa el aprendizaje del posterior de su lectura. Tras el entrenamiento, el posterior de EVE se mantiene congelado y solo cambia la regla de lectura. El protocolo comprueba si el mismo estado latente contiene información predictiva útil más allá de su media. En una tarea controlada de predicción multimodal, las lecturas estructuradas mejoran las métricas probabilísticas sin volver a entrenar el posterior.
Leer →Este artículo metodológico propone un neurón variacional local cuya actividad probabilística interna puede medirse y controlarse. Cada unidad incluye una variable latente escalar, un prior normal estándar, un posterior gaussiano amortizado, una muestra reparametrizada y un término KL local. El protocolo sigue la divergencia KL, el cuadrado de la media posterior, la proporción de unidades fuera del intervalo de actividad y, de forma opcional, una persistencia autorregresiva, y relaciona estos diagnósticos con el error de predicción.
Leer →Esta publicación introduce un neurón variacional basado en distribuciones, concebido como una unidad probabilística local. Cada unidad incorpora un prior, un posterior amortizado, una muestra reparametrizada y una regularización ELBO local.
Leer →Esta publicación cartografía el espacio de diseño de EVE. Estudia cómo la dimensionalidad latente, el control local de capacidad y la persistencia temporal afectan al funcionamiento interno medible del neurón.
Leer →Esta publicación integra unidades EVE en los bloques feed-forward de un Transformer sin alterar su arquitectura general. Compara las variantes determinista y variacional mediante métricas predictivas y probabilísticas.
Leer →Esta publicación estudia la incertidumbre interna como señal operativa. La utiliza para regular el aprendizaje, seleccionar puntos de control y orientar intervenciones durante la inferencia.
Leer →EVE representa determinadas activaciones ocultas como distribuciones posteriores condicionadas por la entrada. Esta arquitectura hace observable la incertidumbre interna y permite utilizarla para supervisar la fiabilidad y realizar cálculos sensibles a la incertidumbre.
Leer →EVE permite medir directamente la actividad posterior interna durante el cálculo de un modelo de lenguaje. El estudio compara la calidad predictiva, la calibración y el riesgo en la cola de la distribución con modelos deterministas, MC Dropout y ensembles.
Leer →El artículo propone un panel de medidas de la actividad posterior local: divergencia KL, escala posterior, energía de la media y proporción de unidades activas. Estas medidas internas se relacionan con el comportamiento predictivo, la calibración y la robustez.
Leer →Este estudio controlado, realizado con cinco inicializaciones aleatorias emparejadas, evalúa EVE como mecanismo a pequeña escala para producir y medir actividad probabilística interna. Analiza conjuntamente la verosimilitud, la precisión, la calibración, el riesgo extremo y los diagnósticos posteriores.
Leer →