FIABILIDADPropiedades estadísticasGENLAYER LABS RESEARCH
Una breve introducción a esta exploración:
Algunas decisiones pueden automatizarse.
El argumento
Seis preguntas, un sistema.
Cada capítulo plantea una pregunta y la responde. Aquí están todas las respuestas de una vez; el resto de la página es la evidencia, y cada capítulo termina con el paper que lleva la prueba.
- 00LA MÁQUINA¿Qué estamos construyendo?Una blockchain que puede juzgar.
- 01FIABILIDAD¿Puedes fiarte de un panel pequeño de jueces de IA?La confianza se convierte en un número.
- 02EQUIVALENCIA¿Cuándo dos respuestas de IA son «la misma»?Lo declara el contrato.
- 03ADAPTACIÓN¿Cuánta evaluación debe comprar una decisión?Exactamente la que justifica lo que hay en juego.
- 04TOKENOMICS¿Por qué el voto no se puede comprar con ordenadores?Los votos son capital bloqueado.
- 05INCENTIVOS¿Quién paga por impugnar una decisión errónea?Aquel para quien la recompensa lo haga racional.
- 06VERIFICACIÓN FORMAL¿El código desplegado coincide con las matemáticas?Se reverifica con cada cambio.
00 · La máquina
GenLayer: una blockchain capaz de juzgar.
GenLayer es una blockchain cuyos contratos pueden actuar ante preguntas sin respuesta demostrable: ¿se entregó el trabajo como se prometió?, ¿llegó dañado el envío? Su consenso es Optimistic Democracy: un líder propone, un panel de validadores —cada uno con su propio modelo de IA— vota, y el veredicto queda abierto a impugnación antes de ser definitivo.
Una decisión, de principio a fin.
01FIABILIDAD
¿Se puede confiar en una decisión cuando los evaluadores discrepan o hacen trampas?
Sí, porque la confianza se convierte en un número. El paper calcula con exactitud con qué frecuencia un panel pequeño y aleatorio coincide con su conjunto declarado de jueces, incluso con adversarios dentro.
Haz una pregunta difícil a un conjunto amplio de evaluadores honestos y puede que 80 digan que sí y 20 que no. GenLayer solo pregunta a un puñado pequeño y elegido al azar. ¿Hasta dónde puedes fiarte de ese puñado?
Imagina el conjunto declarado de posibles jueces (la población de evaluadores). Si se inclina hacia un lado, ¿con qué frecuencia un panel pequeño y aleatorio cae del mismo lado? Esa probabilidad es la reproducibilidad: coincidir con el conjunto, deliberadamente no con la verdad. El paper la calcula con exactitud, incluido el peor caso, en el que los adversarios votan siempre contra la mayoría honesta.
Cambia la proporción de respuestas, los adversarios y el número de evaluadores.
Los adversarios convierten un conjunto de 80/20 en uno de 70/30. Votan cuarenta y siete jueces al azar. ¿Con qué frecuencia siguen coincidiendo con la mayoría honesta?
Alrededor del 99,8%. Comprar a una décima parte de la población apenas hace mella en 47 jueces. Con 11 jueces esa misma cifra baja al 92%; con 1.537 es prácticamente el 100%. Pruébalo aquí abajo.
Peor caso según el modelo exacto no adaptativo del paper: todos los votos de los adversarios van en contra de la mayoría honesta.
Lo que demuestra el paper, exactamente
Fórmulas exactas para saber con qué frecuencia un panel de cualquier tamaño coincide con el conjunto declarado, con adversarios y sin ellos, y un modo de certificar cuántas decisiones futuras se resolverán de forma reproducible (probabilidades de error de panel finito, superficies de sensibilidad y certificados operativos).
¿Por qué ayuda que el grupo de evaluadores sea más grande?
Cuantos más jueces consultes, menor es la probabilidad de que el panel se aparte del lado que prefiere todo el conjunto.
¿Qué hace que una decisión sea más fácil de resolver?
Cuanto mayor es el acuerdo dentro del conjunto, menos jueces hacen falta para un resultado estable.
¿Una decisión reproducible es necesariamente verdadera?
No. Significa que los paneles elegidos al azar tienden a coincidir con el conjunto declarado. La verdad es una cuestión aparte, y empírica.
¿Qué ocurre si algunos evaluadores son adversarios?
El paper calcula el error exacto en el peor caso cuando una proporción conocida del conjunto está corrompida antes de sortear el panel. La tolerancia se mide, no se supone.
02EQUIVALENCIA
¿Quién decide cuándo dos respuestas de IA son la misma respuesta?
Lo decide el contrato. Cada llamada declara qué cuenta como «la misma respuesta», y los validadores juzgan la propuesta del líder bajo esa regla declarada: el Principio de Equivalencia.
¿De dónde sale un voto? Hazle dos veces la misma pregunta a una IA y las palabras que vuelven no son las mismas. Una blockchain clásica interpreta cualquier diferencia como un fallo y rechaza trabajo honesto.
La solución es el Principio de Equivalencia: cada llamada del contrato declara qué cuenta como «la misma respuesta». El líder hace el trabajo y propone; los demás repiten la tarea y juzgan con esa regla. Decláralo bien y los votos llevan juicio dentro. Decláralo mal y se vuelven unánimes pero vacíos, o rechazan todo lo honesto.
Cambia el criterio y observa cómo cambia el voto.
1 EL CONTRATO DECLARA QUÉ CUENTA COMO LA MISMA RESPUESTA
llm_call( task = "¿Cumple el informe entregado con el encargo?", equivalence = "el mismo veredicto que tu propia reejecución", )
# o declara: · ·
2 EL LÍDER LO EJECUTA Y PROPONE
«Cumple el encargo: precios y competidores están bien tratados; la parte regulatoria es escueta, pero está.»
3 CINCO VALIDADORES LO REEJECUTAN Y VOTAN SOBRE LA RESPUESTA DEL LÍDER
Lo que especifica el whitepaper, exactamente
En cada llamada, el contrato declara el criterio con el que cada validador juzga si la respuesta del líder es aceptable; cuando el criterio lo pide, la compara con su propia reejecución.
¿Es sintaxis real?
No, es ilustrativa. Los contratos reales de GenVM son clases de Python que se ejecutan aisladas, pero el mecanismo —un criterio declarado por llamada para cada operación de IA— es exactamente el que especifica el whitepaper.
¿Por qué dos validadores rechazan una respuesta honesta?
Sus propias reejecuciones llegan honestamente al veredicto contrario. Eso es discrepancia, no trampa: nunca se castiga, y la estadística de Fiabilidad está pensada para absorberla.
¿Quién elige el criterio?
El desarrollador del contrato, en cada llamada. Distintas llamadas de un mismo contrato pueden declarar criterios distintos.
¿Por qué no exigir sin más que todos los validadores obtengan exactamente el mismo resultado?
En las llamadas a una IA y en las lecturas de la web no hay un único resultado correcto: dos resúmenes correctos difieren en las palabras. El código determinista se sigue comprobando byte a byte.
03ADAPTACIÓN
¿Para qué preguntar a mil evaluadores cuando bastan un par de decenas?
Comprar exactamente la evaluación que justifica lo que hay en juego. En cada paso —parar, volver a evaluar o regenerar— la mejor jugada es la de menor pérdida total esperada, y el paper la calcula.
Cada evaluación es trabajo remunerado. Un reembolso de 200 $ no merece un panel de 1.537 jueces; un movimiento de tesorería de 20.000 $ quizá sí.
En cada paso el sistema puede parar, pagar más jueces para la misma respuesta (volver a evaluar) o pagar una respuesta nueva (regenerar). La mejor jugada minimiza la pérdida total esperada: lo que cuestan los jueces más el coste medio de equivocarse. El paper calcula el ideal de referencia; si las apelaciones reales lo siguen o no es la pregunta de Incentivos, más abajo.
¿Cuántos evaluadores conviene pagar para esta decisión?
Hay 2.000 $ en juego en una pregunta en la que el 80% está de acuerdo. Cada juez cuesta 10 centavos. ¿Dónde sale más barato parar?
23 jueces: unos 3,50 $ en total. Parar en 11 deja 23 $ de pérdida esperada; llegar a 767 cuesta 76,70 $ en honorarios para no eliminar nada.
Cada evaluador cobra 10 ¢. Los paneles siguen los tamaños de ronda del protocolo, de 5 hasta 1.537.
Total = tarifas + riesgo en cada ronda. Detente donde la línea negra alcanza su mínimo.
Lo que demuestra el paper, exactamente
Una regla precisa para saber qué jugada tiene la menor pérdida esperada, certificados que siguen siendo válidos aunque la respuesta cambie, y una demostración de que la escalera de escalado de GenLayer hace menos de seis veces el trabajo de una elección perfectamente informada (el planificador G-AE-ADS, una planificación seis-competitiva).
¿Por qué puede el sistema empezar con pocos evaluadores?
La mayoría de las decisiones se resuelven barato. Añade jueces solo cuando el beneficio supere al coste.
¿Cuándo merece la pena evaluar más?
Cuando hay bastante en juego, o la evidencia es lo bastante débil, como para pagar otra mirada.
¿Por qué distinguir entre volver a evaluar esta respuesta y generar otra?
Compran cosas distintas: volver a comprobar añade evidencia sobre la misma respuesta; regenerar cambia la respuesta misma. El paper pone precio a cada opción antes de gastar.
¿La red en producción sigue realmente esta regla ideal?
Aquí no se demuestra. La regla es un ideal de referencia; la red solo lo alcanza si a alguien le compensa en privado presentar la apelación adecuada. Eso es justamente lo que estudia Incentivos.
04TOKENOMICS
¿Qué impide que un solo participante levante nodos suficientes para tomar el control?
Los votos son capital bloqueado, no ordenadores. Hacerse con el control exige comprar —y poner en riesgo— una parte enorme del GEN, un token que nadie puede emitir a voluntad.
Hasta aquí dimos por supuesto que los votos son difíciles de comprar. Pero los ordenadores son baratos: una sola persona puede levantar mil nodos.
Por eso los votos pertenecen a GEN bloqueado, un token que nadie puede emitir a voluntad. Un validador bloquea al menos 42.000 GEN que puede perder (stake); cualquier otra persona puede asignar GEN a un validador en quien confíe (delegación). Hacerse con el control exige comprar una parte enorme de todo el GEN y dejarla donde la red pueda quemarla (slashing).
Mira al mismo atacante intentar hacerse con el control en dos mundos distintos.
generando votantes falsos, cada uno por unos 0 $…
PROPORCIÓN DE TODO EL GEN QUE EL ATACANTE HA TENIDO QUE COMPRAR
mismo ataque aquí: comprar y bloquear el 0% de todo el GEN. Si hace trampas, ese stake se quema (slashing).
De las tablas fijadas en el paper: mínimo de 42.000 GEN por validador, mínimo de 42 GEN por delegación, desbloqueo de 7 épocas y hasta un 5% de penalización por fraude.
Lo que especifica el paper, exactamente
El motor económico que sostiene el tribunal: una emisión inicial fija de 4.200 millones de GEN, una emisión que baja del 9% hacia el 4% (un techo, no una promesa), recompensas a partir de comisiones y emisión, reglas de staking y penalizaciones que nunca castigan la discrepancia honesta, solo la mala conducta demostrable.
¿De dónde sale el dinero que paga a los validadores?
Dos flujos: las comisiones de transacción y una emisión que baja del 9% hacia el 4% siguiendo una curva fija (un techo; las quemas solo pueden rebajarlo). La DAO se financia solo con comisiones, así que sus ingresos siguen el uso real.
¿Por qué acaba sancionado un validador?
El error honesto y la mala conducta tienen precios distintos. Perder una votación solo quema cantidades del tamaño de una comisión, nunca el principal. La inactividad penaliza un 1%, el fraude demostrable penaliza al líder un 5%, y una apelación fallida pierde su fianza. La discrepancia se absorbe; la mala conducta se castiga.
¿La ponderación por raíz cuadrada detiene por sí sola los ataques Sybil?
No, y el paper lo dice. El peso cóncavo solo amortigua la concentración; lo que impide fragmentarse es que cada identidad tiene que bloquear los 42.000 GEN completos, mantener su propio nodo y exponerse a su propia penalización.
¿Puedo ganar recompensas sin operar un validador?
Sí. Delega 42 GEN o más y las recompensas se recomponen solas. No hay comisiones que comparar: el protocolo fija el reparto, y cada GEN en la posición de un validador rinde lo mismo.
05INCENTIVOS
¿Quién paga por impugnar una decisión errónea?
Aquel para quien la recompensa lo haga racional. El premio por apelar tiene una ventana segura estrecha: lo bastante grande para que las dudas informadas actúen y lo bastante pequeño para que el spam a ciegas siga perdiendo dinero.
¿Recuerdas la votación de 3 a 2? Las decisiones que quedan así de ajustadas merecen una segunda mirada. Pero quien impugna tiene que bloquear dinero (una fianza) y arriesgarse a perderlo. ¿Por qué iba a dar el paso?
El paper separa dos cosas que suenan igual: cuándo el sistema necesita otro panel y cuándo a una persona concreta le sale a cuenta provocarlo. Divergen en ambos sentidos: apelaciones que nadie presenta (y nadie paga) y apelaciones inútiles (alguien paga sin necesidad). La recompensa es la palanca: si es pequeña, las dudas se callan; si es grande, impugnar a ciegas se convierte en negocio.
El pago decide qué dudas merecen convertirse en apelación.
Lo que demuestra el paper, exactamente
Un precio exacto para la distancia entre la regla de parada ideal y el comportamiento real de las apelaciones (regret de implementación), una demostración de que ninguna combinación fija de fianza y recompensa sirve para toda carga de trabajo, y las condiciones bajo las cuales una recompensa bien calibrada cierra esa distancia.
¿Qué lleva a alguien a apelar?
Sus probabilidades de ganar, la recompensa, la fianza en riesgo, lo que cuesta apelar y cualquier interés privado en el resultado.
¿Se pueden diseñar incentivos para que las apelaciones útiles lleguen a presentarse?
Bajo ciertas condiciones, sí. El paper muestra cómo calibrar las recompensas para que el interés privado siga de cerca los casos en que al sistema le conviene otro panel.
¿Por qué importa que varias personas puedan apelar?
En cuanto muchas personas pueden apelar, sus decisiones interactúan: esperar, competir por llegar primero, duplicar esfuerzo. El mecanismo tiene que poner precio a las tres cosas.
¿Por qué no subir la fianza sin más para frenar las apelaciones frívolas?
Una fianza mayor financia el panel y disuade el spam, pero inmoviliza capital: las cuentas del beneficio pueden seguir siendo idénticas mientras el grupo de personas que puede permitirse apelar se reduce drásticamente.
06VERIFICACIÓN FORMAL
¿Se comporta realmente el protocolo según su diseño?
Se reverifica con cada cambio. Un modelo de Optimistic Democracy verificado por máquina se contrasta con los contratos desplegados a medida que evolucionan, y ya ha cazado errores reales.
Todo lo anterior son matemáticas sobre un diseño; la red, en cambio, ejecuta código que cambia cada semana. Por eso hay un modelo de Optimistic Democracy verificado por máquina (model checking en TLA+) que se vuelve a comprobar contra los contratos a medida que evolucionan.
¿Qué cubre exactamente la verificación?
Un modelo por capas: un grafo de estados canónico, especificaciones TLA+ comprobadas contra él y una correspondencia entre cada transición y el código Solidity de una revisión fijada.
¿Demuestra esto que el código no tiene errores?
No. Demuestra propiedades declaradas sobre un modelo declarado de una revisión fijada. Precisamente ese acotamiento es lo que hace que las afirmaciones se puedan comprobar.
¿Por qué volver a verificar en lugar de demostrar una sola vez?
El protocolo sigue evolucionando. Cada revisión se vuelve a comprobar contra las mismas propiedades, así que una desviación silenciosa aparece como una comprobación fallida y no como una incidencia en producción.
¿Ha cazado algo real este banco de pruebas?
Sí: la condición de carrera y los tres invariantes rotos que se mencionan arriba. Todos confirmados en la implementación y comunicados al equipo.
LA INVESTIGACIÓN PRINCIPAL
Seis preguntas. Cinco papers.
Medir el panel, poner precio al escalado, financiar el tribunal, alinear las apelaciones y verificar el código.
FIABILIDADAggregate Disambiguation SystemsCómo influye el número de evaluadores en la fiabilidad
ADAPTACIÓNAdaptive Economic DisambiguationDisponible próximamente
TOKENOMICSGEN TokenomicsDisponible próximamente
INCENTIVOSMulti-Agent Appeal GamesDisponible próximamente
VERIFICACIÓN FORMALLayered Formal VerificationDisponible próximamente
Cada término, una vez