Búsqueda y aprendizaje ·
Glaubermon Max
glaubermon-maxParticipantes · LEIASantiago Saldaña Subías · Felipe Pacheco Zamorano
Modelo de decisión para basado en , y evaluación híbrida neuronal y .
Dos jugadores eligen sin conocer la acción del otro. Glaubermon estima qué puede ocurrir al atacar, cambiar de Pokémon o usar ; compara esas posibilidades mediante búsqueda y combina una red aprendida con conocimiento competitivo. El estudio pregunta cuánto aporta la red y cómo afectan las reglas, la información oculta y el tiempo disponible a la decisión.
- Fecha del proyecto
- Modelo utilizado
- Red de +
01Qué sabe el jugador
La entrada es un estado estructurado del combate, construido a partir de la información propia y los sucesos públicos de . Incluye vida, tipos, movimientos, , estadísticas, estados y cambios de características; también clima, terreno, y . La imagen del combate ayuda a seguir la partida; la red recibe variables numéricas.
El agente conoce su equipo. Del rival conserva lo que se revela y completa los datos desconocidos con . Por ejemplo, ver que un Pokémon usa un movimiento confirma esa opción; los movimientos aún no usados siguen siendo estimaciones. Esta reconstrucción puede equivocarse, en particular ante equipos poco comunes.
Información permitida
Equipo propio, menú legal, públicos, movimientos usados, objetos o habilidades revelados y sucesos del campo.
Información estimada
Movimientos sin revelar, estadísticas exactas, objeto o habilidad aún ocultos y tipo Tera futuro del rival.
El diseño inicial propuso un para mantener varias hipótesis. La ruta de decisión estudiada utiliza principalmente estimaciones puntuales del y revelaciones públicas. Por ello no se presenta como una completa del equipo rival.
02Elegir frente a una acción desconocida
El menú permite usar movimientos, cambiar a un compañero disponible y combinar un movimiento con . La tiene 14 posiciones: cuatro movimientos, sus cuatro variantes Tera y seis posiciones del equipo para cambios. El estado legal excluye opciones como cambiar al Pokémon activo, entrar con uno debilitado o usar Tera cuando ya se gastó. Un reemplazo obligatorio constituye una fase propia.
En cada turno se construye una tabla: cada fila es una acción propia y cada columna una posible respuesta rival. Una celda simula ambas elecciones, ordena su ejecución por prioridad y velocidad y estima el estado resultante. El valor combina la , consecuencias como un y ajustes tácticos definidos por el equipo.
| Acción propia ↓ / rival → | El rival ataca | El rival cambia |
|---|---|---|
| Atacar | Resolver prioridad, daño y supervivencia | Valorar el ataque contra el Pokémon entrante |
| Cambiar | Aplicar efectos de entrada y recibir el ataque | Valorar el nuevo enfrentamiento y las entradas |
La continúa algunas ramas y resuelve matrices hijas. La selección de candidatos limita la exploración: no recorre exhaustivamente todos los futuros. Los reemplazos tras KO y los ataques pendientes tras un se resuelven respetando su orden; pueden multiplicar el cálculo aun con la misma profundidad.
Un solver de calcula una solución de tipo , con pequeñas preferencias para desempatar. Su es una distribución, pero el cliente de juego y de evaluación selecciona la acción de mayor probabilidad. El autojuego oficial muestrea en las decisiones normales. Esa diferencia importa: calcular una mezcla no garantiza ejecutarla ni hace al bot imposible de explotar.
V(s) = 0.60 · Vred(s) + 0.40 · Vreglas(s)
Combina el valor aprendido por la red y la evaluación fija. La política neuronal también aporta preferencias al solver de la matriz.
- EstadoObservación e hipótesis
- SimulaciónCombinaciones y continuaciones
- EvaluaciónHíbrido
- MatrizDistribución y acción elegida
03Una red que relaciona equipos
La configuración grande, posterior al modelo inicial de imitación, codifica los movimientos de cada Pokémon y promedia sus representaciones. Une ese resumen con sus estadísticas para formar un de 256 valores. Tres bloques de relacionan los miembros de cada equipo; la relaciona después ambos equipos. Cada bloque utiliza ocho .
El resumen de cada equipo se obtiene por . Ambos resúmenes y las condiciones del campo se fusionan y alimentan dos salidas: un valor entre −1 y +1 y las preferencias de acciones. El valor estima ventaja; no se interpreta como una .
La representación actual contiene 33 características por movimiento, 86 por Pokémon y 40 del campo. Los pesos históricos se entrenaron con un contrato menor; las entradas añadidas se adaptan con pesos iniciales cero. Una señal nueva disponible en la observación necesita entrenamiento para que la red aprenda a usarla.
Promediar tokens hace que el resumen del equipo sea . Sin embargo, la política usa posiciones de acciones fijas y también se promedian los movimientos: esa invariancia del resumen no demuestra que las preferencias estén correctamente alineadas al reordenar movimientos o compañeros. La evaluación usa los órdenes fijados en sus equipos.
04Qué se aprende y de dónde salen las etiquetas
El trabajo del equipo comienza con : reconstruir posiciones y ajustar la política a las acciones registradas, mientras la cabeza de valor aprende del resultado. Los scripts incluyen de Showdown y un corpus público en filtrado por . Una buena predicción de esas acciones no garantiza jugar mejor; los registros públicos además dejan datos ocultos que el parser debe estimar.
La segunda vía es . La búsqueda produce una distribución objetivo para la política; una victoria, derrota o empate terminal produce la etiqueta de valor. Los ejemplos de ambos jugadores se acumulan en un y se usan para ajustar la red. La combinación está inspirada en y ; la implementación no reproduce todas sus condiciones teóricas.
Pérdida de autojuego = error del valor terminal + con la política de búsqueda.
La ruta oficial utiliza Showdown para resolver las partidas y el mismo lector de información permitida que utiliza el cliente. Si se alcanza el límite de turnos sin un resultado, esos ejemplos pueden enseñar la política de búsqueda, pero no se les inventa una etiqueta de victoria ni se actualiza con ellos la pérdida de valor.
Esto corrige dos sesgos de la primera ruta interna: aprender con información del rival que no estaba disponible al jugar y tratar una evaluación heurística al cortar la partida como si fuera su resultado real. La búsqueda conserva un simulador propio aproximado, por lo que usar un árbitro oficial para generar etiquetas tampoco elimina todos los errores de decisión.
Durante las evaluaciones los . La partida actualiza lo que el jugador sabe del rival, pero no los parámetros de la red.
05Cómo evolucionó el proyecto
- Desarrollo inicial del equipo · antes de la evaluación oficial
Imitar partidas y buscar respuestas simultáneas
El proyecto del equipo reúne replays, preentrenamiento supervisado, una red de conjuntos y variantes de autojuego denominadas AlphaZero y ReBeL. Las partidas con jugadores mostraron ciclos de cambios, mal uso de Tera y decisiones tácticas deficientes; el equipo introdujo reglas estratégicas y selección de ramas.
- Septiembre de 2026 · contraste del método
Distinguir el modelo de las reglas
Se separaron los evaluadores neuronal, heurístico e híbrido y se incorporó el valor neuronal a la decisión del cliente. El primer piloto oficial comparó el híbrido con una que conservaba la búsqueda y retiraba la red.
- Septiembre de 2026 · entorno y observación
Aprender del resultado que ve cada jugador
El autojuego pasó a consecuencias arbitradas por Showdown, canales propios de observación y etiquetas terminales. Se contrastaron mecánicas de los equipos de práctica y evaluación: campo, estados temporales, movimientos, habilidades, objetos y reemplazos.
- Septiembre de 2026 · candidato y presupuesto de decisión
Medir calidad bajo un reloj
Un candidato continuó el aprendizaje con partidas oficiales. Su evaluación encontró pérdidas por tiempo que impiden aislar la calidad táctica. Agrupar hojas independientes redujo el trabajo de sin eliminar sus alternativas; el rendimiento bajo reloj sigue siendo parte de la comparación necesaria.
06Resultados y qué permiten concluir
La mejora neuronal aún no está demostrada
En el piloto oficial, el híbrido ganó 73/100 partidas y la búsqueda heurística 79/100, ambos frente al mismo control. La diferencia estimada es −6 , con intervalo del 95% de −16 a +4. El intervalo incluye cero: este banco no establece una ventaja del neuronal.
Una evaluación posterior del candidato sufrió . Los contrastes de mecánicas y las mediciones de rapidez responden preguntas distintas y no se convierten en una tasa general de éxito del proyecto.
Piloto de calidad de juego · 11 de septiembre de 2026
El rival fue SimpleHeuristicsPlayer de poke-env, un jugador de reglas. Es distinto del evaluador heurístico de Glaubermon: ambos modos de Glaubermon mantienen su propio buscador. Se jugaron 200 partidas en Showdown 0.11.11, Gen 9 OU, con profundidad 2, pesos históricos congelados y tres equipos legales: y pelol.
| Evaluador de Glaubermon | Victorias | Derrotas | de la proporción |
|---|---|---|---|
| Híbrido | 73/100 | 27/100 | 65%–81% |
| Heurístico | 79/100 | 21/100 | 70%–87% |
Se formaron 50 bloques de dos partidas por modo. Cada bloque conserva y emparejamiento e intercambia lados y equipos. El bootstrap remuestrea bloques completos con 20,000 réplicas. La incertidumbre describe ese pequeño pool y esas semillas; no incluye varios entrenamientos independientes. Los pesos históricos podrían haber visto esos equipos durante su entrenamiento.
El equipo hyper offense propuesto se excluyó antes de congelar el piloto porque incluía un Pokémon rechazado por el validador OU de esa versión. El estudio no mide toda la ni equipos desconocidos. Además, este piloto precede a las ampliaciones posteriores de observación y mecánicas: sus cifras no se atribuyen automáticamente al código más reciente.
Tiempo de cálculo en el mismo piloto
| Modo | Decisiones | Máximo | ||
|---|---|---|---|---|
| Híbrido | 4,061 | 1.025 s | 1.599 s | 3.918 s |
| Heurístico | 3,957 | 0.184 s | 0.361 s | 0.829 s |
El híbrido ejecutó 185,491 llamadas a la red; el modo heurístico, ninguna. Ambos registraron cero acciones inválidas y cero elecciones automáticas de emergencia. Estos controles documentan el cálculo usado en ese banco, pero no convierten el mayor coste neuronal en una mejora competitiva.
Candidato oficial y evaluación con reloj · 14 de septiembre
El candidato recibió 100 partidas oficiales de entrenamiento, con 2,341 turnos y 5,613 ejemplos, en . Se entrenó con profundidad 1 y límite de 60 s por decisión; la evaluación utilizó profundidad 2 y límite de 30 s. El presupuesto de decisión era por tanto diferente.
| Configuración | Victorias registradas | Partidas completadas | |
|---|---|---|---|
| Híbrido · original | 14/100 | 19/100 | 81/100 |
| Híbrido · candidato | 1/100 | 1/100 | 99/100 |
| HeurísticoMismo resultado en las dos evaluaciones | 71/100 | 100/100 | 0/100 |
El candidato falla por tiempo en casi todas las partidas bajo ese límite. Es un resultado desfavorable de rendimiento con reloj, pero no permite separar la calidad de sus decisiones del coste de obtenerlas. Tomar solo las partidas terminadas excluiría muchas derrotas y sesgaría la comparación. Tampoco sería válido convertir esos resultados en un o afirmar que la red aprendió peor.
Presupuesto histórico de aprendizaje y controles de mecánicas
Los contadores de entrenamiento no son victorias
Los metadatos históricos de ReBeL registran 45,075 partidas simuladas y 1,172,760 turnos; los de AlphaZero, 15,423 partidas y 405,707 turnos. Son contadores de dos registros de aprendizaje. No se suman como muestras independientes ni se presentan como partidas oficiales ganadas.
Contrastar reglas tiene un alcance concreto
La auditoría inicial reunió 320 de cinco escenarios con 64 semillas cada uno. Por ejemplo, Stone Edge falló 13/64 veces en Showdown y 0/64 en la transición interna original; un empate de velocidad terminó 26/38 para en Showdown y 64/0 localmente. Eran diferencias del entorno que podía alimentar el aprendizaje, no tasas de victoria competitiva.
Las correcciones posteriores contrastaron un inventario acotado de 57 movimientos, 16 habilidades y 13 objetos de cinco equipos. Cinco coincidieron de principio a fin: 292 fases y 248 turnos, con resultados aleatorios acoplados. Esa muestra verifica su alcance; no certifica todas las reglas, interacciones o equipos de Pokémon.
Qué mostró la agrupación de hojas de búsqueda
Al reunir hojas independientes en , dos decisiones problemáticas redujeron sus llamadas a la red de 3,312 a 226 y de 1,905 a 269, conservando las decisiones contrastadas. Se mantuvieron las alternativas de reemplazo: el tamaño de lote limita memoria, no la cantidad de elecciones consideradas.
Una comprobación posterior en CPU/macOS completó ocho partidas con el original y el candidato, a profundidad 2 y límite de 30 s, sin , acciones inválidas ni elecciones de emergencia. El máximo observado fue 9.61 s con el original y 6.67 s con el candidato; 702 solicitudes contrastadas no mostraron discrepancias en menús legales y PP. Esta muestra mide cálculo y consistencia, no una mejora del .
Alcance de la evidencia
La comparación competitiva corresponde a tres equipos legales frente a SimpleHeuristicsPlayer, con las semillas y los presupuestos de decisión especificados. Sus conclusiones se limitan a ese banco y a las configuraciones evaluadas. La red, el simulador aproximado, las hipótesis del rival y la selección de ramas contribuyen conjuntamente a esas decisiones.