LEIAMoscas

Flomb

Buscaminas · pistas N, k y m.

Buscaminas
Ayuda
012000
Preparando agente y tablero0 decisiones
Cerebro · cuerpo pedunculado
↑ Demo

·

Flomb

Participantes · LEIAFelipe Pacheco Zamorano

Modelo de aprendizaje neuronal basado en el de

Un agente aprende qué casillas abrir y cuáles marcar a partir de pistas cercanas. Usa un modelo del , un circuito asociado al aprendizaje y la memoria en , y aprende del resultado de sus acciones.

Fecha del proyecto
Modelo utilizado
→ ·

01Qué recibe el agente

El objetivo es abrir las casillas seguras sin pisar una mina. Para valorar una casilla tapada, el agente observa sus pistas vecinas abiertas. Cada pista se convierte en tres valores: N, el número de la pista; k, cuántas casillas tapadas la rodean; y m, cuántas de esas casillas marcó el propio agente.

Las ubicaciones de las minas permanecen ocultas. Una bandera es una predicción del agente, no una mina confirmada.

FIGURA 1 / UNA PISTA VECINA
?1⚑011000

Hay una mina entre las casillas vecinas de esta pista.

Valor aprendido de este : +0.059
La terna (1, 2, 1) corresponde a una pista, no al tablero entero. k incluye las casillas marcadas, porque todavía están tapadas. El valor es una preferencia aprendida; no una probabilidad de que la casilla sea segura.

02Cómo transforma las pistas en una decisión

N, k y m se codifican como señales sensoriales artificiales. El cableado procedente de mezcla esas señales en las ; la mantiene activo un subconjunto. Las neuronas de salida, llamadas , convierten ese patrón en un valor de acercamiento o evitación ().

FIGURA 2 / DEL AL VALOR
  1. N, k, mPista y estado local
  2. Señales →
  3. Mezcla de señales
  4. Lectura de acercamiento / evitación
  5. ValorPromedio entre las pistas vecinas
El bloque morado contiene parámetros aprendidos: las → se ajustan durante el entrenamiento.
El circuito se evalúa por cada pista vecina. Al combinar varios , la unión de activas puede ser mayor que la de un solo olor.

Abrir una casilla

Se promedian los valores de sus pistas vecinas. Entre las casillas disponibles, el agente abre la de mayor valor. Si no hay pistas vecinas, asigna valor 0.

V(casilla) = promedio de sus

Poner una bandera

Si el menos favorable cruza una compuerta aprendida, el agente marca la casilla. La nueva marca cambia m y puede provocar otras marcas antes de abrir una casilla.

Marcar A→Reevaluar→Abrir B

Qué aprende. El resultado de abrir una casilla proporciona refuerzo o castigo. El entrenamiento modifica asociaciones → , el contexto y la . El cableado base y la permanecen fijos. La demo usa los ya entrenados.

03

Se compararon tres variantes del mismo circuito y una programada a mano. Cada variante se entrenó durante 20,000 partidas por , en diez (10–19) y se evaluó, con , en los mismos . Una derrota termina al pisar una mina; el inicio tiene una apertura segura en cascada.

FIGURA 3 / VICTORIAS EN 9 × 9 · 12 MINASVictorias en 9 por 9: sum-cap 76.3% (IC95 74.7 a 77.8); mean-cap 81.3% (80.0 a 82.7); Flomb 81.3% (78.8 a 83.8); heurística local 84.8%.
Puntos: . Barras: entre las diez de entrenamiento. Cada se prueba en los mismos 500 tableros; no son 5,000 tableros distintos. La es un algoritmo de referencia, no un jugador humano; se ejecutó una vez con desempates fijos.
Comparación por tamaño · victorias, []
Método7 × 7 · 7 minas250 tableros / 9 × 9 · 12 minas500 tableros / 16 × 16 · 40 minas150 tableros /
Suma sum-cap84.3% [82.9–85.7]76.3% [74.7–77.8]44.3% [38.7–49.8]
Media mean-cap87.4% [86.5–88.4]81.3% [80.0–82.7]51.8% [47.8–55.8]
Cada · demo88.3% [85.7–91.0]81.3% [78.8–83.8]57.3% [52.1–62.5]
91.2%84.8%61.3%

Qué cambia. Suma combina las señales sin ; Media las promedia. Cada aprende por separado y después se promedian sus opiniones. Las tres variantes usan una aprendida con el mismo tope. La estima riesgo a partir de las pistas y aplica reglas de apertura y marcado.

+5.1 frente a Suma en 9 × 9

Diferencia , calculada antes de redondear las medias: [1.5–8.7]. El método de la demo queda 3.5 puntos por debajo de la . No se observa una diferencia clara frente a Media: de la diferencia [−2.7–2.6].

En se registraron cero banderas falsas en los 9,000 de esta evaluación. Es un resultado de este conjunto, no una garantía para cualquier partida. En 16 × 16 se mide a un tamaño que no se usó para entrenar.

Comprobación de la demo web. La 10 gana 145/200 partidas nuevas (72.5%) en otro conjunto 9 × 9. Esa comprobación valida la integración y no sustituye el benchmark de diez .

04Alcance

El agente aprende asociaciones locales; una bandera no es una demostración lógica. La demo y el panel neuronal usan el . La mosquita caminando representa las acciones elegidas; el control de las patas no forma parte del aprendizaje.