·
Flomb
Participantes · LEIAFelipe Pacheco Zamorano
Modelo de aprendizaje neuronal basado en el de
Un agente aprende qué casillas abrir y cuáles marcar a partir de pistas cercanas. Usa un modelo del , un circuito asociado al aprendizaje y la memoria en , y aprende del resultado de sus acciones.
- Fecha del proyecto
- Modelo utilizado
- → ·
01Qué recibe el agente
El objetivo es abrir las casillas seguras sin pisar una mina. Para valorar una casilla tapada, el agente observa sus pistas vecinas abiertas. Cada pista se convierte en tres valores: N, el número de la pista; k, cuántas casillas tapadas la rodean; y m, cuántas de esas casillas marcó el propio agente.
Las ubicaciones de las minas permanecen ocultas. Una bandera es una predicción del agente, no una mina confirmada.
Hay una mina entre las casillas vecinas de esta pista.
02Cómo transforma las pistas en una decisión
N, k y m se codifican como señales sensoriales artificiales. El cableado procedente de mezcla esas señales en las ; la mantiene activo un subconjunto. Las neuronas de salida, llamadas , convierten ese patrón en un valor de acercamiento o evitación ().
- N, k, mPista y estado local
- Señales →
- Mezcla de señales
- Lectura de acercamiento / evitación
- ValorPromedio entre las pistas vecinas
Abrir una casilla
Se promedian los valores de sus pistas vecinas. Entre las casillas disponibles, el agente abre la de mayor valor. Si no hay pistas vecinas, asigna valor 0.
Poner una bandera
Si el menos favorable cruza una compuerta aprendida, el agente marca la casilla. La nueva marca cambia m y puede provocar otras marcas antes de abrir una casilla.
Qué aprende. El resultado de abrir una casilla proporciona refuerzo o castigo. El entrenamiento modifica asociaciones → , el contexto y la . El cableado base y la permanecen fijos. La demo usa los ya entrenados.
03
Se compararon tres variantes del mismo circuito y una programada a mano. Cada variante se entrenó durante 20,000 partidas por , en diez (10–19) y se evaluó, con , en los mismos . Una derrota termina al pisar una mina; el inicio tiene una apertura segura en cascada.
| Método | 7 × 7 · 7 minas250 tableros / | 9 × 9 · 12 minas500 tableros / | 16 × 16 · 40 minas150 tableros / |
|---|---|---|---|
Suma sum-cap | 84.3% [82.9–85.7] | 76.3% [74.7–77.8] | 44.3% [38.7–49.8] |
Media mean-cap | 87.4% [86.5–88.4] | 81.3% [80.0–82.7] | 51.8% [47.8–55.8] |
Cada · demo | 88.3% [85.7–91.0] | 81.3% [78.8–83.8] | 57.3% [52.1–62.5] |
| 91.2% | 84.8% | 61.3% |
Qué cambia. Suma combina las señales sin ; Media las promedia. Cada aprende por separado y después se promedian sus opiniones. Las tres variantes usan una aprendida con el mismo tope. La estima riesgo a partir de las pistas y aplica reglas de apertura y marcado.
Diferencia , calculada antes de redondear las medias: [1.5–8.7]. El método de la demo queda 3.5 puntos por debajo de la . No se observa una diferencia clara frente a Media: de la diferencia [−2.7–2.6].
En se registraron cero banderas falsas en los 9,000 de esta evaluación. Es un resultado de este conjunto, no una garantía para cualquier partida. En 16 × 16 se mide a un tamaño que no se usó para entrenar.
Comprobación de la demo web. La 10 gana 145/200 partidas nuevas (72.5%) en otro conjunto 9 × 9. Esa comprobación valida la integración y no sustituye el benchmark de diez .
04Alcance
El agente aprende asociaciones locales; una bandera no es una demostración lógica. La demo y el panel neuronal usan el . La mosquita caminando representa las acciones elegidas; el control de las patas no forma parte del aprendizaje.