LEIAPivot
LEIA / APRENDIZAJE POR REFUERZO

Rocket League

Pivot PPO · 1 vs 1

DESPLAZA

PARTIDAS 1 VS 1

Así juega Pivot

Una red neuronal usa posiciones y velocidades del balón y los autos para decidir cuándo acelerar, girar, saltar y usar boost. El entrenamiento premia acercarse al balón, dirigirlo a la portería y marcar.

Ver las jugadas
Escena de presentación

Pivot 1 vs 1

Saques

Reconoce el saque y busca ganar el primer contacto.

Disputa del balón

Con un rival cerca, busca ganar el siguiente toque.

Tiros a portería

Orienta el toque hacia la portería rival.

Recuperación del auto

Vuelve a las ruedas y retoma la jugada.

Contra Nexto

Nexto es un bot comunitario entrenado con aprendizaje por refuerzo.

↑ Demo

· control de un auto

Pivot · Rocket League

rocket_league_ppo

Participantes · LEIASantiago Saldaña Subías

Diseño de un modelo de aprendizaje por refuerzo con y redes de y para el control de vehículos en 1v1.

Pivot es el agente de LEIA para Rocket League. El proyecto define controles a partir del estado físico del juego. Dos redes, una y un , se entrenan con . La pregunta central es cómo combinar el objetivo de marcar con señales frecuentes que orienten el aprendizaje antes de conseguir un gol.

Fecha del proyecto
Modelo utilizado
con redes de y · diseño configurado

01Qué observa el agente

transforma el estado del simulador en una . El agente recibe posiciones, orientación y velocidades del balón y de los autos, además de información sobre y salto. Esas variables permiten distinguir, por ejemplo, un balón quieto de otro que se aleja, o un auto en el suelo de uno que ya gastó su salto.

El constructor elegido es DefaultObs, sin relleno para equipos más grandes. Organiza primero la información global y después la del auto propio y sus rivales. Para el equipo naranja invierte las coordenadas a una : una estrategia puede aprender a atacar hacia el mismo lado en su representación interna.

La escala las posiciones por las dimensiones del campo, la velocidad lineal por el máximo del auto y la por su máximo. El boost se multiplica por 1/100. Esto fija la representación de entrada; los que relacionan esas variables con decisiones sí se aprenden.

FIGURA 1 / ESTADO FÍSICO → OBSERVACIÓN
  1. BalónPosición y velocidades
  2. Campo y saltoBoost disponible · estados del salto
  3. Dos autosFísica, orientación y estados
  4. Una perspectivaCoordenadas invertidas y escaladas
DefaultObs entrega un vector por jugador. En la implementación de referencia de RLGym, el formato 1v1 suma 92 valores: 9 del balón + 34 temporizadores de boost + 9 estados propios de salto + 20 por auto. Esa dimensión corresponde al formato de referencia de DefaultObs.

02De una elección a los controles del auto

La red selecciona un índice de una . Cada entrada combina aceleración, dirección, rotación aérea y botones. La tabla estándar LookupTableAction define 90 combinaciones útiles de suelo y aire; descarta combinaciones redundantes del espacio de controles.

El intérprete traduce ese índice a ocho valores: acelerador, dirección, , salto, y freno de mano. RepeatAction mantiene la combinación durante ocho de física. Con 120 ticks por segundo simulado, el intervalo equivale a unos 66.7 ms y 15 decisiones por segundo.

FIGURA 2 / UNA DECISIÓN EN EL TIEMPO
  1. PolíticaProbabilidades de controles
  2. ÍndiceUna entrada del catálogo
  3. 8 controlesMovimiento y botones
  4. 8 ticksAvanza la física y vuelve a observar
Bloques morados: parámetros que se ajustan durante el entrenamiento.
El catálogo y la repetición permanecen fijos. La política aprende en qué estado conviene seleccionar cada combinación. El intervalo es tiempo de simulación, no una velocidad de ejecución medida del entrenamiento.

03Una política y un crítico

El diseño configura dos independientes con capas ocultas de 2048 → 2048 → 1024 → 1024 unidades. La política convierte la observación en una distribución de probabilidades sobre las acciones. El crítico estima un único valor: el futuro esperado desde ese estado.

En la implementación RLGym-PPO, las capas ocultas usan . La salida de la política aplica para obtener probabilidades y durante el entrenamiento. El crítico aprende a predecir el retorno y ayuda a decidir si una experiencia fue mejor o peor de lo esperado. Su estimación no expresa una probabilidad de marcar.

FIGURA 3 / DOS REDES, DOS TAREAS
ObservaciónEstado numérico por jugador
Política π2048 → 2048 → 1024 → 1024
Crítico V2048 → 2048 → 1024 → 1024
ProbabilidadesElegir una acción del catálogo
Un valorEstimar recompensa futura
Bloques morados: parámetros que se ajustan durante el entrenamiento.
Ambas redes reciben la misma representación, con pesos propios. La política decide controles; el crítico contribuye al aprendizaje. La arquitectura descrita corresponde al diseño configurado.

04Qué se aprende con PPO

El entrenamiento alterna reunir experiencias y actualizar las redes. Un conjunto de entornos produce observaciones, acciones y recompensas. El crítico estima cuánto retorno cabe esperar; la compara esa expectativa con lo que siguió a la decisión. PPO aumenta la probabilidad de decisiones con ventaja positiva y reduce la de las negativas.

El limita el incentivo a que una actualización cambie demasiado la probabilidad respecto de la política que reunió la experiencia. Un término de favorece la exploración. Aprender implica cambiar los pesos de las redes; las reglas físicas, observaciones, catálogo de acciones y funciones de recompensa se mantienen definidas por el experimento.

FIGURA 4 / CICLO DE APRENDIZAJE
  1. 32 entornosExperiencia en paralelo
  2. 100 000 pasosObjetivo de recolección por iteración
  3. PPO ·
  4. Nuevos pesosPolítica y crítico actualizados
La configuración usa para ambas redes y coeficiente de entropía 0.01. Los tamaños indican el procedimiento planeado.

Cuatro señales, un retorno

El aporta señales frecuentes además del gol. Cada término se multiplica por su peso; su contribución total depende de su magnitud y de cuántos pasos está activo. Por eso comparar solamente los coeficientes no permite saber cuál dominó una partida.

Recompensa por paso definida en el experimento · estos pesos son configuración
SeñalQué premiaQué no exige
Estar en el aire0.0021 cuando el auto no está en el suelo; 0 en el suelo.Controlar bien el vuelo o tocar el balón.
Ir hacia el balón0.01 de la velocidad del auto hacia el balón, dividida por la velocidad máxima del auto.Contacto con el balón; moverse en sentido contrario se recorta a 0.
Balón hacia portería0.1Proyección positiva de la velocidad del balón hacia la portería rival, dividida por la velocidad máxima del balón.Que ese jugador haya dado el último toque.
Gol10.0GoalReward: +1 si marca el equipo propio, −1 si marca el rival y 0 sin gol.Una partida completa: el episodio acaba con ese gol.
r = 0.002 · aire + 0.01 · avance + 0.1 · dirección del balón + 10 · gol
FIGURA 5 / IR RÁPIDO NO SIEMPRE ES ACERCARSE
balónautov · dirección al balón

La velocidad tiene una componente positiva hacia el balón. La señal normalizada es 0.5; su contribución con el peso 0.01 es 0.005.

avance = max(0.5, 0) = 0.5

Ejemplo geométrico de la función SpeedTowardBallReward, con velocidades expresadas como fracción de la velocidad máxima. Las flechas explican el cálculo; no representan una trayectoria registrada del modelo.

Qué delimita cada episodio

Un comienza en un saque inicial con un auto por equipo. Termina cuando cualquiera marca. Se tras 30 segundos sin toque del balón o 300 segundos totales de simulación. Esa duración cambia la suma de las señales intermedias: una recompensa media alta puede reflejar más tiempo acumulando shaping y no más goles.

05Origen del estudio

  1. Diciembre de 2025

    Control físico con señales intermedias

    La primera versión documentada del equipo define el entorno 1v1 sobre RLGym y RocketSim, las dos redes PPO y la combinación de cuatro recompensas. El enfoque parte del estado físico del simulador y de un catálogo de controles, en lugar de aprender a extraer información de imágenes.

    La configuración sigue la guía de entrenamiento de RLGym.

06Alcance científico

El diseño permite estudiar cómo señales frecuentes orientan una política hacia una tarea de . Sus sesgos son concretos: premiar estar en el aire puede incentivar saltar sin ayudar al ataque; premiar acercarse puede favorecer perseguir el balón sin anticiparlo; premiar su dirección no asigna mérito al último toque. Un alto debe contrastarse con goles, defensa y resultados frente a rivales.

La grabación principal enfrenta dos instancias de Pivot. Este autojuego permite observar acciones del agente frente a sí mismo. La comparación con Nexto muestra una dificultad defensiva ante un rival distinto: Pivot no intercepta el remate que aparece en el clip. Son jugadas seleccionadas, con repeticiones de algunos goles; no permiten estimar una tasa de victorias ni el desempeño medio.

RocketSim aproxima el juego y sus diferencias pueden acumularse. El formato 1v1 tampoco evalúa coordinación con compañeros. La escena del estadio en la web es una presentación animada; sus vuelos y goles no son acciones de una política entrenada ni mediciones de este estudio.

Las descripciones de DefaultObs, la tabla de 90 acciones y las capas de RLGym-PPO se apoyan en sus implementaciones de referencia, mientras que los tamaños de red, los ocho ticks y las cuatro recompensas están definidos por el código del proyecto.