· control de un auto
Pivot · Rocket League
rocket_league_ppoParticipantes · LEIASantiago Saldaña Subías
Diseño de un modelo de aprendizaje por refuerzo con y redes de y para el control de vehículos en 1v1.
Pivot es el agente de LEIA para Rocket League. El proyecto define controles a partir del estado físico del juego. Dos redes, una y un , se entrenan con . La pregunta central es cómo combinar el objetivo de marcar con señales frecuentes que orienten el aprendizaje antes de conseguir un gol.
- Fecha del proyecto
- Modelo utilizado
- con redes de y · diseño configurado
01Qué observa el agente
transforma el estado del simulador en una . El agente recibe posiciones, orientación y velocidades del balón y de los autos, además de información sobre y salto. Esas variables permiten distinguir, por ejemplo, un balón quieto de otro que se aleja, o un auto en el suelo de uno que ya gastó su salto.
El constructor elegido es DefaultObs, sin relleno para equipos más grandes. Organiza primero la información global y después la del auto propio y sus rivales. Para el equipo naranja invierte las coordenadas a una : una estrategia puede aprender a atacar hacia el mismo lado en su representación interna.
La escala las posiciones por las dimensiones del campo, la velocidad lineal por el máximo del auto y la por su máximo. El boost se multiplica por 1/100. Esto fija la representación de entrada; los que relacionan esas variables con decisiones sí se aprenden.
- BalónPosición y velocidades
- Campo y saltoBoost disponible · estados del salto
- Dos autosFísica, orientación y estados
- Una perspectivaCoordenadas invertidas y escaladas
02De una elección a los controles del auto
La red selecciona un índice de una . Cada entrada combina aceleración, dirección, rotación aérea y botones. La tabla estándar LookupTableAction define 90 combinaciones útiles de suelo y aire; descarta combinaciones redundantes del espacio de controles.
El intérprete traduce ese índice a ocho valores: acelerador, dirección, , salto, y freno de mano. RepeatAction mantiene la combinación durante ocho de física. Con 120 ticks por segundo simulado, el intervalo equivale a unos 66.7 ms y 15 decisiones por segundo.
- PolíticaProbabilidades de controles
- ÍndiceUna entrada del catálogo
- 8 controlesMovimiento y botones
- 8 ticksAvanza la física y vuelve a observar
03Una política y un crítico
El diseño configura dos independientes con capas ocultas de 2048 → 2048 → 1024 → 1024 unidades. La política convierte la observación en una distribución de probabilidades sobre las acciones. El crítico estima un único valor: el futuro esperado desde ese estado.
En la implementación RLGym-PPO, las capas ocultas usan . La salida de la política aplica para obtener probabilidades y durante el entrenamiento. El crítico aprende a predecir el retorno y ayuda a decidir si una experiencia fue mejor o peor de lo esperado. Su estimación no expresa una probabilidad de marcar.
04Qué se aprende con PPO
El entrenamiento alterna reunir experiencias y actualizar las redes. Un conjunto de entornos produce observaciones, acciones y recompensas. El crítico estima cuánto retorno cabe esperar; la compara esa expectativa con lo que siguió a la decisión. PPO aumenta la probabilidad de decisiones con ventaja positiva y reduce la de las negativas.
El limita el incentivo a que una actualización cambie demasiado la probabilidad respecto de la política que reunió la experiencia. Un término de favorece la exploración. Aprender implica cambiar los pesos de las redes; las reglas físicas, observaciones, catálogo de acciones y funciones de recompensa se mantienen definidas por el experimento.
- 32 entornosExperiencia en paralelo
- 100 000 pasosObjetivo de recolección por iteración
- PPO ·
- Nuevos pesosPolítica y crítico actualizados
Cuatro señales, un retorno
El aporta señales frecuentes además del gol. Cada término se multiplica por su peso; su contribución total depende de su magnitud y de cuántos pasos está activo. Por eso comparar solamente los coeficientes no permite saber cuál dominó una partida.
| Señal | Qué premia | Qué no exige | |
|---|---|---|---|
| Estar en el aire | 0.002 | 1 cuando el auto no está en el suelo; 0 en el suelo. | Controlar bien el vuelo o tocar el balón. |
| Ir hacia el balón | 0.01 | de la velocidad del auto hacia el balón, dividida por la velocidad máxima del auto. | Contacto con el balón; moverse en sentido contrario se recorta a 0. |
| Balón hacia portería | 0.1 | Proyección positiva de la velocidad del balón hacia la portería rival, dividida por la velocidad máxima del balón. | Que ese jugador haya dado el último toque. |
| Gol | 10.0 | GoalReward: +1 si marca el equipo propio, −1 si marca el rival y 0 sin gol. | Una partida completa: el episodio acaba con ese gol. |
La velocidad tiene una componente positiva hacia el balón. La señal normalizada es 0.5; su contribución con el peso 0.01 es 0.005.
avance = max(0.5, 0) = 0.5
Qué delimita cada episodio
Un comienza en un saque inicial con un auto por equipo. Termina cuando cualquiera marca. Se tras 30 segundos sin toque del balón o 300 segundos totales de simulación. Esa duración cambia la suma de las señales intermedias: una recompensa media alta puede reflejar más tiempo acumulando shaping y no más goles.
05Origen del estudio
- Diciembre de 2025
Control físico con señales intermedias
La primera versión documentada del equipo define el entorno 1v1 sobre RLGym y RocketSim, las dos redes PPO y la combinación de cuatro recompensas. El enfoque parte del estado físico del simulador y de un catálogo de controles, en lugar de aprender a extraer información de imágenes.
La configuración sigue la guía de entrenamiento de RLGym.
06Alcance científico
El diseño permite estudiar cómo señales frecuentes orientan una política hacia una tarea de . Sus sesgos son concretos: premiar estar en el aire puede incentivar saltar sin ayudar al ataque; premiar acercarse puede favorecer perseguir el balón sin anticiparlo; premiar su dirección no asigna mérito al último toque. Un alto debe contrastarse con goles, defensa y resultados frente a rivales.
La grabación principal enfrenta dos instancias de Pivot. Este autojuego permite observar acciones del agente frente a sí mismo. La comparación con Nexto muestra una dificultad defensiva ante un rival distinto: Pivot no intercepta el remate que aparece en el clip. Son jugadas seleccionadas, con repeticiones de algunos goles; no permiten estimar una tasa de victorias ni el desempeño medio.
RocketSim aproxima el juego y sus diferencias pueden acumularse. El formato 1v1 tampoco evalúa coordinación con compañeros. La escena del estadio en la web es una presentación animada; sus vuelos y goles no son acciones de una política entrenada ni mediciones de este estudio.
Las descripciones de DefaultObs, la tabla de 90 acciones y las capas de RLGym-PPO se apoyan en sus implementaciones de referencia, mientras que los tamaños de red, los ocho ticks y las cuatro recompensas están definidos por el código del proyecto.