Repositorio UTM
Please use this identifier to cite or link to this item: http://repositorio.utm.mx:8080/jspui/handle/123456789/548
Title: Control de estabilidad en la marcha de un robot bípedo mediante ZMP y aprendizaje por refuerzo
Authors: OSCAR DAVID RAMIREZ CARDENAS;502953
JOSÉ ANIBAL ARIAS AGUILAR;44390
Ramírez Cárdenas, Oscar D.
Santiago Vásquez, Miguel de J.
Keywords: Caminata
Aprendizaje reforzado
Bípedo
Robótica
Issue Date: Sep-2026
Publisher: Universidad Tecnológica de la Mixteca
Citation: Santiago , M de J. (2021). Detección de escaleras basado en aprendizaje profundo implementado en un robot de búsqueda y rescate para navegación semiautónoma (Tesis para obtener el grado de Maestro en Robótica). Universidad Tecnológica de la Mixteca, Huajuapan de León, Oaxaca.
Abstract: La locomoción bípeda representa un problema complejo dentro de la robótica debido a la naturaleza no lineal del sistema, la coordinación de múltiples grados de libertad y la necesidad de mantener estabilidad dinámica durante el desplazamiento. En este contexto, el criterio del Punto de Momento Nulo (ZMP, por sus siglas en inglés) permite analizar la estabilidad del robot respecto al polígono de soporte. Sin embargo, su uso aislado depende de modelos precisos y puede resultar limitado ante la complejidad de la marcha. Por ello, este trabajo integra el criterio ZMP con aprendizaje por refuerzo para estudiar la generación de marcha estable en un robot bípedo simulado. El objetivo de este trabajo fue diseñar y validar, en simulación, una metodología para la locomoción de un robot bípedo de 12 grados de libertad. Para ello, se combinan el modelado cinemático, el cálculo del centro de masa y del ZMP, y el entrenamiento de una política de control mediante aprendizaje por refuerzo. La finalidad es obtener una política capaz de producir desplazamiento sostenido y conservar condiciones de estabilidad durante la marcha. La metodología incluyó el diseño del modelo del robot, el desarrollo del modelo cinemático mediante parámetros de Denavit-Hartenberg y la validación progresiva del sistema en distintos entornos de simulación. CoppeliaSim se utilizó para instrumentar y visualizar el ZMP, Gazebo/RViz para verificar el modelo robótico y, finalmente, Isaac Sim con Isaac Lab para realizar el entrenamiento masivo en paralelo. El algoritmo seleccionado fue Proximal Policy Optimization (PPO), incorporando el ZMP como un término de penalización dentro de la función de recompensa. Se evaluaron configuraciones de 500, 1000 y 4000 entornos paralelos, y posteriormente se realizó un análisis estadístico con cinco semillas distintas para verificar la robustez de los resultados. Los resultados muestran que el nivel de paralelismo tuvo una influencia importante en la calidad de la política aprendida. La configuración con 4000 entornos fue la única que produjo locomoción sostenida de manera consistente y presentó un error promedio de seguimiento de velocidad sobre el eje x de 0.71 m/s, frente a 1.00 m/s y 0.97 m/s para las configuraciones con 500 y 1000 entornos, respectivamente. Esto representa una reducción relativa del error de 29.0 % respecto a 500 entornos y de 26.8 % respecto a 1000 entornos. Asimismo, el análisis con cinco semillas mostró que la configuración con 4000 entornos mantuvo el mejor compromiso entre reducción del error lineal, distancia recorrida y generación de locomoción sostenida. Se concluye que la hipótesis se cumplió parcialmente dentro del alcance de la simulación. La política entrenada con la función de recompensa propuesta fue capaz de producir marcha bípeda sostenida y conservar condiciones de estabilidad; además, se obtuvo una reducción relativa del error de seguimiento al incrementar el número de entornos paralelos. Sin embargo, el error de 0.71 m/s no puede considerarse bajo en términos absolutos, por lo que esta parte de la hipótesis no se cumplió completamente. La tendencia observada sugiere que el error podría reducirse mediante un mayor número de entornos e iteraciones, el ajuste de la función de recompensa y la optimización de los hiperparámetros, aunque no fue posible evaluar más de 4000 entornos debido a las limitaciones del equipo utilizado. Dado que los resultados se obtuvieron exclusivamente en simulación, la implementación en un prototipo físico y la reducción de la brecha sim-to-real se plantean como líneas futuras de investigación.
URI: http://repositorio.utm.mx:8080/jspui/handle/123456789/548
Appears in Collections:Maestría

Files in This Item:
File Description SizeFormat 
2026-MJVS-MR.pdf1.87 MBAdobe PDFView/Open
facebook


This item is licensed under a Creative Commons License Creative Commons