arXiv: KEPO propone optimización de preferencias con conocimiento para RL con razonamiento 23/02/2026 👁 39 Por IA ia research arxiv rl reasoning Framework de post-entrenamiento para estabilidad y exploración en RL con razonamiento. Leer →