Contenido
El problema
Un market maker debe ganar por dar liquidez, pero sin quedarse atrapado con demasiado inventario.
Un market maker coloca órdenes de compra y venta para facilitar que otros participantes negocien. Si lo hace bien, captura pequeños márgenes. Si lo hace mal, puede terminar acumulando demasiado activo en una dirección y quedar expuesto a movimientos adversos del precio.
Ese equilibrio es incómodo porque los objetivos chocan. Ser agresivo puede aumentar oportunidades de beneficio, pero también eleva el riesgo de inventario. Ser conservador protege más, pero puede dejar pasar operaciones rentables.
La pregunta central es cómo entrenar una estrategia que no oculte ese conflicto. El decisor necesita ver el compromiso entre beneficio e inventario, no una cifra única que mezcle ambas cosas sin explicar cuánto pesa cada una.
Por qué es difícil
Los objetivos compiten
Maximizar beneficio y minimizar inventario no siempre empujan hacia la misma acción.
La recompensa puede engañar
Una recompensa escalar obliga a elegir pesos antes de entrenar, aunque el compromiso real no esté claro.
El mercado es secuencial
Cada cotización afecta al inventario futuro, no solo al resultado inmediato.
Hace falta comparar políticas
Una estrategia útil debe mostrar varias alternativas eficientes, no solo una política ganadora.
La idea principal
La propuesta consiste en tratar el market making como un problema de reinforcement learning multiobjetivo. El agente aprende políticas que consideran simultáneamente beneficio e inventario, pero sin reducirlos desde el principio a una suma ponderada.
El frente de Pareto es la pieza visual y conceptual clave. Cada punto representa una política que no puede mejorar un objetivo sin empeorar el otro. Así el resultado no es una receta cerrada, sino una frontera de decisiones defendibles.
Esto evita parte del problema de la ingeniería de recompensas. En lugar de discutir qué peso exacto dar al beneficio y al riesgo antes de entrenar, el método permite observar el abanico de compromisos disponibles.
El resultado no es una política única, sino un conjunto de políticas eficientes con distintos compromisos.
Una forma sencilla de verlo
Es como elegir una cartera: no existe una única combinación perfecta de retorno y riesgo; existe una frontera de alternativas razonables.
Cómo se resolvió
El enfoque separa los objetivos del market maker y usa reinforcement learning para aprender políticas a lo largo de esa frontera.
Definir los objetivos
El modelo considera por separado la rentabilidad de la estrategia y el control del inventario acumulado.
Entrenar un agente multiobjetivo
M3ORL aprende políticas de market making mediante deep reinforcement learning sin convertir todo en una recompensa única desde el inicio.
Construir el frente de Pareto
Las políticas se organizan como alternativas eficientes, cada una con un equilibrio diferente entre beneficio e inventario.
Comparar con reward engineering
El trabajo contrasta el enfoque con métodos clásicos que dependen de pesos definidos manualmente en la recompensa.
Medir calidad del frente
La evaluación usa métricas multiobjetivo como hipervolumen, dispersión de soluciones y número de soluciones no dominadas.
Abrir el análisis
El repositorio asociado publica datos del trabajo, lo que facilita inspeccionar resultados y reproducir parte del estudio.
Conclusión del enfoque
La aportación es hacer visible el compromiso: optimizar no significa esconder el riesgo dentro de una recompensa, sino mostrar la frontera entre objetivos.
Multi-objective reinforcement learning
Aprendizaje por refuerzo que optimiza varios objetivos al mismo tiempo.
Pareto front
Conjunto de soluciones donde ninguna mejora un objetivo sin empeorar otro.
Market making
Estrategia que proporciona liquidez colocando precios de compra y venta.
Hypervolume
Métrica que resume cuánto espacio de buenas soluciones cubre un frente de Pareto.
El experimento
La publicación aparece en Expert Systems with Applications, volumen 295, artículo 128867, con fecha de enero de 2026.
Según los metadatos de Crossref, el trabajo registra 65 referencias y se apoya en literatura de market making, reinforcement learning, optimización multiobjetivo, reward engineering y métricas de evaluación de frentes de Pareto.
El repositorio público asociado describe el enfoque M3ORL y recoge datos del paper. También indica que se comparan políticas multiobjetivo con alternativas clásicas basadas en ingeniería de recompensas.
Qué se descubrió
El mensaje más útil es que el market making no encaja bien con una recompensa única cuando se quiere entender la decisión. Si beneficio e inventario se mezclan demasiado pronto, el usuario ve una política final, pero no ve el precio pagado por cada objetivo.
El enfoque multiobjetivo permite analizar la frontera completa. Una política puede ser más rentable y aceptar más inventario; otra puede ser más prudente y sacrificar parte del beneficio. Ambas pueden ser buenas si están en la frontera eficiente.
El trabajo también pone en primer plano la evaluación del frente. No basta con generar muchas soluciones: importa que cubran bien el espacio de alternativas, que no estén todas pegadas y que sean realmente no dominadas.
La enseñanza para trading cuantitativo es clara: una estrategia explicable no solo dice qué hace, sino dónde se sitúa dentro del compromiso entre retorno y riesgo operativo.
- El market making puede formularse como un problema multiobjetivo.
- Los frentes de Pareto ayudan a visualizar compromisos entre beneficio e inventario.
- La ingeniería de recompensas puede ocultar decisiones importantes de diseño.
- Métricas como hipervolumen y dispersión permiten evaluar la calidad de las alternativas.
Más transparencia
El decisor ve varias políticas y el compromiso asociado a cada una.
Menos pesos arbitrarios
El enfoque reduce la dependencia de una recompensa mezclada definida a mano.
Mejor lectura del riesgo
El inventario deja de ser un detalle oculto y pasa a ser un objetivo explícito.
En market making, una buena respuesta puede ser una frontera, no un punto aislado.
Por qué importa
Este trabajo es muy relevante para trading actual porque une tres piezas fuertes: mercados de alta frecuencia, reinforcement learning y optimización multiobjetivo.
También conecta directamente con la lógica de ParetoInvest. En ambos casos, la calidad de una solución no se entiende mirando un único número, sino comparando alternativas eficientes y eligiendo según preferencias, riesgo y contexto.
Para herramientas de apoyo a la decisión financiera, el valor práctico está en la transparencia. Un usuario puede preferir una política menos rentable si reduce inventario, o aceptar más riesgo si busca capturar más margen. Lo importante es que el sistema muestre ese intercambio.
Aplicaciones reales
Market making
Diseñar políticas que equilibren margen, liquidez e inventario.
Optimización de carteras
Usar frentes de Pareto para presentar alternativas entre retorno y riesgo.
Gestión de riesgo
Separar objetivos para evitar que el riesgo quede escondido en una recompensa única.
Sistemas de decisión
Mostrar al usuario varias políticas defendibles en vez de una recomendación opaca.
Qué podemos aprender
Cuando hay objetivos en conflicto, una IA financiera no debería fingir que existe una respuesta única. La mejor explicación puede ser enseñar la frontera de alternativas y dejar claro qué se gana y qué se sacrifica en cada punto.
Preguntas frecuentes
¿Esto es una recomendación de trading?
No. Es una explicación divulgativa de una publicación científica. No constituye asesoramiento financiero ni una señal de compra o venta.
¿Qué es market making?
Es una actividad donde un participante ofrece precios de compra y venta para aportar liquidez al mercado, asumiendo a cambio riesgo de inventario.
¿Por qué usar frentes de Pareto?
Porque permiten ver varias políticas eficientes y entender el compromiso entre beneficio e inventario sin esconderlo en una única recompensa.
Publicación y recursos
Fernández Vicente, Ó.; García, J.; Fernández, F. Optimizing market-making strategies: A multi-objective reinforcement learning approach with pareto fronts. Expert Systems with Applications, 295, 128867, 2026. https://doi.org/10.1016/j.eswa.2025.128867.