Volver a papers comentados

Comentario divulgativo

El trading que no busca una única respuesta, sino una frontera de decisiones

Una explicación sencilla de un trabajo Q1 sobre market making, reinforcement learning multiobjetivo y frentes de Pareto.

Basado en el trabajo "Optimizing market-making strategies: A multi-objective reinforcement learning approach with pareto fronts", de Óscar Fernández Vicente, Javier García y Fernando Fernández, publicado en Expert Systems with Applications en 2026.

Esquema de market making con dos objetivos, beneficio e inventario, unidos por un frente de Pareto

El trabajo parte de un problema clásico del market making: ofrecer liquidez puede generar beneficio, pero también deja inventario acumulado y riesgo. En vez de unir esos dos objetivos en una sola recompensa artificial, los autores proponen M3ORL, un agente de deep reinforcement learning multiobjetivo que optimiza beneficio e inventario por separado. El resultado se expresa como un frente de Pareto, es decir, un conjunto de políticas donde cada alternativa muestra un compromiso distinto entre ganar más y controlar mejor el riesgo de inventario.

La idea es especialmente interesante porque cambia la forma de presentar una estrategia. No se entrega una respuesta única como si fuera universal, sino un mapa de alternativas eficientes para que el decisor entienda qué está sacrificando y qué está ganando.

En trading actual, esto importa mucho: muchas estrategias parecen buenas porque esconden el riesgo dentro de una recompensa mezclada. Un frente de Pareto obliga a enseñar el compromiso de forma explícita.

Q1Expert Systems with Applications
2026publicación
M3ORLmarket maker multiobjetivo
65referencias

El problema

Un market maker debe ganar por dar liquidez, pero sin quedarse atrapado con demasiado inventario.

Un market maker coloca órdenes de compra y venta para facilitar que otros participantes negocien. Si lo hace bien, captura pequeños márgenes. Si lo hace mal, puede terminar acumulando demasiado activo en una dirección y quedar expuesto a movimientos adversos del precio.

Ese equilibrio es incómodo porque los objetivos chocan. Ser agresivo puede aumentar oportunidades de beneficio, pero también eleva el riesgo de inventario. Ser conservador protege más, pero puede dejar pasar operaciones rentables.

La pregunta central es cómo entrenar una estrategia que no oculte ese conflicto. El decisor necesita ver el compromiso entre beneficio e inventario, no una cifra única que mezcle ambas cosas sin explicar cuánto pesa cada una.

Por qué es difícil

Los objetivos compiten

Maximizar beneficio y minimizar inventario no siempre empujan hacia la misma acción.

La recompensa puede engañar

Una recompensa escalar obliga a elegir pesos antes de entrenar, aunque el compromiso real no esté claro.

El mercado es secuencial

Cada cotización afecta al inventario futuro, no solo al resultado inmediato.

Hace falta comparar políticas

Una estrategia útil debe mostrar varias alternativas eficientes, no solo una política ganadora.

La idea principal

La propuesta consiste en tratar el market making como un problema de reinforcement learning multiobjetivo. El agente aprende políticas que consideran simultáneamente beneficio e inventario, pero sin reducirlos desde el principio a una suma ponderada.

El frente de Pareto es la pieza visual y conceptual clave. Cada punto representa una política que no puede mejorar un objetivo sin empeorar el otro. Así el resultado no es una receta cerrada, sino una frontera de decisiones defendibles.

Esto evita parte del problema de la ingeniería de recompensas. En lugar de discutir qué peso exacto dar al beneficio y al riesgo antes de entrenar, el método permite observar el abanico de compromisos disponibles.

El resultado no es una política única, sino un conjunto de políticas eficientes con distintos compromisos.

Una forma sencilla de verlo

Es como elegir una cartera: no existe una única combinación perfecta de retorno y riesgo; existe una frontera de alternativas razonables.

Cómo se resolvió

El enfoque separa los objetivos del market maker y usa reinforcement learning para aprender políticas a lo largo de esa frontera.

  1. Definir los objetivos

    El modelo considera por separado la rentabilidad de la estrategia y el control del inventario acumulado.

  2. Entrenar un agente multiobjetivo

    M3ORL aprende políticas de market making mediante deep reinforcement learning sin convertir todo en una recompensa única desde el inicio.

  3. Construir el frente de Pareto

    Las políticas se organizan como alternativas eficientes, cada una con un equilibrio diferente entre beneficio e inventario.

  4. Comparar con reward engineering

    El trabajo contrasta el enfoque con métodos clásicos que dependen de pesos definidos manualmente en la recompensa.

  5. Medir calidad del frente

    La evaluación usa métricas multiobjetivo como hipervolumen, dispersión de soluciones y número de soluciones no dominadas.

  6. Abrir el análisis

    El repositorio asociado publica datos del trabajo, lo que facilita inspeccionar resultados y reproducir parte del estudio.

  7. Conclusión del enfoque

    La aportación es hacer visible el compromiso: optimizar no significa esconder el riesgo dentro de una recompensa, sino mostrar la frontera entre objetivos.

Multi-objective reinforcement learning

Aprendizaje por refuerzo que optimiza varios objetivos al mismo tiempo.

Pareto front

Conjunto de soluciones donde ninguna mejora un objetivo sin empeorar otro.

Market making

Estrategia que proporciona liquidez colocando precios de compra y venta.

Hypervolume

Métrica que resume cuánto espacio de buenas soluciones cubre un frente de Pareto.

El experimento

La publicación aparece en Expert Systems with Applications, volumen 295, artículo 128867, con fecha de enero de 2026.

Según los metadatos de Crossref, el trabajo registra 65 referencias y se apoya en literatura de market making, reinforcement learning, optimización multiobjetivo, reward engineering y métricas de evaluación de frentes de Pareto.

El repositorio público asociado describe el enfoque M3ORL y recoge datos del paper. También indica que se comparan políticas multiobjetivo con alternativas clásicas basadas en ingeniería de recompensas.

295volumen
128867artículo
65referencias registradas
CC BYlicencia registrada

Qué se descubrió

El mensaje más útil es que el market making no encaja bien con una recompensa única cuando se quiere entender la decisión. Si beneficio e inventario se mezclan demasiado pronto, el usuario ve una política final, pero no ve el precio pagado por cada objetivo.

El enfoque multiobjetivo permite analizar la frontera completa. Una política puede ser más rentable y aceptar más inventario; otra puede ser más prudente y sacrificar parte del beneficio. Ambas pueden ser buenas si están en la frontera eficiente.

El trabajo también pone en primer plano la evaluación del frente. No basta con generar muchas soluciones: importa que cubran bien el espacio de alternativas, que no estén todas pegadas y que sean realmente no dominadas.

La enseñanza para trading cuantitativo es clara: una estrategia explicable no solo dice qué hace, sino dónde se sitúa dentro del compromiso entre retorno y riesgo operativo.

  • El market making puede formularse como un problema multiobjetivo.
  • Los frentes de Pareto ayudan a visualizar compromisos entre beneficio e inventario.
  • La ingeniería de recompensas puede ocultar decisiones importantes de diseño.
  • Métricas como hipervolumen y dispersión permiten evaluar la calidad de las alternativas.

Más transparencia

El decisor ve varias políticas y el compromiso asociado a cada una.

Menos pesos arbitrarios

El enfoque reduce la dependencia de una recompensa mezclada definida a mano.

Mejor lectura del riesgo

El inventario deja de ser un detalle oculto y pasa a ser un objetivo explícito.

En market making, una buena respuesta puede ser una frontera, no un punto aislado.

Por qué importa

Este trabajo es muy relevante para trading actual porque une tres piezas fuertes: mercados de alta frecuencia, reinforcement learning y optimización multiobjetivo.

También conecta directamente con la lógica de ParetoInvest. En ambos casos, la calidad de una solución no se entiende mirando un único número, sino comparando alternativas eficientes y eligiendo según preferencias, riesgo y contexto.

Para herramientas de apoyo a la decisión financiera, el valor práctico está en la transparencia. Un usuario puede preferir una política menos rentable si reduce inventario, o aceptar más riesgo si busca capturar más margen. Lo importante es que el sistema muestre ese intercambio.

Aplicaciones reales

Trading

Market making

Diseñar políticas que equilibren margen, liquidez e inventario.

Pareto

Optimización de carteras

Usar frentes de Pareto para presentar alternativas entre retorno y riesgo.

Riesgo

Gestión de riesgo

Separar objetivos para evitar que el riesgo quede escondido en una recompensa única.

Decisión

Sistemas de decisión

Mostrar al usuario varias políticas defendibles en vez de una recomendación opaca.

Qué podemos aprender

Cuando hay objetivos en conflicto, una IA financiera no debería fingir que existe una respuesta única. La mejor explicación puede ser enseñar la frontera de alternativas y dejar claro qué se gana y qué se sacrifica en cada punto.

Preguntas frecuentes

¿Esto es una recomendación de trading?

No. Es una explicación divulgativa de una publicación científica. No constituye asesoramiento financiero ni una señal de compra o venta.

¿Qué es market making?

Es una actividad donde un participante ofrece precios de compra y venta para aportar liquidez al mercado, asumiendo a cambio riesgo de inventario.

¿Por qué usar frentes de Pareto?

Porque permiten ver varias políticas eficientes y entender el compromiso entre beneficio e inventario sin esconderlo en una única recompensa.

Publicación y recursos

Título científicoOptimizing market-making strategies: A multi-objective reinforcement learning approach with pareto fronts
AutoresÓscar Fernández Vicente, Javier García, Fernando Fernández
RevistaExpert Systems with Applications
Año2026
DOI10.1016/j.eswa.2025.128867
AccesoAcceso abierto

Fernández Vicente, Ó.; García, J.; Fernández, F. Optimizing market-making strategies: A multi-objective reinforcement learning approach with pareto fronts. Expert Systems with Applications, 295, 128867, 2026. https://doi.org/10.1016/j.eswa.2025.128867.