Las versiones más recientes de tres grandes familias de modelos de inteligencia artificial detectaron menos operaciones fraudulentas que sus predecesoras en una prueba histórica de Coinbase sobre pagos de su servicio Onramp. El resultado se produjo con la misma política de decisión y pone en cuestión la idea de que actualizar el modelo mejora automáticamente un sistema de prevención del fraude.
La evaluación, comunicada por Coinbase el 7 de octubre, reprodujo 16.140 transacciones realizadas por 7.293 usuarios. Entre ellas había 813 operaciones confirmadas como fraudulentas. La muestra correspondía a las nueve semanas anteriores al despliegue de su agente de riesgo e incluía todos los casos de fraude que ya habían madurado, junto con una selección de operaciones legítimas.
Cada modelo analizó el comportamiento reciente de las transacciones siguiendo las mismas instrucciones. Coinbase también mantuvo sin cambios la forma de convertir las clasificaciones de riesgo en decisiones. De este modo, el ejercicio trataba de aislar el comportamiento del modelo dentro de una configuración concreta, no de comparar sistemas de detección rediseñados por completo.
Menor detección de fraude en las tres comparaciones
Coinbase enfrentó Opus 4.5 con Opus 5, Sonnet 4.6 con Sonnet 5 y GPT-5.4 con GPT-5.6 (sol). En los tres pares, la versión nueva obtuvo una menor tasa de detección, una puntuación F1 inferior y también peores resultados en la detección ponderada por el valor económico del fraude.
La tasa de detección mide qué proporción de los casos fraudulentos identifica el modelo. La métrica ponderada por valor indica cuánto dinero asociado al fraude consigue detectar, mientras que F1 combina la capacidad para encontrar casos con la precisión de las alertas.
La caída más pronunciada correspondió a Sonnet: su tasa de detección bajó 22,2 puntos porcentuales y la detección ponderada por valor descendió 22,9 puntos. En Opus, la tasa de detección retrocedió 0,8 puntos. Las dos versiones nuevas también registraron una precisión menor, lo que significa que una proporción más reducida de las operaciones marcadas como fraudulentas era efectivamente fraudulenta.
El caso de GPT muestra por qué una sola métrica puede ofrecer una imagen incompleta. La precisión de la versión nueva aumentó 11,5 puntos porcentuales, pero su tasa de detección cayó 20,7 puntos y la detección ponderada por valor, 21,8 puntos. Sus alertas eran más exactas, aunque el modelo dejó escapar más casos de fraude y una mayor cantidad de su valor total en la reproducción histórica.
Una prueba que no mide pérdidas reales de clientes
Coinbase subrayó que el ejercicio no demuestra que el uso de esas versiones provocara pérdidas para sus clientes. La compañía pudo identificar el empeoramiento de los resultados, pero no establecer su causa. Además, los investigadores de SR-Fraud señalaron entre las limitaciones del análisis que los datos son de carácter privado, por lo que no pueden publicarse para una replicación independiente ni permiten generalizar directamente las conclusiones.
La empresa había realizado antes otro experimento en producción, centrado en añadir una revisión selectiva mediante modelos de lenguaje a los modelos y reglas existentes. En ese flujo se registraron un 30% menos de transacciones fraudulentas y un 22% menos de valor fraudulento, pero aquella prueba no comparaba versiones nuevas y antiguas del mismo modelo.
El rendimiento de un modelo especializado
En una comunicación del 8 de octubre, Coinbase presentó además un modelo Qwen3.5-9B sometido a entrenamiento adicional. Según la compañía, superó a Opus 4.5 en cuatro métricas de detección de fraude: la puntuación F1 mejoró 9,6 puntos porcentuales y la detección ponderada por valor aumentó 35,4 puntos. El modelo se especializó con resultados históricos de fraude y recompensas deterministas que equilibraban ejemplos fraudulentos y legítimos.
En mediciones de producción, la latencia mediana de extremo a extremo de las solicitudes al modelo fue de 0,683 segundos, frente a 1,515 segundos en Opus 4.5, una reducción relativa del 55%. Coinbase advierte, no obstante, de que la velocidad y la mejora en la detección proceden de evaluaciones distintas. Para los proveedores de pagos, la cuestión no es solo actualizar el modelo, sino comprobar primero su rendimiento dentro de la configuración real de decisiones y medir después, por separado, los cambios en instrucciones o umbrales, junto con la latencia, la fiabilidad y el coste.











