ModelVerdict

Metodología

Metodología: cómo medimos

Cada cifra de este sitio se puede rastrear hasta un documento concreto, el resultado del modelo y el coste de la ejecución. Así se obtienen.

Qué medimos

Tres tareas habituales en una empresa: extraer 13 campos de una factura (proveedor, identificadores, número de documento, referencia de pago, fechas, base e impuesto por tipo, total, moneda, cuenta bancaria); clasificar correos de clientes (categoría, prioridad, tono, cliente, número de pedido y de factura, importe, moneda, plazo); y encontrar datos personales en textos empresariales, por ejemplo antes de enviarlos a un servicio de IA (nombres, correos, teléfonos, direcciones, fechas de nacimiento, números de identificación, cuentas bancarias). Indicamos el porcentaje de campos correctos y el de documentos sin ningún error, porque para una empresa la segunda cifra suele importar más. Los documentos están en checo y en inglés estadounidense.

El conjunto de prueba

Todos los documentos son sintéticos: generados a partir de datos aleatorios pero válidos (identificadores de empresa y números de nacimiento checos con dígito de control, cuentas según las normas del Banco Nacional Checo, EIN, números de ruta ABA). La respuesta correcta son los datos de origen, no una transcripción manual, y no tiene erratas. Ningún dato personal ni empresarial real: los correos usan dominios .example, los teléfonos estadounidenses el rango ficticio 555-01xx y los SSN un rango que nunca se asigna. Un documento checo y uno inglés forman un par con la misma estructura, lo que permite medir la brecha lingüística.

Las facturas tienen ocho diseños con variantes realistas (sin IVA, factura de anticipo, abono, moneda extranjera) y cuatro niveles: 30 % texto PDF, 30 % imagen limpia, 30 % escaneo (rotación, ruido, JPEG), 10 % foto (perspectiva, sombra). Un tercio de cada conjunto no es público; de él solo publicamos resultados agregados, para que ningún modelo acierte por haber visto ya las respuestas.

Los correos aparecen como mensaje único, con una firma larga, como hilo con mensajes anteriores citados y como correo reenviado por un compañero; los plazos también son relativos («antes del viernes»). La prioridad sigue reglas fijas escritas en el prompt, así que no es una cuestión de opinión. Los textos con datos personales (fichas de RR. HH., tickets de soporte, actas, correos) incluyen a propósito datos que no son personales: nombres de empresa formados por apellidos, identificadores de empresa, direcciones genéricas como info@, números de pedido y fechas que no son de nacimiento.

Cómo funciona una ejecución

Todos los modelos se llaman a través de OpenRouter con el mismo prompt en el idioma del documento y temperatura 0, cada modelo en un proveedor fijo para que los resultados sean reproducibles. Si un modelo admite salida estructurada (esquema JSON), la usamos; si el proveedor rechaza el esquema, volvemos a preguntar sin él y lo registramos. Si la respuesta no es un JSON válido, preguntamos una vez más y también lo registramos. En cada llamada guardamos el modelo, las versiones del prompt y del conjunto, los tokens, el coste, la latencia y el proveedor. Las respuestas se guardan en caché, así que cada semana solo pagamos por modelos, documentos y prompts nuevos.

Cómo puntuamos

Un campo es correcto cuando coincide exactamente con el valor correcto tras normalizar el formato: fechas a AAAA-MM-DD, importes a un número con dos decimales (con ambas convenciones de separador), sin tener en cuenta los espacios en identificadores y números de cuenta. Los diacríticos no se normalizan: «Horak» en lugar de «Horák» es un error. Los errores se clasifican por categorías (campo ausente, valor incorrecto, diacríticos perdidos, fechas intercambiadas, base en lugar de total, tipo incorrecto, formato numérico, JSON no válido). El umbral para facturas es del 95 % de campos correctos.

Correos: la categoría, la prioridad y el tono deben coincidir exactamente; los plazos relativos deben dar la fecha correcta. Datos personales: cada campo es una lista y solo es correcto si está completa y no sobra nada; un identificador de empresa marcado como dato personal cuenta como valor inventado. El umbral es del 95 % de campos correctos en todas las tareas.

Costes e impuesto lingüístico

El coste es el gasto real en tokens tal como lo devuelve la API en USD, escalado a 1000 documentos. La conversión a otras monedas se hace solo para mostrarla, al tipo de cambio indicado en el pie de página. El impuesto lingüístico se mide con un corpus paralelo de 50 párrafos en checo, alemán, francés, español, polaco e inglés: enviamos el texto con un límite de salida mínimo, restamos la sobrecarga de un prompt vacío y comparamos los tokens de entrada con los del inglés.

El coste real suma el trabajo de una persona que debe encontrar y corregir cada documento con errores: 3 minutos por documento a 450 CZK / 35 EUR / 40 USD la hora. La velocidad es la mediana del tiempo de respuesta (percentil 90 en la ayuda); las respuestas válidas son el porcentaje de documentos con JSON válido. Los errores de límite de peticiones de la API no se atribuyen al modelo: se repiten hasta que cada documento tiene respuesta.

La calculadora de coste real usa costes medidos cuando tenemos documentos en el idioma. En los demás idiomas estima: el recargo medido en documentos reales en otro idioma, ajustado con el impuesto lingüístico del idioma elegido (una imagen de factura cuesta lo mismo en todos los idiomas; la simple proporción de tokens lo exageraría). Las estimaciones van marcadas con ≈ y no tienen precisión.

La brecha lingüística

La diferencia de precisión entre documentos checos e ingleses se calcula solo con los campos que tienen ambas versiones. Las facturas estadounidenses no tienen número de IVA ni fecha de devengo, por lo que esos campos quedan fuera de la comparación.

Limitaciones

Los documentos sintéticos no cubren todo lo que ve una empresa real (notas manuscritas, facturas de varias páginas, diseños poco habituales). Con unos 150 documentos por idioma, la precisión tiene una incertidumbre de aproximadamente ±1 punto porcentual; no considere decisivas las diferencias menores entre modelos. Los modelos y los precios cambian, por eso cada cifra muestra la fecha de la ejecución.

Independencia

Las clasificaciones y recomendaciones no se pueden comprar. Ningún proveedor de modelos nos paga por su posición. Si encuentra un error en una respuesta correcta o en la puntuación, avísenos: lo corregimos y dejamos constancia del cambio.

Ejecución actual: 20260928T085806Z-5d2ece del 28 de septiembre de 2026, versión del conjunto de datos 0.1.0.