Vulsar AI ha publicado un benchmark que evalúa la capacidad de 24 modelos de inteligencia artificial para crear ficción, comparándolos con textos de escritores humanos. Basado en 475 prompts, el estudio sitúa a GPT 6 Astra con una tasa de éxito prevista del 87,8 % en la clasificación general, frente al 86,6 % de la referencia humana. Sin embargo, la diferencia resulta más significativa al segmentar entre escritores profesionales y aficionados.
Resumen en 20 segundos del benchmark de escritura creativa de Vulsar
- Vulsar ha comparado 24 modelos de IA con escritores humanos mediante 475 prompts.
- GPT 6 Astra obtiene una tasa de victoria prevista del 87,8 % en el resultado global.
- Los escritores humanos alcanzan el 86,6 % en esa misma clasificación.
- Entre profesionales, Astra baja al 76,2 %, mientras que la referencia humana llega al 99,9 %.
- Para aficionados, Astra alcanza el 93,9 %, frente al 79,7 % de los humanos.
Publicado el 17 de septiembre de 2026, este benchmark intenta medir una capacidad difícil de comparar con las típicas pruebas de matemáticas, programación o conocimientos. Vulsar no busca determinar solo si un modelo puede generar un texto coherente, sino estimar qué historias serían más preferidas por lectores humanos.
La metodología emplea un modelo de recompensa entrenado con preferencias humanas en escritura creativa. No se usa otro modelo de lenguaje como juez final ni rúbricas con múltiples criterios. El sistema compara las respuestas y calcula una tasa de victoria prevista para cada participante.
GPT 6 Astra lidera la clasificación general
GPT 6 Astra logra una tasa de éxito prevista del 87,8 %, frente al 86,6 % de la referencia humana. La diferencia de 1,2 puntos porcentuales se presenta como una estimación de preferencia, no como una medida absoluta de calidad literaria.
| Posición | Modelo o referencia | Victoria prevista |
|---|---|---|
| 1 | GPT 6 Astra | 87,8 % |
| 2 | Escritores humanos | 86,6 % |
| 3 | GPT 5.6 Sol | 77,6 % |
| 4 | Muse Spark 1.3 | 70,6 % |
| 5 | Claude Fable 5.1 | 70,3 % |
| 6 | Claude Opus 5 | 63,4 % |
| 7 | GPT 5.6 Terra | 62,6 % |
| 8 | GPT 5.6 Luna | 61,8 % |
| 9 | Kimi K3 | 61,0 % |
| 10 | Grok 4.6 | 59,3 % |
Por debajo, se encuentran modelos como GLM 5.3 Flash con un 54,6 %, Qwen3.8 2.4T A95B con un 53,9 %, e Inkling con un 52,3 %. En los niveles más bajos, Gemma 4 31B logra un 23,4 %, Qwen3.8 27B un 23,2 %, DeepSeek V4.1 Flash un 19,8 %, DeepSeek V3.2 un 16,5 %, y Gemma 4 26B A4B llega al 10,9 %.
El estudio también analiza la longitud de las historias. Los humanos producen en promedio 2.592 tokens, mientras GPT 6 Astra alcanza 1.537. Claude Opus 5 llega a 2.330, y Claude Fable 5.1 a 2.114 tokens.
No obstante, la longitud no se usa como criterio principal para la clasificación; el benchmark mide la preferencia prevista basada en el sistema de recompensa de Vulsar.
El rendimiento de los profesionales es mucho más destacado
Al separar a los escritores profesionales, la diferencia es aún más marcada. La referencia humana obtiene una tasa de victoria prevista del 99,9 %, mientras que GPT 6 Astra llega al 76,2 %, y Grok 4.6 alcanza el 78,5 %.
| Posición | Modelo o referencia | Victoria prevista |
|---|---|---|
| 1 | Escritores profesionales | 99,9 % |
| 2 | Grok 4.6 | 78,5 % |
| 3 | GPT 6 Astra | 76,2 % |
| 4 | Claude Fable 5.1 | 69,8 % |
| 5 | Muse Spark 1.3 | 64,9 % |
| 6 | Qwen3.8 2.4T A95B | 63,6 % |
| 7 | Claude Opus 5 | 63,3 % |
| 8 | GPT 5.6 Sol | 63,1 % |
El tamaño medio de los textos de los profesionales es de 4.528 tokens por historia, en comparación con los 1.745 tokens de GPT 6 Astra. La diferencia se atribuye a que los prompts para profesionales incluyen instrucciones más detalladas y requisitos específicos.
Este análisis indica que el rendimiento varía según el tipo de tarea y el nivel de experiencia de la referencia humana. La clasificación general puede esconder esas variaciones.
Los modelos superan a los aficionados
En la categoría de amateurs, GPT 6 Astra alcanza una tasa de victoria prevista del 93,9 %, seguido por GPT 5.6 Sol con el 85,2 %, y la referencia de escritores aficionados en el 79,7 %.
| Posición | Modelo o referencia | Victoria prevista |
|---|---|---|
| 1 | GPT 6 Astra | 93,9 % |
| 2 | GPT 5.6 Sol | 85,2 % |
| 3 | Escritores aficionados | 79,7 % |
| 4 | Muse Spark 1.3 | 73,5 % |
| 5 | Claude Fable 5.1 | 70,5 % |
| 6 | GPT 5.6 Terra | 70,2 % |
| 7 | GPT 5.6 Luna | 67,4 % |
| 8 | Claude Opus 5 | 63,5 % |
Es notable cómo GPT 6 Astra supera en rendimiento a los aficionados y queda bastante lejos de los profesionales, reflejando las diferencias en competencia y nivel de detalle en las instrucciones.
Este estudio no busca establecer una conclusión absoluta sobre si la inteligencia artificial escribe mejor que los humanos; más bien, depende del conjunto de prompts, la referencia y el sistema de preferencias empleado.
475 prompts para una evaluación difícil de comparar
Para su evaluación, Vulsar utilizó 475 prompts únicos, solicitando a los participantes generar una historia corta para cada uno. Las pruebas cubren distintos tipos de ficción y usan instrucciones uniformes para los modelos dentro de cada conjunto.
Cuando el modelo podía realizar razonamiento, el sistema lo activaba; si no, usaba el nivel de razonamiento más bajo disponible. Las respuestas vacías o rechazadas no se consideran automáticamente derrotas, sino que quedan fuera de las comparaciones.
Este detalle es importante porque la tasa de victoria no equivale a un porcentaje de aciertos, sino a una estimación de la preferencia promedio hacia las respuestas de cada modelo dentro del benchmark. Por ejemplo, una tasa del 87,8 % indica que, en el conjunto de comparaciones, se estima que GPT 6 Astra sería preferido en ese porcentaje.
Los intervalos de confianza aportan información adicional: para GPT 6 Astra, el intervalo del 95 % está entre el 86,7 % y el 88,9 %, mientras que para la referencia humana, oscila entre el 85,5 % y el 87,7 %.
El benchmark no mide la originalidad de forma independiente
Vulsar reconoce una limitación en su evaluación: el sistema de recompensa está entrenado con preferencias humanas que pueden valorar la novedad o sensación de originalidad, pero el benchmark en sí no verifica si las ideas o formulaciones son realmente nuevas respecto a obras existentes o datos de entrenamiento.
Por ello, una tasa de victoria elevada no certifica necesariamente la originalidad del texto.
Lo mismo aplica para la calidad literaria. El objetivo del benchmark es estimar las preferencias humanas agregadas, no emitir una opinión definitiva sobre la calidad. Los gustos individuales pueden diferir de las predicciones del sistema de recompensa.
Este enfoque resulta especialmente valioso porque introduce una dimensión que suele faltar en los benchmarks técnicos: la comparación entre generación automática y preferencias humanas en tareas abiertas.
Los resultados muestran que el rendimiento varía en función del nivel de experiencia de la referencia. GPT 6 Astra se acerca a la referencia global, sobrepasa a la de aficionados y está bastante lejos de la de profesionales, reflejando las distintas demandas y niveles de detalle en las instrucciones.
Este Creative Writing Bench V1 funciona como una prueba concreta de escritura creativa, pero no como una evaluación general de las capacidades de los modelos de lenguaje.
Preguntas frecuentes
¿Qué modelos participan en el benchmark de Vulsar?
Se comparan 24 modelos de IA con referencias de escritores humanos, usando 475 prompts de escritura creativa. Los modelos corresponden a diferentes familias y tamaños.
¿Qué resultado obtiene GPT 6 Astra?
GPT 6 Astra logra una tasa de victoria prevista del 87,8 % en la clasificación general, con un 76,2 % respecto a escritores profesionales y un 93,9 % frente a amateurs.
¿Cómo evalúa Vulsar las historias?
Utiliza un modelo de recompensa entrenado con preferencias humanas, sin emplear otro LLM como juez final ni rúbricas tradicionales.
¿El benchmark demuestra que la IA escribe mejor que los humanos?
No realiza una conclusión general sobre esa comparación. La evaluación se basa en preferencias previstas en 475 tareas específicas, variando según el grupo de referencia y los prompts utilizados.