Tecnología

Alibaba lanza Qwen3.8-Omni-Flash con mejoras en audio y una rebaja de más del 93% en el precio de su API

Miguel Castaño | Viernes 18 de septiembre de 2026

Alibaba Cloud ha presentado Qwen3.8-Omni-Flash, su nuevo modelo de inteligencia artificial multimodal, con el que la compañía china busca ampliar las capacidades de su familia Qwen en procesamiento de audio, visión y ejecución de tareas mediante agentes, el lanzamiento llega además acompañado de una importante reducción de precios en su API, especialmente en el procesamiento de audio y contenidos audiovisuales.



Según los datos de rendimiento publicados por Alibaba Cloud, Qwen3.8-Omni-Flash supera a Gemini 3.8 Flash de Google en diferentes pruebas relacionadas con voz, sonido y agentes multimodales. Al mismo tiempo, la compañía asegura haber reducido en más de un 98% el precio del procesamiento de audio y en más de un 93% el correspondiente al procesamiento audiovisual frente a la generación anterior.

Un modelo que apuesta especialmente por el audio

Uno de los principales puntos diferenciales de Qwen3.8-Omni-Flash se encuentra en sus capacidades de procesamiento de voz y sonido, Alibaba Cloud destaca especialmente los resultados obtenidos en escenarios donde intervienen varios interlocutores al mismo tiempo, con una tasa de errores reducida en las pruebas realizadas por la compañía. El modelo también obtiene buenos resultados en comprensión musical y detección de sonidos, en la prueba SpotSoundBench, Qwen3.8-Omni-Flash alcanza una puntuación de 67,2 puntos, frente a los 39,7 puntos de Gemini 3.8 Flash, según los datos proporcionados por Alibaba.

La compañía también señala que el nuevo modelo mejora la comprensión de contenidos musicales y puede interpretar diferentes tipos de información sonora dentro de un mismo contexto. Esta capacidad tiene aplicaciones potenciales en asistentes de voz, herramientas de accesibilidad, análisis multimedia o sistemas capaces de interactuar con el usuario mediante conversaciones más naturales.

La ventaja no se limita al rendimiento, Alibaba ha acompañado el lanzamiento con una reducción especialmente agresiva del precio de su API. El coste asociado al procesamiento de audio cae más de un 98%, mientras que el audiovisual se reduce más de un 93% respecto a la generación anterior.

Qwen deja de centrarse solo en comprender y empieza a ejecutar

Alibaba también quiere diferenciar Qwen3.8-Omni-Flash por su capacidad para trabajar como parte de sistemas de agentes, la compañía plantea el modelo como una herramienta capaz de pasar de la interpretación de información a la ejecución de acciones.

El sistema puede integrarse en flujos relacionados con ejecución de código, gestión de documentos, navegación por interfaces web y móviles y automatización de tareas complejas paso a paso. En este escenario, el modelo no se limita a responder una pregunta, sino que puede utilizar herramientas externas para completar una determinada tarea, los resultados publicados por Alibaba en WildClawBench-MM, una prueba centrada en agentes multimodales con herramientas, sitúan a Qwen3.8-Omni-Flash en 71 puntos, frente a los 58,9 obtenidos por Gemini en la misma evaluación.

Esta orientación hacia los agentes también se refleja en la capacidad del modelo para seguir parámetros establecidos por el usuario, Alibaba asegura haber mejorado la adherencia a instrucciones relacionadas con el tono de conversación, la personalidad, las restricciones de salida y el uso de llamadas a funciones. Esto último permite que el modelo interactúe con herramientas externas para realizar determinadas acciones, como consultar información actualizada o acceder a servicios conectados.

Qwen3.8-Omni-Flash está diseñado para trabajar de manera nativa con diferentes tipos de información, el sistema puede procesar texto y visión junto con entradas y salidas de audio, lo que permite construir experiencias en las que las distintas modalidades se combinan dentro de una misma interacción. La compañía también asegura que el nuevo modelo mejora su capacidad para interpretar imágenes, diagramas, esquemas e interfaces gráficas, en estas tareas, Alibaba destaca una mayor precisión en la comprensión de representaciones tanto en dos como en tres dimensiones.

El modelo mantiene además el rendimiento en tareas de texto y ofrece una ventana de contexto de un millón de tokens, una característica especialmente relevante para aplicaciones que necesitan trabajar con grandes cantidades de información simultáneamente. Según Alibaba Cloud, teniendo en cuenta el conjunto de capacidades multimodales, Qwen3.8-Omni-Flash supone una mejora media superior al 25% respecto a la generación anterior.

Gemini todavía conserva ventaja en vídeo

Aunque Alibaba presenta resultados superiores en diferentes pruebas, el nuevo Qwen no domina todas las categorías, la propia compañía reconoce que todavía existe margen de mejora en el razonamiento audiovisual centrado específicamente en vídeo, un ámbito en el que Gemini continúa obteniendo mejores resultados.

La comparación con los modelos de Google y Anthropic debe interpretarse además teniendo en cuenta las pruebas concretas utilizadas y las versiones evaluadas. Alibaba ha comparado Qwen3.8-Omni-Flash con Gemini 3.8 Flash y con Claude Opus 4.6 en diferentes escenarios, y señala que su modelo supera al de Anthropic en tareas relacionadas con visión y utilización de pantallas, incluyendo navegación móvil, percepción visual del entorno y razonamiento matemático basado en elementos visuales.

La compañía también ha realizado comparaciones con Opus 4.6 Max, aunque se trata de una generación anterior respecto al actual Opus 5, por ello, estos resultados deben entenderse dentro del conjunto concreto de benchmarks utilizados y no como una comparación absoluta de todos los modelos disponibles. Más allá de los resultados de rendimiento, la estrategia de Alibaba tiene otro componente importante: el coste de utilizar el modelo.

La reducción superior al 93% en el precio de la API audiovisual y superior al 98% en audio puede resultar especialmente relevante para desarrolladores y empresas que quieran incorporar capacidades multimodales a sus productos. El procesamiento de audio y vídeo puede generar un volumen elevado de datos y, por tanto, convertirse en uno de los principales costes cuando estas funciones se utilizan a gran escala.

TEMAS RELACIONADOS:


Noticias relacionadas