La versión DeepSeek V4 Flash es la mejor opción predeterminada para la mayoría de los usuarios. En nuestras pruebas de programación y de recuperación de 20,7 mil tokens, obtuvo resultados equivalentes a los de Pro, aunque su coste fue mucho menor. Pro solo justificó su precio más elevado en la tarea más difícil: obtuvo una puntuación de 12/12 en un memorándum de lanzamiento muy exigente, mientras que Flash obtuvo 8/12.
Eso hace que la elección sea sencilla. Empieza con Flash para tareas rutinarias de programación, recuperación, extracción y trabajos de gran volumen. Opta por la versión Pro cuando un solo error aritmético, una restricción omitida o un resultado mal formado puedan costar más que el propio modelo.
¿Se ha lanzado oficialmente la versión DeepSeek V4?
Sí. Según se comprobó el 13 de agosto de 2026, el Página oficial de modelos y precios las referencias DeepSeek-V4-Pro-0813 y DeepSeek-V4-Flash-0731. Esa es la información vigente que hay que tener en cuenta, y no la frase del registro de cambios del 31 de julio en la que se indicaba que la versión Pro estaría disponible en breve.
DeepSeek V4 Pro
Versión: Pro-0813
Ajuste óptimo: programación más compleja, agentes, razonamiento y entregables con numerosas restricciones.
DeepSeek V4 Flash
Versión: Flash-0731
Ajuste óptimo: producción de alto rendimiento, codificación rutinaria, recuperación de datos y cargas de trabajo en las que el coste es un factor determinante.
Los nombres pueden resultar confusos, ya que el informe técnico de la V4 describe variantes de vista previa, mientras que la API en producción utiliza versiones de producción con fecha. A lo largo de esta reseña, “Pro” se refiere a Pro-0813 y “Flash” a Flash-0731, salvo que en una frase se indique explícitamente “V4 Preview”.”


¿Qué ha cambiado en DeepSeek V4 Pro?
Los cambios más evidentes son la escala, la capacidad contextual, las interfaces orientadas a los agentes y una estrategia de producto de dos niveles. DeepSeek’s Tarjeta oficial del modelo Pro identifica un modelo de «mezcla de expertos» con un total de 1,6 billones de parámetros y 49 000 millones de parámetros activos, publicado bajo la licencia del MIT. Los materiales adjuntos de la versión 4 describen nuevos avances en atención y enrutamiento destinados a hacer viable el procesamiento de millones de tokens.
- Dos niveles actuales: Pro, para trabajos en los que prima la calidad, y Flash, para el rendimiento y el coste.
- Una memoria de trabajo mucho más amplia: una ventana de contexto de 1M tokens especificada para ambos modelos.
- Límite máximo de generación elevado: hasta 384K tokens de salida según la especificación oficial.
- Interfaces de agente: llamadas a herramientas, salida en formato JSON, API de respuestas y acceso compatible con Anthropic.
- Categorías de peso abiertas: Se dispone de fichas y archivos oficiales del modelo V4, aunque su implantación a gran escala a nivel local sigue siendo un proyecto de infraestructura de gran envergadura.
Esa combinación hace que V4 sea adecuado para la codificación a escala de repositorio, paquetes de investigación extensos y trazas de agentes de varios pasos. Además, cambia el marco competitivo: una evaluación útil debe ahora ir más allá de la calidad del chat y plantearse cómo se comporta el modelo con herramientas, formatos estrictos y entradas largas. Nuestro Comparación entre DeepSeek y ChatGPT ofrece más información sobre en qué se diferencian esos ecosistemas.

DeepSeek V4 Pro frente a Flash: la diferencia en la práctica
Ambas versiones ofrecen el mismo contexto de titular y los mismos límites de salida, por lo que no se trata de una elección entre un “modelo completo” y un «modelo de contexto reducido». Se trata principalmente de una decisión relacionada con la calidad, el precio y la planificación de la capacidad. El límite oficial de concurrencia de Flash es cinco veces mayor que el de Pro, mientras que los tokens de entrada y salida por fallo de caché de Pro cuestan algo más de tres veces más.
Pro frente a Flash: resumen rápido
Las especificaciones y los precios oficiales se han comprobado el 13 de agosto de 2026; las observaciones prácticas se basan en una sola ejecución por tarea y no constituyen pruebas de rendimiento oficiales.
Elige Flash cuando…
Si necesitas una solución a bajo coste, correcciones rutinarias del código, extracción, clasificación o numerosas solicitudes en paralelo, podrás validar operaciones aritméticas de alto riesgo y restricciones de formato.
Elige la versión Pro cuando…
El resultado combina código, políticas, finanzas o numerosas restricciones precisas, y el coste adicional es menor que el de un fallo sutil.
Pruebas prácticas: codificación, recuperación y cumplimiento de restricciones
El 13 de agosto de 2026 probamos ambos ID de modelo de API a través del mismo punto final de Broly Anywhere compatible con OpenAI. La temperatura era de 0. Cada resultado puntuado corresponde a una ejecución por modelo y tarea. El tiempo real incluye el retraso de la pasarela y el retraso ascendente, por lo que resulta útil como observación, pero no como una clasificación estable de la latencia.
Ficha de evaluación práctica
Tanto Pro como Flash han superado todas las pruebas fijas.
Tanto las respuestas como todas las referencias a los expedientes requeridas eran correctas.
Pro cumplió todas las reglas; Flash no cumplió los requisitos aritméticos ni de longitud.
Prueba 1: depuración de Python con agente
El harness proporcionaba a cada modelo cuatro herramientas —listar archivos, leer un archivo, escribir un archivo y ejecutar pruebas— dentro de un pequeño proyecto de Python de tres archivos dedicado a la fijación de precios. Esto se parece más al flujo de trabajo de un agente que a pedir un fragmento de código en el chat.
Depurar, aplicar parches y verificar un proyecto de cálculo de precios en Python
Ambos modelos siguieron la misma secuencia de seis llamadas, modificaron únicamente la implementación y generaron 8 aprobados. Flash completó esta prueba en 47,378 segundos, frente a los 95,228 segundos de Pro, y utilizó menos fichas devueltas. En este caso no hubo un ganador en cuanto a calidad. Para conocer otra perspectiva centrada en el código, consulta nuestro Prueba de programación en Python: DeepSeek frente a ChatGPT.

Prueba 2: recuperación de un expediente de aproximadamente 20,7 mil tokens
Adjuntamos un dossier que contenía más de 180 registros, distractores repetidos, borradores obsoletos y diez datos dispersos. El modelo tenía que responder siguiendo un formato exacto de diez líneas y citar un registro para cada respuesta.
Responde a un expediente controvertido con referencias precisas
Ambos modelos obtuvieron una puntuación de 22/22: diez respuestas correctas, diez citas correctas y dos puntos de formato. Pro completó esta prueba en 10,396 segundos y Flash en 21,737 segundos. El uso real de la solicitud fue de unos 20,7 mil tokens. Esto la convierte en una prueba de recuperación de longitud media útil, pero sí que no validar la ventana completa de 1 millón de tokens.

Prueba 3: un memorándum sobre la decisión de lanzamiento con criterios estrictos
Esta tarea combinaba un resumen de entre 120 y 180 palabras, una tabla exacta de cuatro filas, riesgos fijos y recuentos desconocidos, una decisión breve, un JSON válido y un cálculo de los costes del primer año a partir de notas de los departamentos de finanzas, jurídico, ingeniería, ventas, asistencia técnica y seguridad.
Elabora una nota de lanzamiento con reglas aritméticas y de formato estrictas
Con un límite de 2.048 tokens de finalización, ambos modelos agotaron el presupuesto de finalización disponible en el razonamiento devuelto y no generaron ninguna respuesta visible. Conservamos esos registros y, a continuación, volvimos a ejecutar la indicación sin cambios con un límite de 8.192 tokens. Pro obtuvo una puntuación de 12/12. Flash obtuvo una puntuación de 8/12 porque informó de $217 100 en lugar de $216 900, trasladó el error $200 a la varianza, y redactó un resumen de 94 palabras en lugar de las 120-180 palabras requeridas.

La conclusión es específica, no universal: Flash ya destacaba en las tareas de codificación y recuperación, mientras que Pro ofrecía mayor seguridad en la combinación más compleja de restricciones aritméticas, estructurales y de políticas. Si tu flujo de trabajo se basa en un shell de agente, nuestro Comparación entre OpenClaw, Claude y OpenCode ayuda a adaptar el modelo a la herramienta circundante.
Pruebas de rendimiento del DeepSeek V4: lo que demuestran los datos oficiales
La fuente de referencia más fiable es la Informe técnico DeepSeek V4, pero sus tablas y gráficos describen los modelos de V4 Preview. Son útiles para comprender las capacidades previstas de la arquitectura y la configuración de las pruebas; no se trata de puntuaciones independientes correspondientes a la versión de la API Pro-0813 de esa fecha.
Las puntuaciones preliminares no son las puntuaciones del Pro-0813
Arquitectura y resultados de pruebas de rendimiento de DeepSeek.
Versiones de producción obsoletas que figuran en la documentación de la API.
Las puntuaciones de vista previa no se pueden volver a etiquetar como puntuaciones Pro-0813.
La actualización Flash del 31 de julio también publica los resultados de los agentes e indica el entorno de pruebas, la configuración y la compatibilidad con Codex. Estos detalles son importantes porque las clasificaciones entre distintos proveedores pueden variar en función del andamiaje, el presupuesto de razonamiento, las definiciones de las herramientas y las reglas de reintento. Un resultado sin indicar su entorno de pruebas no es suficiente para declarar a un ganador incondicional.
Por la misma razón, nuestras tres tareas complementan los datos oficiales en lugar de sustituirlos. Te indican lo que ocurrió en un escenario concreto. Si estás comparando productos de agentes en lugar de limitarte a comparar las API de los modelos, nuestro Guía comparativa entre Codex y Claude explica por qué el flujo de trabajo circundante puede modificar la experiencia del usuario.
Precios de la API DeepSeek V4
Los precios de la API de DeepSeek son inusualmente agresivos en el momento del lanzamiento. La tabla siguiente recoge las cifras oficiales por millón de tokens consultadas el 13 de agosto de 2026. La página oficial también advierte de que los precios aumentarán significativamente en el futuro, por lo que hay que considerar estas cifras como datos anticuados propios de la época del lanzamiento.
Precio por 1 millón de tokens
Una carga de trabajo sencilla sin caché, con 10 millones de tokens de entrada y 2 millones de tokens de salida, tendría un coste de $1,96 en Flash y de $6,09 en Pro con estas tarifas. Este ejemplo no tiene en cuenta los aciertos en caché, los recargos de los proveedores, los reintentos ni ningún cambio posterior en los precios. Los equipos que comparen proveedores deberían utilizar una única combinación de tokens y una única base de facturación; nuestra Guía de precios de la API Claude Opus 4.6 muestra por qué la entrada, la salida y el almacenamiento en caché necesitan filas independientes.
Qué significa la ventana de contexto de 1M y cuáles son sus límites
Una ventana de contexto de 1 millón de tokens es una capacidad, no una garantía de recuperación perfecta en cada posición. Ofrece a la API margen para repositorios muy grandes, colecciones de documentos, paquetes de investigación o historiales de agentes. La cuestión de la calidad radica en si el modelo es capaz de recuperar el detalle adecuado cuando la evidencia relevante se encuentra oculta entre cientos de miles de tokens que distraen la atención.
El informe preliminar de DeepSeek incluye un gráfico de resolución de coreferencia en múltiples rondas (MRCR) con un rango de tokens de entrada que va desde los 8K hasta 1M. La curva se mantiene sólida en longitudes más cortas, pero desciende a partir de 128K. Esto es una prueba habitual de un problema grave relacionado con el contexto largo, y es la razón por la que “admite 1M” nunca debería interpretarse como “sin pérdidas a 1M”.”

La interfaz de la API tiene sus propias limitaciones. Las de DeepSeek Guía de la API de respuestas describe una implementación sin estado: características como id_de_la_respuesta_anterior, las conversaciones, el historial y el contexto no son compatibles. Tampoco se admiten entradas de imágenes ni de archivos, por lo que tendrás que extraer el texto o crear la capa de estado fuera del modelo.
En Tabla de API compatibles con Anthropic Asimismo, indica que las variantes de mensajes de imágenes y documentos no son compatibles. Por lo tanto, la compatibilidad se refiere a formatos de solicitud y herramientas habituales, y no a una paridad característica por característica con todos los modelos o clientes de Anthropic.

Cómo probar DeepSeek V4 Pro y Flash
Tienes tres opciones prácticas. Elige en función de si quieres una conversación rápida, control de la API de producción o un espacio de trabajo multimodelo.
Elige tu vía de acceso
DeepSeek Web/Aplicación
Lo mejor para probar el modelo a través de la propia interfaz de usuario de DeepSeek.
API oficial
Ideal para facturación por tokens, herramientas, JSON, marcos de trabajo para agentes y control de producción.
GlobalGPT
La mejor opción para abrir archivos Pro o Flash en un entorno de trabajo multimodelo más amplio sin tener que crear primero un cliente.
Canal 1: chat oficial de DeepSeek
Empieza por Página web oficial de DeepSeek si solo quieres conocer la experiencia actual del usuario. El acceso de los usuarios y la facturación de la API son dos cosas distintas; el hecho de que haya una interfaz de chat disponible no significa que la API sea gratuita.
Vía 2: API oficial y agentes de programación
Utilice deepseek-v4-pro o deepseek-v4-flash con las interfaces documentadas compatibles con OpenAI. Ambas admiten los modos «thinking» y «non-thinking», salida JSON, llamadas a herramientas, la API de respuestas y acceso compatible con Anthropic. FIM solo se aplica en el modo «non-thinking».
DeepSeek también publica un Guía oficial de integración de Codex. Si estás dudando entre qué shells de agente elegir primero, compara Claude: Precios y límites de uso del código antes de dar por hecho que el coste del token del modelo corresponde al importe total de la factura.

Los usuarios del código Claude pueden seguir la misma lógica de «punto final y modelo» descrita en nuestra guía sobre Configuración de un modelo en el código Claude, al consultar la tabla de compatibilidad en tiempo real de DeepSeek para detectar campos no compatibles.
Ruta 3: GlobalGPT
GlobalGPT cuenta con entradas específicas para ambos modelos. La ruta de conversión verificada es DeepSeek V4 Pro en GlobalGPT. También existe una página de producto en Flash, pero no hemos encontrado ningún parámetro de campaña específico para Flash que esté verificado, por lo que no vamos a inventarnos uno.


En el caso de los flujos de trabajo de terminal, el Configuración del código GlobalGPT CLI en Claude explica cómo una plataforma multimodelo puede integrarse en una rutina de programación ya existente. No sustituye a las herramientas nativas del repositorio, sino que cambia la forma de acceder a los modelos y compararlos.
¿Qué modelo DeepSeek V4 deberías elegir?
Adapta el modelo al coste del fallo
Flash
Elígelo para chats de gran volumen, extracción de datos, código rutinario, recuperación de información y agentes con una validación rigurosa. Superó a la perfección dos de nuestras tres tareas al precio oficial más bajo.
Pro
Elígelo cuando la aritmética rigurosa, el formato, las directrices y el razonamiento multidominio se den cita en un único trabajo. Fue el único modelo que obtuvo una puntuación de 12/12 en nuestro informe.
GlobalGPT
Elige la ruta de la plataforma cuando quieras probar el modelo o comparar alternativas sin tener que escribir primero un cliente de API.
Para muchos equipos, Flash es la opción más acertada para una primera implementación: es mucho más económica, admite los mismos límites de contexto y salida especificados, y ha superado nuestras pruebas de codificación y de recuperación de 20,7 K sin ninguna pérdida de calidad. Añade comprobaciones determinísticas de números, esquema y secciones obligatorias.
Pásate a la versión Pro cuando el tiempo dedicado a la revisión o el coste de los errores supere el ahorro que supone el uso de tokens. La diferencia de precio es real, pero también lo es el valor de conseguir que un informe de cumplimiento normativo o de lanzamiento sea perfecto a la primera. Si tu lista de candidatos incluye otros asistentes, la más amplia Guía para elegir entre el DeepSeek y el ChatGPT puede ayudar a diferenciar la calidad del modelo del ecosistema del producto.
Veredicto final
El DeepSeek V4 Flash es la mejor opción en relación calidad-precio; el DeepSeek V4 Pro es la actualización que te ofrece mayor seguridad. Ambos modelos demostraron un gran rendimiento en nuestras pruebas, y ninguno de los dos necesita un truco de 1 millón de tokens para resultar útil. Flash igualó a Pro en codificación agentiva y en la recuperación de textos de longitud media. Pro destacó cuando la tarea combinaba aritmética, estatus legal, estructura exacta, coherencia JSON y una regla estricta de recuento de palabras.
Las principales razones para actuar con cautela no son ningún secreto: todo apunta a que los precios actuales van a subir, la ventana de 1M no garantiza una recuperación sin pérdidas, las entradas de imágenes y documentos siguen sin ser compatibles con las capas de compatibilidad documentadas, y los gráficos de referencia de Preview no son las tablas de referencia de Pro-0813.
Empieza con Flash para trabajos validados y de gran volumen. Opta por la versión Pro cuando los errores salgan más caros que las fichas. Y si quieres comparar la experiencia antes de integrar una API, Prueba el DeepSeek V4 Pro en el GlobalGPT.
Preguntas frecuentes sobre DeepSeek V4
¿Se ha lanzado oficialmente la versión DeepSeek V4?
Sí. El 13 de agosto de 2026, la documentación oficial de la API de DeepSeek indicaba que DeepSeek-V4-Pro-0813 y DeepSeek-V4-Flash-0731 eran las versiones V4 actuales.
¿Cuál es la diferencia entre el DeepSeek V4 Pro y el V4 Flash?
Ambos ofrecen un contexto de 1M y una salida máxima de 384K. La versión Flash es más económica y tiene un límite de concurrencia más alto; la versión Pro es la de mayor calidad y obtuvo mejores resultados en nuestra prueba de memoria con múltiples restricciones.
¿Cuánto cuesta la API DeepSeek V4?
El 13 de agosto de 2026, Flash costaba $0,0028 de entrada con acierto en caché, $0,14 de entrada sin acierto en caché y $0,28 de salida por cada millón de tokens. Pro costó $0,003625, $0,435 y $0,87. DeepSeek advierte de que los precios subirán.
¿Es cierto que DeepSeek V4 admite realmente una ventana de contexto de 1 millón de tokens?
Sí, ambas versiones actuales indican una ventana de contexto de 1 millón de tokens. Se trata de un límite de capacidad, no de una garantía de recuperación perfecta: el informe «Preview» de DeepSeek muestra que el rendimiento de MRCR disminuye a longitudes extremas.
¿Puedo utilizar el DeepSeek V4 con Codex o el Claude Code?
Sí. DeepSeek documenta una configuración de Codex a través de su API de respuestas y ofrece una interfaz compatible con Anthropic para herramientas como Claude Code, aunque no es compatible con todos los campos ni todas las funciones de Anthropic.
¿El DeepSeek V4 es de código abierto o de peso abierto?
DeepSeek publica los pesos oficiales de la versión 4 e incluye una licencia del MIT en la ficha del modelo Pro. Para ejecutar el modelo Pro completo de forma local sigue siendo necesario disponer de una infraestructura considerable de almacenamiento, memoria e inferencia.
¿Puedo utilizar DeepSeek V4 de forma gratuita?
Es posible que DeepSeek ofrezca acceso al chat para consumidores, pero su API oficial se factura por tokens. El acceso a cualquier plataforma de terceros depende del plan actual de dicha plataforma, por lo que no debes considerar que el acceso web y la tarificación de la API son lo mismo.
¿Puedo utilizar la versión 4 de DeepSeek en GlobalGPT?
Sí. GlobalGPT cuenta con entradas específicas para DeepSeek V4 Pro y Flash. La ruta «Pro» verificada y con seguimiento abre el modelo directamente, mientras que la ruta general de GlobalGPT con seguimiento se puede utilizar cuando no se dispone de un enlace de campaña específico para Flash.




