Chatea con DeepSeek-V4-Flash

AI ChatDeepSeek-V4-Flash

¿Qué es DeepSeek-V4-Flash?

DeepSeek lanzó la versión preliminar de V4 Flash el 24 de abril de 2026 como modelo de texto con 284.000 millones de parámetros totales y 13.000 millones activos, pensado para razonamiento a bajo coste y agentes. El 31 de julio publicó DeepSeek-V4-Flash-0731 en beta pública tras un nuevo posentrenamiento, sin cambiar arquitectura, tamaño ni nombre de API. Comprobado el 8 de septiembre de 2026: `deepseek-v4-flash` apunta a 0731. La actualización solo afectó a la API Flash; DeepSeek indicó que App/Web no cambiaron entonces. La API actual separa Pro-0813, y `deepseek-v4-flash-vision-exp` es otro modelo experimental. Flash normal solo admite texto: no hereda las imágenes de Vision. Esta página prepara una petición para Ottermind Studio; no confirma la disponibilidad en tu cuenta ni selecciona DeepSeek automáticamente.

Contexto, salida y controles

  • Una gran ventana de texto, no de imágenes: La tabla actual de modelos indica un contexto de 1 millón de tokens y salida máxima de 384.000, además de JSON, llamadas de herramientas, Responses API y API Anthropic. Son límites de API, no garantía de recordar cada detalle. Las imágenes corresponden al Vision experimental separado.
  • Tarifas punta y valle de la API: En horas punta, Flash cuesta 0,014 $ por millón de tokens de entrada en caché, 0,44 $ sin caché y 1,32 $ de salida. Fuera de punta cuesta la mitad. El pico es lunes-viernes, 01:00-04:00 y 06:00-10:00 UTC; el resto es valle. Son tarifas API de DeepSeek, no precios de Ottermind, y pueden cambiar.
  • Ajusta el esfuerzo a la tarea: La guía de pensamiento lo activa por defecto en high; los niveles actuales son low, high y max. Medium y xhigh se asignan a high. En este modo, temperature y top-p no tienen efecto, y las conversaciones con herramientas deben devolver bien el razonamiento previo. Las interfaces pueden variar.

Cuatro tareas para continuar en Ottermind

Empieza con la menor muestra de texto útil y una condición de aceptación. Studio continúa la conversación; utiliza archivos o un modelo concreto solo si la interfaz elegida los ofrece de verdad.

  • Arreglar un fallo sin ampliar el cambio

    Pega en Ottermind la función que falla, el error y la prueba cercana; pide un parche mínimo que conserve el comportamiento indicado. Ejecuta la prueba y revisa el diff. En Studio, devuelve el fallo exacto o la línea indeseada y limita la corrección a esa discrepancia.

  • Rastrear un agente que repite una herramienta

    Pega llamadas, respuestas y esquema de herramienta anonimizados. Pregunta dónde se perdió un argumento o empezó el bucle. Contrasta cada afirmación con la traza; después lleva a Studio el primer evento incorrecto y pide una llamada revisada con prueba de regresión.

  • Comparar dos revisiones largas de una política

    Pega las cláusulas antiguas y nuevas con etiquetas estables y pide un registro con citas, impacto y ambigüedades. Comprueba cada cita en los originales. Luego pide en Studio que rehaga solo la fila sin respaldo o convierta un cambio confirmado en lista de responsable y fecha.

  • Convertir una reunión en acciones con responsables

    Pega el fragmento, etiquetas de hablantes y campos de responsable, acción, fecha y evidencia. Pide null si falta un dato. Verifica hablantes y fechas en la fuente; devuelve a Studio cualquier fila equivocada y solicita una corrección puntual sin inventar compromisos.

¿Flash o Pro para esta tarea?

CriterioDeepSeek-V4-FlashDeepSeek-V4-Pro
Versión API actualDeepSeek-V4-Flash-0731DeepSeek-V4-Pro-0813
Entrada punta: caché / sin caché0,014 $ / 0,44 $ por 1M tokens0,044 $ / 1,32 $ por 1M tokens
Salida punta1,32 $ por 1M tokens3,96 $ por 1M tokens
Prueba útil para decidirEjecuta una tarea limitada de código o extracción; mide correcciones, latencia y tokensEjecuta el mismo caso difícil; paga más solo si menos reintentos o mejor cobertura lo justifican

Haz útil el bajo coste

Dónde experimentar

  • Ciclos de código inspeccionables: Los parches pequeños y pruebas explícitas encajan con el entrenamiento orientado a agentes sin quitarte control. Conserva el código aceptado y devuelve un solo caso fallido en vez de reiniciar una tarea amplia.
  • Texto largo con referencias estables: El millón de tokens permite conjuntos mayores, pero IDs de sección, citas y campos obligatorios hacen auditable la respuesta. Pide el ancla de origen para toda afirmación importante.

Dónde ser prudente

  • Las reglas necesitan comprobaciones ejecutables: Las instrucciones largas aún pueden omitirse. Convierte las reglas críticas en lista breve, pruebas o esquema estricto y rechaza resultados que fallen, en vez de suponer que el prompt se obedeció.
  • Longitud de contexto no equivale a precisión: Una entrada grande aún puede perder un matiz, confundir al hablante o concluir sin respaldo. Revisa el pasaje y compara el coste total, incluidos reintentos, antes de elegir Flash, Pro u otro modelo.

Qué contaron usuarios en dos versiones

Son experiencias individuales en interfaces y despliegues distintos, no benchmarks controlados. Abril trata de Preview; los informes posteriores tratan de 0731 y no predicen la latencia actual ni tu resultado.

Mejor uso de herramientas, velocidad según la tarea

En una prueba personal del 24 de abril, Comfortable-Rock-498 describió trabajo preciso con varias herramientas, una rama propia de Cline y la API oficial, pero generación lenta y minutos de pensamiento en Preview. Tras 0731, un usuario de VS Code Copilot observó menos desvíos y más soluciones al primer intento. Los entornos impiden una comparación directa.

Siguen siendo posibles fallos de instrucciones y texto

Tras 0731, Juulk9087 informó que su instalación local de precisión completa ignoraba reglas; el hilo incluye experiencias API y locales diferentes. Otro informe de LocalLLaMA mostró contexto omitido y confusión de hablantes en actas. Son casos locales individuales: usa tus propias muestras y controles.

Del prompt al resultado comprobado

1

Aporta evidencia y un límite

Empieza con una función fallida, pasaje etiquetado o traza anonimizada. Indica la salida, los hechos a conservar y una comprobación ejecutable.

2

Continúa en Studio

Abre Ottermind Studio e inicia sesión si hace falta. Elige DeepSeek-V4-Flash solo si tu cuenta lo ofrece. La transición lleva el prompt; no sube archivos, no elige modelo ni demuestra acceso a la API.

3

Devuelve la discrepancia exacta

Ejecuta la prueba o contrasta citas, responsables y fechas. Pega solo el elemento fallido y pide una revisión focalizada que conserve el trabajo aceptado.

Preguntas sobre DeepSeek-V4-Flash

¿Qué versión de DeepSeek-V4-Flash usa la API?

A 8 de septiembre de 2026, `deepseek-v4-flash` apunta a DeepSeek-V4-Flash-0731. DeepSeek describió el 31 de julio como actualización API beta pública con nuevo posentrenamiento y misma arquitectura y tamaño que Preview. El aviso dijo que App/Web no cambiaron, así que no demuestra que 0731 esté allí.

¿DeepSeek-V4-Flash lee imágenes?

El `deepseek-v4-flash` normal solo admite texto. Las imágenes corresponden al modelo experimental separado `deepseek-v4-flash-vision-exp`. Esta página no sube imágenes ni cambia de modelo; proporciona texto salvo que la interfaz ofrezca explícitamente Vision.

¿Cuánto cuesta la API de DeepSeek?

En Flash, el pico actual por millón de tokens es 0,014 $ de entrada en caché, 0,44 $ sin caché y 1,32 $ de salida; fuera de punta, la mitad. El pico es lunes-viernes, 01:00-04:00 y 06:00-10:00 UTC. Es facturación API DeepSeek, no precio o suscripción de Ottermind.

¿Uso low, high o max?

DeepSeek documenta low, high y max, con high por defecto. Empieza en low para extracción acotada, usa high para agentes cotidianos y reserva max para casos difíciles tras medir calidad, latencia y salida. Un producto de chat puede mostrar controles distintos.

Trae un resultado que puedas comprobar

Lleva la fuente, el resultado esperado y el criterio de aceptación a Ottermind Studio.