Cómo crear prompts para Claude Sonnet 4.6 con 1M de tokens: estrategias que funcionan

Claude Sonnet 4.6 y su ventana de contexto de 1 millón de tokens cambian lo que es posible en una sola sesión de IA. Este artículo explica cómo estructurar entradas largas, usar prompts por fases y procesar bases de código completas, documentos legales y corpus de investigación sin perder calidad ni coherencia en miles de líneas de contenido.

Cómo crear prompts para Claude Sonnet 4.6 con 1M de tokens: estrategias que funcionan
Cristian Da Conceicao
Fundador de Picasso IA

Si te has visto limitado por lo que una IA puede retener en una sola conversación, la ventana de contexto de 1 millón de tokens de Claude Sonnet 4.6 supone un cambio real. No es una afirmación de marketing. Es un cambio tangible en lo que puedes hacer sin dividir tu trabajo en fragmentos, perder el hilo o empezar de cero.

La cuestión no es si esa capacidad existe. Existe. La cuestión es cómo aprovecharla bien. La mayoría de la gente carga un documento enorme y se pregunta por qué la respuesta sigue pareciendo superficial o pasa por alto detalles críticos de las secciones iniciales. Eso no es un fallo del modelo. Es un problema estructural.

Este artículo explica qué te permiten hacer realmente 1 millón de tokens, cómo estructurar entradas largas para que el modelo procese todo el contenido, qué tipos de tareas se benefician más y dónde están los límites reales de esta tecnología.

Tokens y contenido extenso en la pantalla de un equipo portátil

Qué significan realmente 1 millón de tokens

Antes de entrar en las tácticas, conviene traducir las cifras a algo concreto. Los tokens no son palabras, pero se acercan lo suficiente para hacer estimaciones: aproximadamente 750 palabras por cada 1000 tokens, o 1 token por cada 0,75 palabras de media.

Cantidades reales de tokens

Tipo de contenidoTokens aproximados
Novela media (90 000 palabras)~120 000 tokens
Base de código Python completa (50 archivos)~200 000 tokens
Contrato legal (150 páginas)~75 000 tokens
Artículo académico (8000 palabras)~10 000 tokens
Manual técnico de 500 páginas~375 000 tokens
Base de código completa de una aplicación de tamaño mediano~400 000–600 000 tokens

Qué cabe en 1 millón de tokens

Un millón de tokens significa que puedes tener unas 750 000 palabras en una sola sesión. Eso equivale a:

  • 8 novelas completas al mismo tiempo
  • Una declaración jurada de 3500 páginas en una sola pasada
  • El código fuente completo de una aplicación en producción con su documentación
  • Un año entero de transcripciones de reuniones corporativas
  • Varios libros sobre el mismo tema, cruzados entre sí

💡 La idea clave: 1M de tokens no es para un solo documento largo. Es para corpus enteros que antes requerían varias sesiones y unir resultados a mano.

La diferencia entre una ventana de contexto de 128K y una de 1M no es solo de escala. Es la diferencia entre resumir un capítulo y leer el libro entero antes de responder. Entre hojear un contrato y leer de verdad cada cláusula.

Configurar Claude Sonnet 4.6 para trabajos largos

Hay una diferencia entre acceder a la ventana de contexto de 1M y usarla bien. La fase de configuración importa más de lo que la mayoría cree. Enviar un millón de tokens sin estructura es como entregar a alguien una caja de hojas sueltas y pedirle que resuma el libro.

API frente a interfaz de chat

La ventana de contexto de 1M está disponible tanto en la API como en la interfaz de Claude.ai, pero el comportamiento cambia de forma notable. En la API controlas el contexto de manera explícita. En la interfaz web, la gestión del contexto se hace automáticamente y con menos control detallado.

Para trabajos largos, la API te ofrece tres ventajas clave:

  1. Recuento explícito de tokens antes de enviar, usando el endpoint count_tokens
  2. Colocación del prompt de sistema para anclar el comportamiento del modelo antes de cualquier contenido
  3. Respuestas en streaming que te permiten supervisar la calidad de la salida en tiempo real al generar textos muy largos

Si usas Claude Sonnet 4.6 a través de la interfaz de chat, pega primero el material de referencia más importante, antes de tu pregunta, para que quede en la parte inicial del contexto, donde la atención es más fuerte.

Notas de planificación escritas a mano junto a un equipo portátil con texto largo

Cómo estructurar tu entrada

Los contextos largos se degradan siguiendo un patrón concreto. El rendimiento con el contenido del principio y del final de la ventana tiende a ser mejor que con el contenido enterrado en el medio. Esto se conoce como el fenómeno de "perdido en el medio", y afecta a todos los modelos de contexto amplio en mayor o menor grado.

Estructura tu entrada para contrarrestarlo:

  • Pon el material de referencia más importante al principio, no enterrado en el medio
  • Define tu tarea con claridad al principio y al final de una entrada larga
  • Usa encabezados de sección explícitos dentro de los documentos pegados para que el modelo pueda referirse a ellos por nombre
  • Especifica el formato de salida antes del contenido, no después
  • Evita el relleno repetitivo al inicio del contexto, porque diluye la señal de importancia de tus datos reales

💡 Regla práctica: si tu entrada supera los 100 000 tokens, repite tu pregunta principal al final del prompt. El modelo acaba de procesar todo tu contenido, así que la pregunta estará fresca cuando empiece a generar la respuesta.

5 tipos de tareas que más se benefician

No todas las tareas necesitan 1M de tokens. Muchas funcionan perfectamente con 8K o 32K. Pero estas cinco categorías mejoran de forma real y medible con un contexto grande, y representan los casos en los que los modelos de la generación anterior se quedaban claramente cortos.

Análisis de bases de código

Probablemente es el caso de uso más sólido. Cuando puedes cargar un repositorio completo, con pruebas, archivos de configuración y documentación, el modelo puede rastrear dependencias, detectar incoherencias de arquitectura y proponer refactorizaciones teniendo en cuenta todos los efectos posteriores.

Lo que funciona bien con 1M:

  • "Encuentra todos los lugares donde se llama a esta función e identifica los llamadores que pasan tipos de argumento incorrectos"
  • "Rastrea el flujo de datos desde este endpoint de la API hasta la capa de base de datos, incluidas todas las transformaciones intermedias"
  • "Identifica qué módulos tienen dependencias circulares y propón un orden de resolución"
  • "Revisa todo el manejo de errores de esta base de código para comprobar su coherencia y enumera los casos límite sin gestionar"

Lo que todavía tiene límites:

  • Hacer cambios en más de 50 archivos en una sola pasada (la salida sigue necesitando dividirse para editarla de verdad)
  • Razonar sobre el comportamiento en tiempo de ejecución solo a partir del código estático, sin contexto de ejecución

Desarrolladora de software ante una configuración de tres monitores con muros de código con resaltado de sintaxis

Revisión de documentos largos

Acuerdos legales, artículos de investigación médica, especificaciones técnicas, informes financieros, presentaciones regulatorias. Documentos en los que una cláusula omitida o una incoherencia escondida en la página 87 sí importa.

Claude Sonnet 4.6 puede procesar un contrato completo en una sola sesión y responder preguntas que exigen cruzar secciones separadas por 200 páginas. Compáralo con el enfoque anterior: dividir el documento, resumir cada fragmento, unir los resúmenes y perder precisión en cada paso. Cuando por fin tienes una respuesta, ha pasado por tres rondas de compresión con pérdidas.

Con 1M de tokens, haces una pregunta y obtienes una respuesta con citas directas del material original.

Mujer profesional revisando un documento legal impreso y extenso con un marcador en su escritorio

Investigación en varios pasos

Cuando trabajas con varias fuentes sobre un mismo tema, la ventana de 1M te permite cargarlo todo a la vez: el artículo principal, los argumentos contrarios, los estudios de apoyo, los anexos con datos brutos y las secciones de metodología de todos ellos. Después puedes hacer preguntas que exigen una síntesis real entre todas las fuentes, en lugar de recuperar información de una sola.

Es un tipo de asistencia para la investigación cualitativamente distinto. No preguntas "¿qué dice el artículo A?". Preguntas "¿en qué coinciden los artículos A, B y C, y en qué punto el artículo D introduce un hallazgo contradictorio?". Eso requiere acceso simultáneo a los cuatro documentos.

Resumen de libros o informes

Resumir un solo libro es trivial para cualquier LLM moderno. Lo que antes era difícil: resumir un libro y, al mismo tiempo, cruzarlo con otros tres sobre el mismo tema para identificar dónde coinciden los autores y dónde divergen. Con 1M de tokens, eso es un único prompt en lugar de seis sesiones separadas con comparación manual.

En los informes anuales, esto significa cargar el Q1 hasta el Q4 a la vez y pedir una narrativa coherente del año completo, en lugar de cuatro resúmenes separados que tengas que conciliar tú mismo.

💡 Consejo avanzado: al resumir documentos largos, pide primero un esquema sección por sección y después el resumen completo. La pasada del esquema prepara al modelo para procesar la estructura antes de sintetizar el contenido, y te da una hoja de ruta con la que comprobar el resultado final.

Extracción de datos a gran escala

Extraer datos estructurados de corpus de texto masivos y desordenados: cientos de páginas de respuestas de encuestas, transcripciones de entrevistas, notas clínicas o tickets de soporte al cliente. El contexto de 1M te permite definir el esquema de extracción una sola vez, aportar decenas de ejemplos en el propio contexto y procesar el corpus entero en una sola pasada, en lugar de dividirlo en lotes y conciliar resultados que se generaron sin saber unos de otros.

Estrategias de prompting que funcionan a escala

Los consejos habituales de prompting funcionan bien con 4K tokens. Con 500K tokens, rigen otras reglas. Las estrategias que funcionan en contextos cortos pueden perjudicar activamente el rendimiento en los largos.

Pon las instrucciones al principio

En un contexto corto, dar las instrucciones al final funciona bien. En un contexto muy largo, las instrucciones enterradas tras 400 000 tokens de contenido pueden perder peso en la salida final. El modelo ha procesado una cantidad enorme de material desde que vio tus instrucciones.

Coloca tus instrucciones de nivel de sistema en los primeros 1000 tokens de tu prompt:

  1. Definición de la tarea (qué quieres, con precisión)
  2. Formato de salida (estructura, extensión, estilo)
  3. Tono y restricciones ("cita los números de sección", "no especules más allá del texto proporcionado")
  4. Restricciones negativas ("no resumas lo que ya te he contado")
  5. Después, pega tu contenido

Manos concentradas escribiendo rápido en un teclado mecánico con una iluminación cálida de fondo

Usa anclajes y puntos de referencia

En entradas muy largas, dale al modelo referencias explícitas a las que volver. Si envías un documento de 300 páginas, añade etiquetas de sección como [SECTION-12] o [CLAUSE-4.3] al inicio de cada sección importante. Cuando el modelo cite algo, podrá referirse a estas etiquetas en lugar de a descripciones vagas, y tú podrás comprobar que ha encontrado el contenido correcto.

Esto también te ayuda a auditar la salida. Si el modelo menciona [SECTION-23] en su respuesta, puedes verificar si interpretó bien esa sección concreta. Crea una capa de verificabilidad que la recuperación abierta no tiene.

Divide la tarea en fases

Incluso con 1M de tokens, el razonamiento complejo se beneficia de una salida por etapas. En lugar de pedir un análisis completo de una sola vez, estructúralo así:

Fase 1: "Lee el siguiente documento y enumera, textualmente, todas las afirmaciones de la sección de metodología." Fase 2: "Con base en esa lista, identifica qué afirmaciones están respaldadas por citas en otra parte del documento." Fase 3: "Para las afirmaciones sin respaldo, evalúa si el contexto que las rodea las hace plausibles o especulativas."

Cada fase se apoya en la anterior. La salida de la Fase 1 se convierte en contexto para la Fase 2. Este enfoque produce con regularidad resultados más precisos y más verificables que un prompt único sobre contenido largo, porque obliga al modelo a dar pasos de razonamiento estructurados en lugar de intentar hacerlo todo en una sola pasada de generación.

Tres profesionales alrededor de una mesa de conferencias cubierta de informes, en una intensa discusión de colaboración

Evitar errores comunes

El problema del sesgo de recencia

Cuando un modelo ha procesado 800 000 tokens antes de responder a tu pregunta, dará de forma natural más peso al contenido más reciente. Esto no es exclusivo de Claude Sonnet 4.6. Es una propiedad de la atención en las arquitecturas transformer, y afecta a todos los modelos de contexto largo.

Estrategias para mitigarlo:

  • Indica explícitamente al modelo que use todo el documento: "Responde a esta pregunta usando información de cualquier parte del material proporcionado, no solo de la sección más reciente."
  • En documentos cuya información crítica está repartida, pide de forma explícita: "Antes de responder, identifica los tres pasajes más relevantes de partes distintas del documento."
  • Repite tu restricción más importante al final de un prompt largo, justo antes de que el modelo empiece su respuesta.

Cuenta los tokens antes de enviar

Enviar 1,2M de tokens cuando el límite de contexto es 1M hará que se trunque el principio de tu contenido. Es la peor ubicación posible para un truncamiento, porque pierdes tus instrucciones de anclaje. Cuenta siempre antes.

Con la API de Anthropic:

import anthropic

client = anthropic.Anthropic()

response = client.messages.count_tokens(
    model="claude-sonnet-4-6",
    messages=[{"role": "user", "content": your_long_text}]
)
print(f"Token count: {response.input_tokens}")

Si superas el límite, recorta desde el medio de tu contenido en lugar de desde el principio o el final. Tus instrucciones iniciales y tu pregunta final son las dos partes que más sostienen el prompt.

Editor de código con tema oscuro en un monitor de 32 pulgadas que muestra cientos de líneas de Python con resaltado de sintaxis

Cuándo dividir frente a enviarlo todo de una vez

1M de tokens no siempre es la mejor opción. El costo por llamada aumenta de forma notable con tamaños de contexto muy grandes, y algunas tareas rinden igual de bien en ventanas más pequeñas si se estructuran con cuidado. Considera dividir tu contenido cuando:

  • La calidad de la salida importa más que la coherencia entre documentos: el procesamiento por fragmentos con una ingeniería de prompts cuidadosa puede superar a una pasada única en contenido muy fragmentado y sin interdependencias
  • Necesitas trazabilidad en cada paso: el procesamiento dividido te da salidas intermedias que puedes revisar y validar antes de continuar
  • El costo es una limitación: con 1M de tokens de entrada por llamada, el costo por solicitud es considerable. Para tareas que solo necesitan contexto parcial, una ventana más pequeña resulta más económica
  • El contenido es realmente independiente: si las secciones no se referencian entre sí, no hay ningún beneficio en cargarlas juntas

Envíalo todo de una vez cuando:

  • El cruce de referencias entre secciones sea esencial para la respuesta
  • No puedas permitirte la pérdida de información que provoca el resumen
  • Mantener el hilo a lo largo de todo el documento sea el objetivo principal de la tarea

Riesgo de alucinación a escala

Un hallazgo contraintuitivo: los contextos muy largos pueden aumentar el riesgo de alucinación en detalles concretos, aunque la comprensión general mejore. Cuando un modelo procesa una cantidad enorme de texto, puede confundir detalles parecidos de secciones distintas o generar datos específicos verosímiles que nunca estuvieron en la fuente.

La solución consiste en pedir siempre citas directas en lugar de paráfrasis cuando la precisión en detalles concretos importa. "Cita el texto exacto del documento que respalda esta afirmación" es un prompt más fiable que "¿Qué dice el documento sobre X?".

Persona leyendo un libro grueso de tapa dura mientras un equipo portátil está abierto a su lado en un sofá de lino con luz de la tarde

Claude Sonnet 4.6 frente a otros modelos de contexto largo

La ventana de contexto de 1M no es exclusiva de Claude Sonnet 4.6, pero lo que hace el modelo dentro de esa ventana varía mucho entre proveedores. Tener un recipiente grande no significa que puedas llenarlo bien.

Cómo se comparan los modelos

ModeloContexto máximoPrecisión en contexto largoVelocidadMejor para
Claude Sonnet 4.61M de tokensMuy altaRápidaTrabajo equilibrado con contexto largo
Claude Opus 4.7200K de tokensLa más altaMás lentaRazonamiento profundo sobre contenido denso
Claude Opus 4.6200K de tokensAltaModeradaTareas de análisis complejas
Claude 4 Sonnet200K de tokensAltaRápidaProgramación y razonamiento estructurado
GPT 5128K de tokensAltaRápidaTareas de contexto largo más cortas
Gemini 3 Pro1M de tokensAltaRápidaDocumentos multimodales de contexto largo
DeepSeek R1128K de tokensModeradaRápidaTareas de razonamiento paso a paso

Profesional con una mesa de pie revisando informes encuadernados en una oficina moderna y minimalista

Dónde gana Claude Sonnet 4.6

Tres ámbitos en los que Claude Sonnet 4.6 supera con regularidad a las alternativas con contexto largo:

1. Seguimiento de instrucciones a distancia. Sigue con la tarea aunque la instrucción original se diera hace 900 000 tokens. Esto es más difícil de lo que parece. Muchos modelos se desvían de sus restricciones a medida que crece el contexto; Claude Sonnet 4.6 es notablemente estable.

2. Precisión en las citas. Cuando se le pide que cite pasajes concretos, copia el texto literal en lugar de parafrasearlo y tergiversarlo. En trabajo legal, médico o de investigación, donde la precisión importa, esto es fundamental.

3. Coherencia en salidas largas. Generar un análisis de 10 000 palabras sobre una entrada de 500 000 tokens sin perder el hilo, sin repetirse ni contradecir lo dicho antes en la misma respuesta. La salida larga sobre una entrada larga es donde los modelos menos capaces fallan de forma más visible.

💡 Cuándo elegir Opus: si tu tarea exige un razonamiento profundo paso a paso sobre un documento más corto pero muy denso, Claude Opus 4.7 puede ofrecer un análisis más completo a pesar de su ventana menor. La profundidad de razonamiento y la amplitud de contexto son capacidades distintas, y a veces gana la profundidad.

Cómo encaja PicassoIA

PicassoIA te da acceso a Claude Sonnet 4.6 junto con toda la línea de modelos de Anthropic y otros LLM líderes en una sola interfaz. Esto importa porque distintas tareas de contexto largo requieren realmente distintos modelos. Para una revisión de código, Claude Sonnet 4.6 con 1M de tokens es probablemente tu mejor opción. Para un artículo filosófico denso de 80 páginas que exige un análisis lógico profundo, quizá te convenga Claude Opus 4.7. Para una tarea de investigación que combine imágenes y gráficos con texto, Gemini 3 Pro cobra relevancia.

Tenerlos todos disponibles sin cambiar de cuenta ni gestionar claves de API separadas es una ventaja de flujo de trabajo real cuando trabajas a diario con distintos tipos de contenido.

Ponlo en práctica ahora mismo

La verdadera prueba de cualquier modelo de contexto largo no es un benchmark. Es el documento concreto que llevas posponiendo porque era demasiado grande para procesarlo bien.

Ese contrato que llevas leyendo a trozos. Esa base de código que solo has revisado en parte. Ese corpus de artículos de investigación guardado en una carpeta porque sintetizarlos a mano llevaría días. Para estas tareas se diseñó realmente Claude Sonnet 4.6 con 1M de tokens.

Las tácticas de este artículo, estructurar las entradas con instrucciones al principio, usar etiquetas de anclaje explícitas, dividir el razonamiento en fases y contar los tokens antes de enviar, no son teóricas. Son la diferencia entre obtener un vistazo superficial a tu contenido y un análisis profundo y preciso de todo él.

Empieza por tu documento más difícil. Cárgalo completo. Haz la pregunta que llevas evitando. La capacidad está ahí. Úsala en PicassoIA y mira lo que cambia cuando el contexto deja de ser el límite.

Compartir este artículo

Elige tu idioma