Caracteres · Tokens · Oraciones · Superposición

Divisor de Texto

Divide cualquier texto en partes que caben en un límite: caracteres, palabras, tokens exactos, oraciones, párrafos, líneas o partes iguales. Superposición, etiquetas, copia y descarga.

0Partes
0Caracteres de entrada
0Parte más larga (caracteres)
0Tokens (o200k)
Partes

El conteo de tokens usa el mismo tokenizador o200k del Contador de Tokens (se carga al primer uso, unos 2 MB). Los límites de oración siguen las reglas de idioma de tu navegador.

Publicidad

Qué hace el Divisor de Texto

Pega un texto largo y recíbelo en partes que caben, cada una, dentro del límite que elijas. El límite puede ser de caracteres, palabras, tokens exactos, oraciones, párrafos o líneas, o puedes pedir un número fijo de partes iguales. Cada parte trae su propio botón de copiar y su cuenta de caracteres, palabras y tokens; un clic copia todas las partes en orden y otro las descarga como archivo de texto. No se sube nada: la división, la detección de oraciones y el conteo de tokens ocurren en tu navegador.

Una aclaración, porque el nombre se presta a confusión: esta herramienta divide un texto en partes o fragmentos, no en columnas. Para repartir un texto en dos columnas de Word o separar el contenido de una celda de Excel, la función está en esos programas. Aquí el trabajo es otro: un prompt que debe caber en la ventana de contexto de un modelo, un documento que hay que fragmentar para embeddings y búsqueda, una publicación que supera el tope de una plataforma, un mensaje que excede un SMS, una transcripción que varias personas revisarán a la vez. En todos esos casos lo difícil no es contar sino cortar bien, y por eso los valores predeterminados conservan enteras las palabras y las oraciones y te dejan añadir superposición y etiquetas.

Siete maneras de dividir

ModoQué significa el campo de tamañoIdeal para
CaracteresMáximo de caracteres por parteCampos con límite de caracteres, SMS, publicaciones en redes, formularios
PalabrasMáximo de palabras por parteLectura por partes, colas de revisión, lotes de traducción
Tokens (o200k)Máximo de tokens por parte, contados con el mismo tokenizador que GPT-5, GPT-4.1 y GPT-4oPrompts, ventanas de contexto, fragmentos para embeddings y recuperación
OracionesOraciones por parteFragmentos finos, subtítulos, revisión oración por oración
PárrafosPárrafos por parteRespetar la estructura del autor; un párrafo por parte es una unidad habitual de recuperación
LíneasLíneas por parteRegistros, listas, filas CSV, código, todo lo que ya viene a un elemento por línea
Partes igualesNúmero de partesRepartir un trabajo entre personas o sesiones; cada parte termina en un límite de oración o de palabra

La superposición, y por qué la usan los fragmentadores

Cuando un texto se corta en partes para un buscador o para un modelo de lenguaje, un dato que cae justo en la frontera puede perderse: una mitad en una parte, la otra en la siguiente, y ninguna sirve sola. La superposición lo resuelve repitiendo la cola de cada parte al comienzo de la siguiente. La guía de Microsoft para fragmentar documentos antes de una búsqueda vectorial propone como punto de partida razonable un fragmento de tamaño fijo de, por ejemplo, 200 palabras o 600 caracteres, con cierta superposición, por ejemplo, del 10 al 15 % del contenido. El campo de superposición usa la misma unidad que el modo: caracteres en el modo de caracteres, tokens en el de tokens, oraciones enteras en el de oraciones. En los modos por unidad, la herramienta arrastra palabras u oraciones completas, no un corte crudo, para que la cola repetida siempre se lea como texto.

Oraciones y palabras enteras

Cortar en una cuenta exacta es fácil; cortar bien no lo es. Un punto puede cerrar una oración, marcar una abreviatura o vivir dentro de un número, y el estándar Unicode de segmentación de texto (UAX #29) lo dice sin rodeos: el punto se usa de forma ambigua. Con Mantener oraciones enteras activado, la herramienta empaqueta oraciones completas en cada parte y solo corta dentro de una oración cuando esa oración sola es más larga que toda la parte, y en ese caso te lo avisa. Los límites de oración los pone el segmentador integrado de tu navegador (Intl.Segmenter), que aplica reglas propias de cada idioma, con un mecanismo de respaldo basado en reglas para navegadores antiguos. Mantener palabras enteras hace lo mismo a nivel de palabra en el modo de caracteres, para que ninguna parte termine a mitad de una palabra.

Dividir por tokens para modelos de lenguaje

Los modelos de lenguaje miden el texto en tokens, no en caracteres, y un token no es una palabra: en prosa inglesa un token equivale a unos cuatro caracteres, pero el código, otros idiomas y las palabras poco frecuentes mueven esa proporción, así que contar caracteres es solo una aproximación. El modo de tokens cuenta con la codificación o200k, la misma que usan GPT-5, GPT-4.1 y GPT-4o, exactamente como lo hace nuestro Contador de Tokens, de modo que una parte de 500 tokens son 500 tokens para esos modelos. Claude y Gemini usan sus propios tokenizadores; para ellos toma la cuenta como una estimación cercana y deja margen. Los modelos de embeddings tienen límites de entrada estrictos, por ejemplo 8192 tokens en los modelos text-embedding-3 de OpenAI, y la recuperación funciona mejor con fragmentos mucho más pequeños que eso, que es para lo que existe este modo.

Dividir para plataformas con límite de caracteres

Algunos límites se miden en caracteres, no en tokens. Un SMS lleva 160 caracteres del alfabeto GSM de 7 bits definido en la especificación 3GPP TS 23.038, y solo 70 cuando el mensaje contiene caracteres fuera de ese alfabeto y debe enviarse en UCS-2; por eso una palabra con tilde o un emoji puede duplicar el número de mensajes. X admite publicaciones de hasta 280 caracteres, y algunos caracteres cuentan doble. Los campos de formulario, las meta descripciones y las fichas de las tiendas de aplicaciones tienen cada uno su propio tope. El modo de caracteres con Mantener palabras enteras y las etiquetas activadas produce partes que caben y se leen en orden; si la plataforma cuenta de una manera poco habitual, comprueba cualquier parte con el Contador de Caracteres.

Cómo sacarle partido

Elige la unidad que el destino cuenta de verdad: tokens para un modelo, caracteres para un campo, párrafos cuando la estructura del autor importa. Fija el tamaño un poco por debajo del límite real, para dejar sitio a las etiquetas y a las diferencias entre tokenizadores. Añade superposición solo cuando las partes se vayan a buscar o resumir por separado; para un texto que alguien leerá en orden, la superposición es ruido. Deja las etiquetas activadas siempre que las partes viajen separadas. Después mira la parte más larga en la fila de estadísticas: si una parte es mucho mayor que las demás, la forzó una oración o un párrafo largo, y un tamaño menor o la opción a nivel de palabra lo emparejará. Para contar el texto completo antes, usa el Contador de Palabras; para limpiar una respuesta de IA antes de dividirla, el Limpiador de Texto IA.

Privacidad y límites

El divisor es JavaScript que se ejecuta en tu dispositivo. Tu texto no se envía a ningún lado, nada se guarda, y el tokenizador es un archivo servido desde este sitio que se carga solo cuando eliges el modo de tokens o cuando aparecen las partes, así que la cuenta puede verse pendiente un segundo la primera vez. La herramienta es determinista y funciona por reglas: no entiende el significado, así que no puede mantener junto un tema como lo haría un fragmentador semántico, y no conoce las reglas exactas de conteo de tu plataforma. Lo que garantiza es que cada parte respeta el tamaño que fijaste, termina en un límite de palabra u oración cuando se lo pides y llega etiquetada y en orden.

Preguntas frecuentes

¿Cómo divido un texto largo en fragmentos?

Pégalo en el Divisor de Texto, elige la unidad que cuenta el destino (caracteres, palabras, tokens, oraciones, párrafos o líneas), fija el máximo por parte y, si las partes se van a buscar por separado, una superposición. Cada parte tiene su botón de copiar; Copiar todo y Descargar .txt las entregan en orden con etiquetas [1/N].

¿Qué tamaño de fragmento conviene para RAG o embeddings?

Depende del modelo de embeddings y de lo específicas que sean tus consultas, pero la guía de Microsoft para fragmentar documentos antes de una búsqueda vectorial da como punto de partida un tamaño fijo de, por ejemplo, 200 palabras o 600 caracteres con una superposición del 10 al 15 %, y los modelos text-embedding-3 de OpenAI aceptan como máximo 8192 tokens por entrada. Usa el modo de tokens para que el tamaño que fijes sea el que ve el modelo.

¿Qué hace la superposición?

Repite el final de cada parte al comienzo de la siguiente, para que una oración o un dato que cae en la frontera aparezca entero al menos en una parte. Importa cuando las partes se indexan o se resumen por separado, y sobra cuando una persona las leerá en orden.

¿Puede dividir texto por tokens para ChatGPT o Claude?

Sí. El modo de tokens cuenta con la codificación o200k que usan GPT-5, GPT-4.1 y GPT-4o, así que la cuenta es exacta para esos modelos. Claude y Gemini tokenizan distinto; deja margen por debajo de sus límites.

¿Esta herramienta divide el texto en columnas?

No. Divide un texto largo en partes o fragmentos que caben dentro de un límite. Para repartir un texto en columnas de Word o separar el contenido de una celda en Excel, usa las funciones de esos programas.

¿Mi texto se sube a algún servidor?

No. La división, la detección de oraciones, el conteo de tokens, la copia y la descarga en .txt ocurren en tu navegador. El tokenizador es un archivo estático que se carga desde este sitio; no hay servidor, ni cuenta, ni registro.

Relacionados

Publicidad

Más sobre dividir y fragmentar texto