Esta página foi traduzida automaticamente do inglês e pode estar desatualizada. Leia o original
Segmentação de Texto
A segmentação de texto divide documentos de origem em sequências semanticamente coesas que podem ser incorporadas ou indexadas em uma coleção RAG. Ela devolve segmentos para sua aplicação; não cria embeddings nem armazena documentos enviados.
Use-a quando um documento de origem precisa de limites revisáveis e prontos para recuperação antes de criar ou atualizar documentos da coleção. Se você já tem texto focado e autocontido, pode importá‑lo diretamente. Se quiser que o AIVAX processe arquivos de origem em documentos da coleção, veja Media Injector.
Consulte onde a segmentação se encaixa em um pipeline RAG, ao lado de armazenamento, atualizações e recuperação.
Ignorar a segmentação quando o texto já está focado #
A segmentação justifica‑se em fontes longas e com múltiplos tópicos — manuais, artigos, transcrições — onde um embedding por página borraria assuntos distintos. Não segmente texto que já contém uma ideia por unidade: respostas de FAQ, descrições de produtos, políticas curtas ou trechos já divididos podem ir direto para a coleção. Cada divisão desnecessária adiciona trabalho de indexação e corre o separar declarações que só fazem sentido juntas.
O que faz um bom segmento #
Um bom segmento é o menor trecho que ainda responde a uma pergunta por si só: uma declaração completa ou um grupo compacto de declarações sobre um sub‑tópico, tipicamente um parágrafo ou uma seção curta. Segmentos são mais úteis quando a fonte possui títulos claros, parágrafos e declarações completas — o segmentador preserva esses limites ao invés de cortar no meio de um pensamento.
Observe os modos de falha de fontes desordenadas. Tabelas perdem seus cabeçalhos, OCR elimina a estrutura de linhas, transcrições divagam entre tópicos e documentos exportados repetem cabeçalhos em cada página. Revise os resultados dessas fontes antes da indexação e prefira limpar a fonte (corrigir títulos, remover conteúdo padronizado) ao invés de pedir ao segmentador que adivinhe ao redor dela.
Preparar o texto da fonte #
Forneça o texto completo da fonte sempre que possível. Segmentos são mais úteis quando a fonte tem títulos claros, parágrafos e declarações completas. Revise os resultados de tabelas, OCR, transcrições ou documentos com cabeçalhos repetidos antes de indexá‑los.
Sem sanitização, os segmentos têm cerca de 300 tokens e cobrem todo o documento na ordem original, sem sobreposição. Os limites seguem a estrutura do documento e a similaridade semântica dos trechos vizinhos; documentos desse tamanho ou menores são retornados como um único segmento.
Use sanitização apenas quando o conteúdo omitido for realmente irrelevante para a recuperação. Solicitações sanitizadas são processadas por um modelo de linguagem e demoram mais. Quando a formulação exata da fonte, a fidelidade legal ou a rastreabilidade completa são importantes, retenha e revise o texto da fonte ao invés de sanitizá‑lo.
Para o contrato de solicitação, resposta, autenticação e erro suportado, use a Referência da API:
Para disponibilidade atual do serviço e limites de conta, veja Plans and Limits.
