Pular para o conteúdo principal

Configurações

A aba Configurações da Base de Conhecimento permite configurar como seus documentos são processados e divididos em blocos. Essas configurações afetam como o conteúdo é dividido em blocos, incorporado e recuperado pelo seu agente.

Estratégia de Divisão em Blocos​

Escolha como seus documentos serão divididos em blocos para processamento.

EstratégiaDescrição
Divisão por SentençaUtiliza um tokenizador de sentenças para limites de linguagem natural. Melhor para conteúdo geral onde preservar o contexto da sentença é importante.
Divisão SemânticaDetermina automaticamente os limites dos blocos com base no significado semântico. Melhor para documentos complexos ou técnicos onde o contexto semântico é mais importante que a estrutura da sentença.

Configuração dos Blocos​

Configure o tamanho dos blocos e a sobreposição para a divisão por sentença. Esta seção se aplica quando Divisão por Sentença é selecionada.

ConfiguraçãoPadrãoRecomendaçãoDescrição
Tamanho do Bloco6464–512 tokensO tamanho máximo de cada bloco. Blocos maiores preservam mais contexto, mas podem reduzir a precisão da recuperação. Blocos menores são mais precisos, mas podem perder contexto.
Sobreposição de Blocos610–20% do tamanho do blocoO número de tokens sobrepostos entre blocos adjacentes. Ajuda a manter o contexto entre os limites dos blocos. Deve ser não negativo e menor que o tamanho do bloco.

Configurações de Aprimoramento dos Blocos​

Configure o enriquecimento dos blocos e a seleção de modelo LLM para melhor processamento do conteúdo.

ConfiguraçãoDescrição
Enriquecimento de BlocosQuando habilitado, usa IA para aprimorar os blocos com contexto adicional para maior precisão de recuperação.
Modelo LLMSelecione o modelo LLM a ser utilizado para o enriquecimento dos blocos. Necessário quando o Enriquecimento de Blocos está habilitado.
Nota

Se nenhum modelo de Enriquecimento de Blocos estiver configurado no Super Admin, o modelo padrão será utilizado automaticamente.

Dica

O enriquecimento dos blocos melhora a qualidade da pesquisa, mas aumenta o tempo de processamento e o custo computacional. Habilite-o para conteúdo complexo onde a simples divisão não é suficiente.

Zona de Perigo​

aviso

As ações nesta seção são irreversíveis. Prossiga com cautela.

Excluir Toda a Base de Conhecimento — Remove permanentemente todos os documentos, blocos e embeddings da sua base de conhecimento. Esta ação não pode ser desfeita.

Salvando e Aplicando Configurações​

AçãoDescrição
Salvar ConfiguraçõesSalva sua configuração. Aplica-se apenas a novos documentos adicionados ou sincronizados a partir de agora.
RedefinirRedefine o formulário para a última configuração salva.
Aplicar a Todos os DocumentosReindexa todos os documentos existentes na sua base de conhecimento com as configurações atuais. Use isto após salvar para aplicar alterações ao conteúdo carregado anteriormente.
aviso

Aplicar configurações a todos os documentos pode levar tempo significativo dependendo do número de documentos na sua base de conhecimento. Este processo não pode ser cancelado uma vez iniciado.

Melhores Práticas​

Estratégia de Divisão em Blocos​

  • Comece com Divisão por Sentença para a maioria dos casos de uso.
  • Mude para Divisão Semântica para documentos complexos ou técnicos onde os limites das sentenças não se alinham com divisões de conteúdo significativas.

Tamanho do Bloco​

  • Comece com o padrão (64) como linha de base.
  • Aumente para conteúdo que requer mais contexto por bloco.
  • Diminua quando uma recuperação precisa e direcionada é mais importante que o contexto.

Sobreposição de Blocos​

  • Mantenha a sobreposição em 10–20% do tamanho do bloco.
  • Aumente a sobreposição quando informações críticas podem se estender pelos limites dos blocos.

Enriquecimento de Blocos​

  • Habilite para conteúdo complexo onde a qualidade da recuperação precisa ser melhorada.
  • Escolha um modelo com fortes capacidades de raciocínio para melhores resultados.
  • Monitore o tempo de processamento após habilitar — o enriquecimento adiciona custo computacional.