Fuentes de conocimiento
Conecte artículos, sitios, archivos, instrucciones y datos, indexelos de forma segura y verifique exactamente qué encontrará el agente de IA.
En esta página
Una fuente de conocimiento es una entrada desde la que el agente de IA puede responder. Las fuentes se encuentran en Base de conocimientos → Fuentes; la pestaña Recuperación de prueba junto a ella muestra los extractos que recibiría un agente para una pregunta determinada.
Nada se indexa implícitamente. Cada fuente se crea explícitamente, se indexa en con su propio cronograma y se puede seleccionar o deseleccionar por agente en respuestas AI y agentes.
Tipos de fuentes
- Artículo de la base de conocimientos: un artículo existente de este bot. Los artículos publicados en se convierten en fuentes públicas, los artículos internos se convierten en fuentes exclusivas para agentes, y los borradores no producen ningún contenido que permita realizar búsquedas.
- Sitio web: páginas de su propio sitio, recuperadas por un rastreador incluido en la lista de permitidos.
- Archivo: carga de PDF, Word, Excel, PowerPoint, texto, Markdown o HTML.
- Instrucción: un breve texto de la política que usted mismo escribe; por ejemplo, , una regla de reembolso que el agente siempre debe seguir.
- Hecho: un único hecho almacenado al que hace referencia su identificador.
El nombre de la fuente está limitado a 120 caracteres y toda la configuración de la fuente , incluido el texto de instrucciones, a 64 KB.
Visibilidad y prioridad
Cada fuente tiene una visibilidad:
- Agente AI: solo el agente puede recuperarla.
- Operadores: reservado para recuperación de cara al operador.
- Público: también puede aparecer en superficies públicas como centro de ayuda.
Los archivos, instrucciones y hechos nunca pueden ser públicos; única base de conocimientos Los artículos alcanzan visibilidad pública y lo hacen a través de su propio estado publicado . La visibilidad es parte de la consulta de la base de datos, no un filtro aplicado posteriormente, por lo que un agente restringido al contenido público no puede recibir un extracto interno de .
Prioridad varía de −100 a 100. Es un desempate: cuando dos extractos clasifican a por igual, gana la fuente de mayor prioridad. Nunca anula una coincidencia de texto claramente mejor.
Fuentes de sitios web
Una fuente de sitio web necesita al menos un origen permitido (una dirección https://host
básica, hasta 20 de ellas) y al menos una URL de inicio dentro de esos orígenes, hasta
100 URL. Las direcciones HTTP se rechazan.
El rastreo se mantiene dentro de esos límites:
- El rastreador se identifica como
MyBotKnowledge/1.0y leerobots.txtpara cada origen antes de buscarlo. Los prefijosDisallowse omiten y se respetaCrawl-delayhasta 10 segundos. - Solo se siguen enlaces
<a href>que vuelven a los orígenes permitidos. Los fragmentos se descartan y los parámetrosutm_*,gclidyfbclidse eliminan antes de poner una URL en cola, por lo que una misma página no se indexa dos veces. - Cada solicitud vuelve a resolver el host y rechaza las direcciones de metadatos de nube, de bucle invertido, privadas, de enlace local, de multidifusión y de la nube. Los redireccionamientos se revalidan según con las mismas reglas y se siguen como máximo tres.
- Una solicitud caduca después de 15 segundos, el cuerpo de la respuesta tiene un límite de 8 MB, y solo se aceptan respuestas HTML, XHTML, texto sin formato y Markdown.
- Una sola fuente indexa como máximo 100 páginas.
El rastreador nunca inicia sesión, nunca envía un formulario y nunca carga secuencias de comandos, medios ni recursos integrados. Por lo tanto, las páginas detrás de un inicio de sesión están fuera del alcance: publique el contenido o cárguelo como un archivo.
La actualización cada (segundos) se aplica únicamente a las fuentes del sitio web. Debe estar en mínimo 60 segundos y máximo 366 días. Las fuentes de artículos, archivos, instrucciones y hechos no se recuperan según un cronograma; se vuelven a indexar cuando los cambia o presiona Actualizar.
Cargas de archivos
Las cargas ya deben pertenecer a la biblioteca multimedia de este bot y tener un tamaño máximo de 8 MB.
Los tipos aceptados son PDF, DOCX, XLSX, PPTX, text/plain, text/markdown,
text/html y XHTML.
La extracción es deliberadamente limitada:
- HTML mantiene encabezados, listas y texto de enlaces; Se eliminan los scripts, estilos, navegación, encabezados, pies de página, apartes y plantillas .
- Los archivos PDF se leen solo como texto, hasta 100 páginas. Los archivos cifrados o con formato incorrecto se rechazan en lugar de analizarse parcialmente.
- Los archivos de Office se leen únicamente desde las partes de texto del documento. Las macros, los objetos incrustados y las relaciones externas se ignoran y nunca se recuperan. El archivo debe tener menos de 500 entradas, una relación de compresión de 100:1, 32 MB expandidos, 200 000 nodos XML y 500 000 caracteres de texto.
Los archivos binarios heredados .doc, .xls y .ppt se rechazan con
unsupported_type. Guárdelos como DOCX, XLSX o PPTX y cárguelos nuevamente.
Indexación y estados
Una fuente pasa por estos estados, que se muestran en su tarjeta:
- En espera de indexación: creado o modificado, aún no procesado.
- Indexación: un trabajador mantiene el trabajo.
- Listo: se puede buscar el contenido actual.
- Necesita actualización: la programación venció o el contenido cambió.
- Error: el último intento finalizó con un código de error.
- Desactivado: se mantiene pero se excluye de todas las búsquedas.
La indexación está por etapas. Un trabajador lee la fuente, divide el texto en fragmentos superpuestos (aproximadamente 1.500 caracteres con 200 caracteres superpuestos), solicita incrustaciones de en lotes de 32 y solo entonces reemplaza los documentos de la fuente y los fragmentos en una sola transacción. Un lector siempre ve la versión completa de anterior o la nueva versión completa, nunca una fuente medio reconstruida. Si la suma de comprobación del contenido no ha cambiado, se omite la reconstrucción.
Las incrustaciones se producen a través de la integración AI del bot
(Integrations), utilizando su URL base y clave, y de manera predeterminada
el modelo text-embedding-3-small con 1 536 dimensiones. Sin una integración AI
que funcione, una fuente no puede abandonar la cola de indexación.
Una fuente indexa como máximo 100 documentos y un solo documento no puede producir más de 500 fragmentos. Los trabajos se alquilan durante dos minutos con un latido, por lo que un trabajador interrumpido libera la fuente en lugar de bloquearla. La tarjeta de origen muestra el recuento de intentos y la cantidad de documentos procesados, fragmentos de procesados y documentos fallidos; Cancelar indexación detiene la ejecución actual.
Qué devuelve la recuperación
Una pregunta se responde a partir de dos búsquedas independientes:
- una búsqueda léxica en el índice de texto de PostgreSQL, y
- una búsqueda semántica sobre el índice vectorial (distancia coseno).
El bot, el conjunto de visibilidad, la condición de fuente activa y el La condición de documento no eliminado son parte de ambas consultas SQL, antes de clasificar y ante cualquier límite. Luego, las dos clasificaciones se fusionan con una clasificación recíproca. la fusión, la prioridad de fuente y la indexación reciente (dentro de los 30 días) rompen los vínculos, y Los fragmentos vecinos del mismo documento están colapsados.
El resultado son como máximo 12 extractos de 800 caracteres cada uno como máximo. una pregunta es limitado a 16 000 caracteres, y un agente puede estar restringido a un máximo de 100 fuentes específicas.
El agente almacena la fuente, el documento y el fragmento detrás de cada extracto que recibidos, en orden de clasificación. Una respuesta que cite cualquier otra cosa se rechaza antes. se envía, por lo que una respuesta nunca puede apuntar a una fuente borrador, oculta, deshabilitada o eliminada.
Recuperación de prueba
Base de conocimientos → Recuperación de prueba ejecuta la misma búsqueda sin involucrar el modelo
. Para cada visita, muestra la fuente, el título, el extracto, la puntuación
del partido y el motivo (Hybrid match). No se devuelven metadatos ocultos y
la prueba tiene una tarifa limitada por cuenta.
Úselo antes de activar un agente: si los extractos aquí son incorrectos, la respuesta también lo será.
Cuando falla la indexación
El último error se almacena como un código estable:
blocked_address: la URL, una redirección o la IP resuelta están fuera del orígenes o puntos permitidos en una dirección privada.robots_denied:robots.txtprohíbe esa ruta.unsupported_type: el tipo de contenido o formato de archivo no es compatible.file_too_large: la descarga o carga excede el límite de tamaño.expanded_too_large: el texto extraído, el recuento de páginas o el contenido del archivo superan los límites anteriores.malformed_file: no se pudo analizar el archivo o la respuesta.fetch_timeout: el sitio no respondió a tiempo.rate_limited: el proveedor de incorporación limitó la solicitud; Se vuelve a intentar el trabajo.
Corrija la causa y presione Actualizar. Los errores nunca incluyen el texto obtenido, por lo que es seguro compartirlos con el soporte.
Eliminar, deshabilitar y conservar
Desactivar mantiene la configuración pero elimina la fuente de cada búsqueda; Habilitar lo vuelve a colocar en la cola. Eliminar elimina la fuente junto con con sus documentos y fragmentos.
Una fuente seleccionada por un agente activo no se puede eliminar: la solicitud falla con un conflicto. Primero anule la selección en el agente o ponga en pausa el agente.
Aislamiento
Los orígenes, documentos, fragmentos y trabajos de indexación están codificados por bot. Cada ruta de lectura de se filtra en el bot dentro de SQL, por lo que el contenido de un inquilino nunca es candidato a para la búsqueda de otro inquilino, incluso cuando el texto y las incrustaciones de son idénticos.
API y MCP
La API REST utiliza los alcances knowledge:read y knowledge:write:
GET/POST /api/bots/{botID}/knowledge/sourcesGET/PATCH/DELETE /api/bots/{botID}/knowledge/sources/{sourceID}POST /api/bots/{botID}/knowledge/sources/{sourceID}/uploadPOST /api/bots/{botID}/knowledge/sources/{sourceID}/refreshPOST /api/bots/{botID}/knowledge/sources/{sourceID}/cancelPOST /api/bots/{botID}/knowledge/sources/{sourceID}/disablePOST /api/bots/{botID}/knowledge/sources/{sourceID}/enableGET /api/bots/{botID}/knowledge/sources/{sourceID}/index-statusGET /api/bots/{botID}/knowledge/sources/{sourceID}/documentsPOST /api/bots/{botID}/knowledge/retrieval-test
MCP expone herramientas de solo lectura: list_knowledge_sources,
get_knowledge_source_status y test_knowledge_retrieval. No existe ninguna herramienta MCP
que cambie una fuente o descargue documentos ocultos sin formato.
Páginas relacionadas
- Respuestas de IA y agentes: conecta fuentes a un agente.
- Centro de ayuda pública: publicar artículos para clientes.
- Integraciones: la integración de IA utilizada para las incrustaciones.