opción

Recupera y responde a preguntas de un directorio de base de conocimientos local navegando por archivos de índice jerárquicos y, a continuación, realiza búsquedas progresivas en archivos Markdown, PDF y Excel utilizando grep, Read, pdfplumber y pandas.

...Expandir todo
0
Tiempo actualizado 30 de septiembre de 2026

Búsqueda en la base de conocimientos local (kb-retriever)

Descripción del directorio de la base de conocimientos

  • La base de conocimientos se almacena en un directorio raíz y contiene diversos tipos de archivos (como .md/.txt、.pdf、.xlsx , etc.), y suele dividirse en subdirectorios de varios niveles según el tipo o la finalidad operativa.
  • Se utiliza un sistema de directorios jerárquico para indexar los archivos:
    • En el directorio raíz hay un archivo data_structure.mdque describe los principales «directorios temáticos» y su finalidad.
    • Cada directorio de área puede tener su propio data_structure.md, que describe qué subdirectorios o archivos contiene dicho directorio, así como su finalidad respectiva.
    • Los subdirectorios de niveles inferiores también pueden contener data_structure.md, formando así un árbol de índices de varios niveles.
  • Convención para el directorio raíz de la base de conocimientos:
    • Por defecto, se considera que la base de conocimientos se encuentra en el directorio knowledge/ .
    • Si el usuario especifica explícitamente otra ruta en el diálogo (por ejemplo, «Mi base de conocimientos está en /data/kb» o «Utilizar el directorio ./docs como base de conocimientos»), se utilizará la ruta especificada por el usuario como directorio raíz.
    • Cuando la ruta predeterminada knowledge/ no existe o no se puede acceder a ella, se debe confirmar con el usuario la ubicación real del directorio raíz de la base de conocimientos, en lugar de hacer conjeturas al azar.
  • Un único archivo de negocio puede ser muy grande:
    • no leas el archivo completo directamente con Read
    • Para archivos PDF y Excel, utilice la Skill correspondiente para procesarlos de forma estructurada y, a continuación, combine el uso de grep o la lectura parcial para realizar búsquedas precisas

Localizar knowledge del directorio raíz

  • En el directorio raíz, dar prioridad a la indicación del usuario: si el usuario proporciona una ruta (por ejemplo, ./docs、./knowledge-personal), utilice directamente la ruta proporcionada por el usuario.
  • Directorio raíz por defecto: en caso contrario, se establece como directorio raíz el directorio knowledge/。
    • Comprobar explícitamente con el shell si el directorio existe: dar prioridad a test -d knowledge, o, en su defecto, utilizar ls -d knowledge。
    • Nota: Queda prohibido utilizar Glob "knowledge" in . este tipo de patrones para determinar si un directorio existe,Glob ya que solo devuelve la ruta del archivo, no el propio directorio; un resultado vacío no permite distinguir entre «el directorio no existe» y «el directorio existe pero está vacío».
  • Solo cuando se haya comprobado que el directorio raíz existe mediante test -d , se utilizará Glob para buscar contenido en dicho directorio, y se utilizará el directorio como path, por ejemplo:
    • archivo de índice:pattern="**/data_structure.md", path="knowledge"
    • Todos los archivos Markdown:pattern="**/*.md", path="knowledge"
  • Si por defecto knowledge/ no existe (test -d error): no especules sobre otros directorios, indica claramente al usuario que no se ha encontrado el directorio raíz predeterminado y pídele que especifique la ruta real de la base de conocimientos.

Principio clave: primero aprender, luego procesar

Lista de comprobación obligatoria al encontrarse con archivos PDF o Excel:

  • ✅ Se han consultado los documentos de referencia correspondientes para aprender el método de procesamiento
  • ✅ Se han comprendido las herramientas y los comandos recomendados
  • ✅ Se ha completado el procesamiento del archivo (extracción/conversión)
  • ⏭️ Ahora ya puedes comenzar la recuperación

Conductas prohibidas:

  • ❌ Intentar procesar un PDF directamente sin haber leído primero el archivo pdf_reading.md
  • ❌ Intentar procesar archivos Excel directamente sin haber leído primero el archivo excel_reading.md
  • ❌ Saltarse los pasos de procesamiento de archivos y realizar la extracción directamente sobre los archivos PDF/Excel originales

Proceso general

  1. Comprender las necesidades del usuario

    • Leer la consulta del usuario y extraer:
      • palabras clave del tema o ámbito (por ejemplo, «informes de ventas», «arquitectura del sistema», «documentación de interfaces»)
      • Limitaciones temporales o de alcance (por ejemplo, «primer trimestre de 2023», «última versión»)
      • Tipo de resultado requerido (explicación, resumen, valores concretos de campos, etc.)
    • Determinar el directorio raíz de la base de conocimientos:
      • Comprueba en primer lugar si el usuario ha especificado una ruta a la base de conocimientos en la pregunta.
      • De lo contrario, utilice el directorio raíz por defecto knowledge/。
      • Si el directorio raíz predeterminado no existe o la estructura de directorios es anómala, se debe solicitar confirmación al usuario, en lugar de hacer suposiciones por cuenta propia.
  2. Revisar el índice de directorios por niveles data_structure.md

    • Utilizar el concepto de «directorio de trabajo actual»:
      • por defecto, se parte del directorio raíz de la base de conocimientos especificado por el usuario; si el usuario no lo ha especificado, se utiliza el directorio actual.
    • En el directorio de trabajo actual, si existe data_structure.md:
      • utilizar la función «Read» para leer las primeras líneas del archivo (por ejemplo, limit=300) y, si es necesario, continuar la lectura por tramos.
      • Objetivo:
        • Conocer qué subdirectorios y archivos hay en el directorio actual
        • Comprender la descripción del uso de cada subdirectorio o archivo
      • En función de la consulta del usuario, seleccionar los subdirectorios o archivos más relevantes para formar un conjunto de candidatos.
    • Para los subdirectorios candidatos:
      • entrar de forma recursiva en dicho subdirectorio, tomándolo como nuevo «directorio de trabajo actual», y continuar buscando en su interior data_structure.md y repetir el proceso anterior.
      • Durante el proceso recursivo, se debe evitar profundizar en todas las ramas a la vez, dando prioridad a la exploración de las rutas más relevantes para la incidencia.
    • En cuanto a los archivos de trabajo candidatos (md/texto, PDF, Excel, etc.):
      • Una vez completada la exploración necesaria de los niveles de directorios, recopilar estos archivos para formar la lista definitiva de objetivos de búsqueda.
    • A la hora de ordenarlos por prioridad:
      • Da prioridad a los directorios y archivos de ámbito específico cuya descripción de uso coincida en gran medida con el tema del problema.
      • En segundo lugar, se deben tener en cuenta las restricciones de tiempo o versión (si están reflejadas en el índice).
      • Los documentos de carácter general (como README.md o documentos de diseño general) se sitúan en una prioridad inferior.
  3. Aprender los métodos de procesamiento de archivos (aplicar de forma obligatoria en el caso de archivos PDF o Excel).

    • Antes de procesar archivos PDF:
      • Es imprescindible leer primero el archivo references/pdf_reading.md (ten en cuenta que este directorio se encuentra en el directorio «Skills», no en el directorio «Knowledge») y aprender los métodos de extracción
      • Es fundamental conocer: el comando pdftotext, el uso de pdfplumber y los métodos de extracción de tablas
    • Antes de procesar archivos Excel:
      • Es imprescindible leer primero el archivo references/excel_reading.md para aprender los métodos de lectura
      • Es imprescindible leer primero el archivo references/excel_analysis.md para aprender los métodos de análisis
      • Puntos clave: lectura con pandas, selección de columnas y filtrado de datos
    • Objetivo: garantizar el uso de las herramientas y métodos correctos para evitar búsquedas a ciegas
  4. Realizar el procesamiento y la recuperación según el tipo de archivo

    • Procesar los archivos utilizando los métodos que acabas de aprender (extracción, conversión y estructuración)
    • Para cada tipo de archivo candidato, seguir las estrategias que se indican a continuación: «Markdown/texto», «PDF» y «Excel»
    • Principio general:
      • Dar prioridad a los archivos más relevantes y precisos
      • Realizar búsquedas parciales y progresivas dentro de cada archivo, evitando cargar todo el contenido de una sola vez
      • Si no se obtiene información satisfactoria del archivo actual, pasar al siguiente archivo candidato
  5. Búsqueda iterativa

    • Se utiliza un «mecanismo de búsqueda iterativa en varias rondas» uniforme para todos los tipos de documentos (véanse los principios generales de búsqueda más arriba)
  6. Organización de las respuestas y referencia a las fuentes

    • Se recopila el contexto obtenido tras varias rondas de búsqueda y se responde de forma integral a la pregunta del usuario.
    • En la medida de lo posible:
      • dar respuestas claras y directas
      • Se indiquen los nombres de los documentos utilizados (incluyendo, cuando sea necesario, la ubicación aproximada, como el capítulo o el número aproximado de líneas o páginas)
    • Si la respuesta se basa en deducciones o en información incompleta:
      • Señalará claramente las suposiciones y las incertidumbres
      • Indique al usuario que puede añadir un rango de documentos más concreto o palabras clave

Principios de búsqueda pública

Estrategia de selección de palabras clave

  • Extraer entre 3 y 8 palabras clave de la consulta del usuario (incluidas posibles abreviaturas en inglés, sinónimos y términos genéricos o específicos)
  • Frases combinables (por ejemplo, «informes de ventas», «tiempo de espera de la interfaz API»)
  • Incluir, cuando sea necesario, términos de negocio, jerga técnica y abreviaturas comunes (como «uv», «pv» o «GMV»)

Principios básicos de la búsqueda con grep

  • Especificar siempre «include» y «path» con la mayor precisión posible, evitando buscar en todo el directorio
  • En el patrón, dar prioridad a los sustantivos y términos clave de la consulta, y después probar con sinónimos
  • Para cada resultado, lee solo la zona local cercana a la coincidencia (unas cuantas líneas por encima y por debajo)
  • Guardar «nombre del archivo + información de ubicación + fragmento de texto»

Mecanismo de búsqueda iterativa en varias rondas (hasta un máximo de 5 veces)

Se aplica una estrategia de iteración unificada a todos los tipos de archivo:

  1. Control de iteraciones
    • Se mantiene un recuento de «intentos de búsqueda», con un máximo de 5.
    • El recuento se incrementa tras cada búsqueda
  2. Proceso de cada ronda de iteración
    1. Generación o actualización de palabras clave de búsqueda en función de la consulta (pueden incluir sinónimos y términos relacionados)
    2. Seleccionar archivos o partes de archivos que aún no se hayan buscado exhaustivamente
    3. Realizar la búsqueda (grep/lectura parcial/llamada a una habilidad específica)
    4. Analizar los fragmentos de contexto obtenidos
    5. Determinar si es suficiente para responder a la pregunta
  3. Condiciones de finalización
    • Se ha encontrado contexto suficiente para respaldar la respuesta; o
    • Se han agotado los 5 intentos sin encontrar información adecuada
  4. Procedimiento en caso de información insuficiente
    • Informar claramente al usuario de que falta información o de que es posible que no se encuentre en la base de datos actual
    • Proporcionar la información más cercana que se haya encontrado y explicar la incertidumbre
    • Sugerir al usuario cómo puede acotar la búsqueda (nombres de archivos más concretos, palabras clave, intervalos de tiempo, etc.)

Aspectos a tener en cuenta

  • Prohibido llamar directamente desde el primer momento a:Glob "knowledge" in . ni realizar ninguna llamada que intente determinar la existencia de un directorio mediante Glob; la existencia del directorio debe comprobarse mediante comandos de shell (como test -d).
  • Al consultar la base de conocimientos con esta Skill, no se permite utilizar otras herramientas, como búsquedas en Internet, para obtener información

Políticas específicas para los distintos tipos de archivo

1. Archivos de tipo Markdown / texto (.md, .txt, .log, etc.)

  1. Selección de archivos candidatos

    • En función de data_structure.md el nombre del archivo y la ruta, se determina la relevancia
    • Se da prioridad a la búsqueda de archivos de tipo título e índice (como documentos de resumen o descripciones generales de diseño)
  2. Localización con grep y lectura parcial

    • Utilizar la herramienta grep para los archivos candidatos especificados, limitando con «include» a extensiones concretas (por ejemplo, «*.md»)
    • Para los archivos que coincidan, utilizar «Read» para leer únicamente la zona cercana a la coincidencia:
      • Controlar la lectura mediante el desplazamiento de línea y el parámetro «limit» (por ejemplo, leer varias decenas de líneas hacia delante y hacia atrás desde la línea coincidente)
      • Evitar la lectura del archivo completo
  3. Tratamiento especial

    • Si el contenido es solo un índice o un título, continuar la localización hacia el contenido más detallado basándose en los enlaces o los nombres de las secciones
    • Aplicar el «mecanismo de búsqueda iterativa en varias rondas» (véanse los principios generales de búsqueda mencionados anteriormente)

2. Estrategia de búsqueda en archivos PDF

Flujo de trabajo:

  1. En primer lugar: leer la guía de métodos de procesamiento

    • Antes de procesar cualquier PDF, es imprescindible leer el archivo references/pdf_reading.md (tenga en cuenta que este directorio se encuentra en el directorio «Skills», y no en el directorio «Knowledge»)
    • Puntos clave: el comando pdftotext, el uso de pdfplumber, los métodos de extracción de tablas y la tabla de decisiones rápidas
  2. Selección de archivos PDF candidatos

    • Según data_structure.md , selecciona entre 1 y 3 archivos que sean los más relevantes
    • Si el usuario especifica un archivo PDF concreto, se dará prioridad a dicho archivo
  3. Aplicar los métodos aprendidos para extraer el texto

    • Utiliza las herramientas recomendadas en pdf_reading.md (preferiblemente pdftotext o pdfplumber)
    • Importante: utiliza pdftotext input.pdf output.txt extraer el texto a un archivo, en lugar de enviarlo directamente a stdout (para evitar el consumo excesivo de tokens)
    • Si se desea extraer tablas, utilizar la función de extracción de tablas de pdfplumber
  4. Realizar búsquedas en los resultados extraídos

    • Utiliza `grep` para buscar palabras clave en el texto extraído
    • Para cada coincidencia, extrae el contexto de la zona cercana a la coincidencia (unas decenas de líneas por encima y por debajo o las páginas adyacentes)
    • Guardar «nombre del archivo + número de página/ubicación aproximada + fragmento de texto»
    • Aplicar el «mecanismo de búsqueda iterativa en varias rondas» (véanse los principios generales de búsqueda mencionados anteriormente)

3. Estrategia de búsqueda en archivos de Excel

Flujo de trabajo:

  1. En primer lugar: leer la guía de métodos de procesamiento.

    • Antes de procesar cualquier archivo de Excel, es imprescindible leer:
      • references/excel_reading.md: aprende a leer hojas de cálculo (ten en cuenta que este directorio se encuentra en el directorio «Skills», no en el directorio «Knowledge»)
      • references/excel_analysis.md: aprende a analizar datos (ten en cuenta que este archivo se encuentra en el directorio «Skills», no en el de «Knowledge»)
    • Puntos clave: métodos de lectura de pandas, filtrado de columnas, filtrado de datos y operaciones de agregación
  2. Seleccionar un archivo Excel candidato

    • Según data_structure.md los nombres de los archivos y hojas de cálculo, selecciona la hoja más relevante
    • Dar prioridad a los libros o hojas de cálculo que contengan palabras clave como «informes», «estadísticas», «registros», «configuración» o «mapeo»
    • Si el usuario especifica un archivo de Excel concreto, se utilizará preferentemente ese archivo
  3. Aplicar los métodos aprendidos para explorar la estructura

    • Utilizar pandas para leer las primeras 10-50 filas (utilizando nrows los parámetros de limitación)
    • Aspectos clave: nombres de columnas/campos, tipos de datos (valores numéricos, fechas, texto) y campos clave
    • Comparar los nombres de las columnas con la consulta del usuario para identificar posibles campos clave (como «ingresos», «ventas», «error_code», etc.)
  4. Realizar la recuperación y el análisis de datos

    • Utilizar los métodos de pandas aprendidos para filtrar y agrupar (por ejemplo, df[df['column'] == value])
    • leer solo los datos cercanos a las filas que coincidan, evitando leer toda la tabla de una sola vez
    • Si la pregunta incluye un intervalo de tiempo, añadir un filtro de fecha a la búsqueda
    • Aplicar el «mecanismo de búsqueda iterativa en varias rondas» (véanse los principios generales de búsqueda mencionados anteriormente)

Colaboración con otras herramientas

Procesamiento de PDF

  • Antes de procesar un PDF, es imprescindible leer el archivo references/pdf_reading.md para conocer el método de procesamiento
  • Utilizar pdfplumber/pypdf para la extracción de texto, la extracción de tablas y la lectura de metadatos
  • Dar prioridad a la herramienta de línea de comandos pdftotext para una extracción rápida de texto

Procesamiento de Excel

  • Antes de procesar archivos Excel, es imprescindible consultar:
    • references/excel_reading.md: para aprender los métodos de lectura
    • references/excel_analysis.md: para aprender los métodos de análisis
  • Utilizar pandas para explorar, previsualizar, filtrar y analizar datos

Principios de uso de las herramientas

  • Grep: se utiliza para buscar, en un archivo determinado, los números de línea y los fragmentos que coincidan con una palabra clave; especifica siempre los parámetros «include» y «path» con la mayor precisión posible
  • Read: se utiliza únicamente para leer partes de un archivo; establece siempre un «limit» razonable (por ejemplo, entre 200 y 500 líneas) y un desplazamiento adecuado
  • Para cualquier archivo que pueda ser muy grande:
    • No se debe leer directamente de principio a fin
    • Reducir siempre primero el alcance mediante índices, directorios o palabras clave antes de leer

Estilo de respuesta y gestión de errores

  • Estilo de respuesta
    • Intenta responder utilizando el mismo idioma que el usuario haya empleado en su pregunta (chino/inglés).
    • Empieza por dar la conclusión y, a continuación, expón brevemente los fundamentos.
    • Si es necesario, se pueden indicar al final los archivos consultados y su ubicación aproximada, por ejemplo:
      • Fuente: design/api_gateway.md, cerca de la línea 100
      • Fuente: reports/2023_Q1_sales.xlsx, hoja de cálculo «Summary»
  • Cuando falte información o esta sea incierta
    • Indique claramente que no se ha encontrado información que coincida totalmente en la base de conocimientos actual o que solo se puede responder parcialmente.
    • No invente datos.
    • Indicar al usuario cómo puede ayudar a acotar la búsqueda:
      • Especificar un directorio o archivo más concreto
      • Proporcione palabras clave o nombres de campos más precisos
      • Especificar un intervalo de tiempo o una versión
Ver en GitHub
---
name: kb-retriever
description: Retrieves and answers questions from a local knowledge base directory by navigating hierarchical index files, then progressively searching Markdown, PDF, and Excel files using grep, Read, pdfplumber, and pandas.
---

# 本地知识库检索 Skill(kb-retriever)

## 知识库目录说明

- 知识库存放在一个根目录下,包含多种文件类型(如 `.md`/`.txt`、`.pdf`、`.xlsx` 等),通常按类型或业务用途拆分为多级子目录。
- 采用**分层目录索引文件**:
  - 根目录有一个 `data_structure.md`,说明主要的「领域目录」及其用途。
  - 每个领域目录下可以有自己的 `data_structure.md`,说明该目录下有哪些子目录/文件,以及各自用途。
  - 更深一层的子目录也可以继续有 `data_structure.md`,形成多级索引树。
- 知识库根目录约定:
  - 默认认为知识库位于当前项目根目录下的 `knowledge/` 目录。
  - 如果用户在对话中明确指定了其他路径(例如“我的知识库在 /data/kb”或“用 ./docs 这个目录作为知识库”),则以用户指定的路径作为根目录。
  - 当默认路径 `knowledge/` 不存在或访问失败时,应向用户确认实际的知识库根目录位置,而不是随意猜测。
- 单个业务文件可能很大:
  - 不要直接用 Read 读取整文件
  - 对 PDF、Excel 使用对应 Skill 进行结构化处理后,再结合 grep/局部读取做精细检索

### 定位 `knowledge` 根目录

- 根目录优先听用户:如果用户给了路径(如 `./docs`、`./knowledge-personal`),直接用用户提供的路径。
- 默认根目录:否则约定根目录为当前项目下的 `knowledge/`。
  - 使用 shell 显式检查目录是否存在:优先使用 `test -d knowledge`,或退而求其次使用 `ls -d knowledge`。
  - 注意:禁止使用 `Glob "knowledge" in .` 这类模式来判断目录是否存在,`Glob` 只返回文件路径,不返回目录本身,空结果并不能区分“目录不存在”和“目录存在但为空”。
- 只有在根目录已通过 `test -d` 等方式确认存在时,才使用 Glob 在该目录下检索内容,并把目录作为 `path`,例如:
  - 索引文件:`pattern="**/data_structure.md"`, `path="knowledge"`
  - 所有 Markdown:`pattern="**/*.md"`, `path="knowledge"`
- 如果默认 `knowledge/` 不存在(`test -d` 失败):不要猜测其他目录,明确告诉用户未找到默认根目录,并让用户指定实际知识库路径。

## 关键原则:先学习,再处理

**遇到 PDF 或 Excel 文件时的强制检查清单**:

- [ ] ✅ 已读取对应的 references 文档学习处理方法
- [ ] ✅ 已理解推荐的工具和命令
- [ ] ✅ 已将文件处理(提取/转换)完成
- [ ] ⏭️ 现在可以开始检索

**禁止行为**:
- ❌ 在未读取 pdf_reading.md 的情况下直接尝试处理 PDF
- ❌ 在未读取 excel_reading.md 的情况下直接尝试处理 Excel
- ❌ 跳过文件处理步骤,直接对原始 PDF/Excel 进行检索

## 总体流程

1. 理解用户需求
   - 读用户问题,提取:
     - 主题/领域关键词(如“销售报表”“系统架构”“接口文档”)
     - 时间或范围限定(如“2023 年 Q1”“最近版本”)
     - 需要的输出类型(解释、摘要、具体字段数值等)
   - 确定知识库根目录:
     - 优先检查用户是否在问题中指定了知识库路径。
     - 否则使用默认根目录 `knowledge/`。
     - 若默认根目录不存在或目录结构异常,应向用户询问确认,而不是自行假设。

2. 分层查看目录索引 `data_structure.md`
   - 使用一个「当前工作目录」的概念:
     - 默认从用户指定的知识库根目录开始;如果用户未指定,则使用当前目录。
   - 在当前工作目录下,如果存在 `data_structure.md`:
     - 使用 Read 读取该文件的前若干行(例如 limit=300),必要时分段继续读取。
     - 目标:
       - 了解当前目录下有哪些子目录和文件
       - 理解每个子目录/文件的用途说明
     - 基于用户问题,挑选**最相关的若干个子目录或文件**,构成候选集合。
   - 对于候选子目录:
     - 递归进入该子目录,将其作为新的「当前工作目录」,继续查找其中的 `data_structure.md` 并重复上述过程。
     - 在递归过程中,避免一次性深入所有分支,优先沿着与问题最相关的路径向下钻取。
   - 对于候选业务文件(md/文本、PDF、Excel 等):
     - 在完成必要的目录层级探索后,收集这些文件为最终的**检索目标列表**。
   - 在优先级排序时:
     - 优先选择用途说明与问题主题高度匹配的领域目录和文件
     - 其次考虑时间/版本等约束(如果索引中有体现)
     - 通用说明类文档(如 README.md、总体设计类文档)放在较后优先级

3. 学习文件处理方法(遇到 PDF/Excel 时强制执行)
   - **在处理 PDF 文件前**:
     - **必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)学习提取方法
     - 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法
   - **在处理 Excel 文件前**:
     - **必须先读取** [references/excel_reading.md](references/excel_reading.md)学习读取方法
     - **必须先读取** [references/excel_analysis.md](references/excel_analysis.md)学习分析方法
     - 重点了解:pandas 读取、列筛选、数据过滤
   - **目的**:确保使用正确的工具和方法,避免盲目检索

4. 按文件类型执行处理和检索
   - 使用刚学到的方法处理文件(提取、转换、结构化)
   - 对每类候选文件,按照下面「Markdown/文本」「PDF」「Excel」策略执行
   - 总原则:
     - 优先从最相关、最精确的文件开始
     - 每个文件内都渐进式地局部检索,避免一次性加载全内容
     - 若当前文件得不到满意信息,切换到下一个候选文件

5. 迭代检索
   - 所有文件类型都使用统一的「多轮迭代检索机制」(见上文公共检索原则)

6. 答案组织与溯源
   - 汇总多轮检索得到的上下文,综合回答用户问题。
   - 尽量:
     - 给出清晰、直接的回答
     - 指出使用过的文件名(必要时包含大致位置,如章节或大概行数/页数)
   - 如果答案基于推断或信息不完全:
     - 明确标注假设与不确定性
     - 提示用户可以补充更具体的文件范围或关键词

## 公共检索原则

### 关键词选择策略
- 从用户问题提取 3-8 个关键词(含可能的英文缩写、同义词、上位/下位词)
- 可组合词组(如 "销售 报表"、"API 接口 超时")
- 必要时包含业务词、技术术语、常见缩写(如 "uv"、"pv"、"GMV")

### grep 检索基本原则
- 始终指定尽量精准的 include 和 path,避免搜索整个目录
- pattern 优先尝试问题中的核心名词、术语,再尝试同义词
- 对于每个命中,只读取匹配附近的局部区域(上下若干行)
- 保存「文件名 + 位置信息 + 文本片段」

### 多轮迭代检索机制(最多 5 次)
所有文件类型都采用统一的迭代策略:
1. **迭代控制**
   - 维护「已尝试检索次数」计数,最多 5 次
   - 每次检索后累加计数
2. **每轮迭代流程**
   1. 基于问题生成/更新检索关键词(可包括同义词、扩展词)
   2. 选择尚未充分检索的文件或文件部分
   3. 执行检索(grep/局部读取/专用 Skill 调用)
   4. 分析获取的上下文片段
   5. 判断是否足够回答问题
3. **终止条件**
   - 找到足够支撑回答的上下文;或
   - 已达到 5 次尝试仍未找到合适信息
4. **信息不足时的处理**
   - 明确告知用户信息缺失或可能不在当前知识库中
   - 提供已找到的最接近信息,并说明不确定性
   - 提示用户可以如何缩小范围(更具体的文件名、关键词、时间范围等)

### 注意事项

- 禁止第一次就直接调用:`Glob "knowledge" in .` 或任何试图用 Glob 判定目录存在性的调用,目录存在性应通过 shell 命令(如 `test -d`)检查。
- 使用本 Skill 查询知识库时,禁止使用网络搜索等其他工具获取知识

## 针对不同文件类型的具体策略

### 1. Markdown / 文本类文件(.md, .txt, .log 等)

1. **候选文件选择**
   - 根据 `data_structure.md` 和文件名、路径判断相关度
   - 优先检索标题和目录类文件(如汇总文档、设计总览)

2. **grep 定位与局部读取**
   - 使用 Grep 工具对指定候选文件,include 限定具体后缀(如 "*.md")
   - 对于有匹配的文件,使用 Read 仅读取匹配附近的局部区域:
     - 通过行号偏移和 limit 控制读取(例如从匹配行附近往前后各读取几十行)
     - 避免整文件读取

3. **特殊处理**
   - 如内容仅是目录/标题,根据链接或小节名继续定位深入内容
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

### 2. PDF 文件检索策略

**工作流**:

1. **首先:读取处理方法指南**
   - 在处理任何 PDF 之前,**必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
   - 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法、快速决策表
   
2. **选择候选 PDF**
   - 根据 `data_structure.md` 中的描述,选择最相关的 1-3 个文件
   - 如果用户指明具体 PDF 文件,则优先使用该文件

3. **应用学到的方法提取文本**
   - 使用 pdf_reading.md 中推荐的工具(优先 pdftotext 或 pdfplumber)
   - **重要**:使用 `pdftotext input.pdf output.txt` 将文本提取到文件,不要直接输出到 stdout(避免占用大量 token)
   - 如需提取表格,使用 pdfplumber 的表格提取功能
   
4. **对提取结果执行检索**
   - 使用 grep 对提取的文本进行关键词搜索
   - 对于每个命中,提取命中附近范围的上下文(上下数十行或相邻几页)
   - 保存「文件名 + 页码/大致位置 + 文本片段」
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

### 3. Excel 文件检索策略

**工作流**:

1. **首先:读取处理方法指南**
   - 在处理任何 Excel 之前,**必须先读取**:
     - [references/excel_reading.md](references/excel_reading.md) - 学习如何读取工作表(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
     - [references/excel_analysis.md](references/excel_analysis.md) - 学习如何分析数据(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
   - 重点了解:pandas 读取方法、列筛选、数据过滤、聚合操作
   
2. **选择候选 Excel**
   - 根据 `data_structure.md` 和文件/工作表命名,选择最相关的表
   - 优先选择包含「报表」「统计」「日志」「配置」「映射」等关键词的工作簿/工作表
   - 若用户指明具体 Excel 文件,优先使用该文件

3. **应用学到的方法探索结构**
   - 使用 pandas 读取前 10-50 行(使用 `nrows` 参数限制)
   - 重点掌握:列名/字段名、数据类型(数值、日期、文本)、关键字段
   - 将列名与用户问题比对,识别潜在关键字段(如「收入」「销售额」「error_code」等)
   
4. **执行数据检索和分析**
   - 使用学到的 pandas 方法进行过滤和聚合(如 `df[df['column'] == value]`)
   - 每次只读取匹配行附近的数据,避免一次性读取整表
   - 如问题包含时间范围,在检索中加入时间过滤
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

## 与其他工具的协同

### PDF 处理
- **在处理 PDF 前必须先读取** [references/pdf_reading.md](references/pdf_reading.md) 学习处理方法
- 使用 pdfplumber/pypdf 进行文本提取、表格提取、元数据读取
- 优先使用 pdftotext 命令行工具进行快速文本提取

### Excel 处理
- **在处理 Excel 前必须先读取**:
  - [references/excel_reading.md](references/excel_reading.md) - 学习读取方法
  - [references/excel_analysis.md](references/excel_analysis.md) - 学习分析方法
- 使用 pandas 进行数据探索、预览、过滤和分析

### 工具使用原则
- **Grep**:用于按关键词在指定文件中查找行号与匹配片段,始终指定尽量精准的 include 和 path
- **Read**:只用于局部读取文件,始终设置合理的 limit(如 200-500 行)和合适的偏移
- **对于任何可能很大的文件**:
  - 禁止直接从头读到尾
  - 始终先通过索引、目录、关键词等方式缩小范围后再读

## 回答风格与错误处理

- 回答风格
  - 尽量用用户提问的语言(中文/英文)作答。
  - 先给出结论,再给出简要依据。
  - 如需要,可在后面列出引用的文件和大致位置,例如:
    - 来源:design/api_gateway.md 第 100 行附近
    - 来源:reports/2023_Q1_sales.xlsx Summary 工作表
- 信息缺失或不确定时
  - 明确说明在当前知识库中没有找到完全匹配的信息或只能部分回答。
  - 不臆造事实。
  - 提示用户可以如何帮助缩小范围:
    - 指定更具体的目录/文件
    - 提供更精确的关键词或字段名
    - 指定时间/版本范围


 

Instalar kb-retriever

Descarga y descomprime los archivos de habilidades en tu directorio .claude/skills/.

Descargar ZIP

Clona el repositorio y copia los archivos de la habilidad a tu proyecto.

git clone https://github.com/ConardLi/garden-skills/tree/main/skills/kb-retriever # Copy SKILL.md to your .claude/skills/ directory

Copiar Copiar
Configuración rápida: Copia la carpeta de la habilidad en .claude/skills/ Claude detectará y utilizará automáticamente la habilidad

Habilidades relacionadas

microservices-patterns
Tiempo actualizado 29 de junio de 2026
jpa-patterns
Tiempo actualizado 30 de junio de 2026
fabric-lakehouse
Tiempo actualizado 30 de junio de 2026
prisma-expert
Tiempo actualizado 29 de junio de 2026
OR