opção

Recupera e responde a perguntas de um diretório de base de conhecimento local, navegando por arquivos de índice hierárquicos e, em seguida, pesquisando progressivamente arquivos Markdown, PDF e Excel usando grep, Read, pdfplumber e pandas.

...Expandir tudo
0
Tempo atualizado 30 de Setembro de 2026

Pesquisa na base de conhecimento local – Skill (kb-retriever)

Descrição do diretório da base de conhecimento

  • A base de conhecimento está armazenada em um diretório raiz e contém diversos tipos de arquivos (como .md/.txt、.pdf、.xlsx etc.), geralmente divididos em subdiretórios de vários níveis por tipo ou finalidade comercial.
  • Os arquivos são indexados por meio de uma estrutura de diretórios hierárquica:
    • O diretório raiz possui um arquivo data_structure.md, que descreve os principais “diretórios de área” e suas finalidades.
    • Cada diretório de área pode ter seu próprio data_structure.md, que descreve quais subdiretórios/arquivos estão presentes nesse diretório, bem como suas respectivas finalidades.
    • Os subdiretórios de níveis mais profundos também podem conter data_structure.md, formando uma árvore de índice de vários níveis.
  • Convenção para o diretório raiz da base de conhecimento:
    • Por padrão, considera-se que a base de conhecimento está localizada no diretório knowledge/ .
    • Se o usuário especificar explicitamente outro caminho durante a interação (por exemplo, “Minha base de conhecimento está em /data/kb” ou “Use o diretório ./docs como base de conhecimento”), o caminho especificado pelo usuário será considerado o diretório raiz.
    • Quando o caminho padrão knowledge/ não existir ou houver falha no acesso, deve-se confirmar com o usuário a localização real do diretório raiz da base de conhecimento, em vez de fazer suposições aleatórias.
  • Um único arquivo de negócios pode ser muito grande:
    • não leia o arquivo inteiro diretamente com o comando `Read`
    • Para PDFs e arquivos do Excel, utilize as Skills correspondentes para processá-los de forma estruturada e, em seguida, combine com o grep ou leitura parcial para realizar uma busca refinada

Localizar knowledge diretório raiz

  • Priorize o diretório raiz, mas respeite o que o usuário indicar: se o usuário fornecer um caminho (como ./docs、./knowledge-personal), use diretamente o caminho fornecido pelo usuário.
  • Diretório raiz padrão: caso contrário, o diretório raiz será, por convenção, o knowledge/。
    • Verificar explicitamente com o shell se o diretório existe: dar prioridade ao uso de test -d knowledge, ou, como alternativa, use ls -d knowledge。
    • Atenção: é proibido usar Glob "knowledge" in . desse tipo de padrão para determinar se o diretório existe,Glob pois ele retorna apenas o caminho do arquivo, e não o próprio diretório; um resultado vazio não permite distinguir entre “o diretório não existe” e “o diretório existe, mas está vazio”.
  • Somente quando a existência do diretório raiz já tiver sido confirmada por meio de test -d ou de outra forma, é que se deve usar o Glob para buscar conteúdo nesse diretório, tratando-o como path, por exemplo:
    • arquivo de índice:pattern="**/data_structure.md", path="knowledge"
    • Todos os Markdown:pattern="**/*.md", path="knowledge"
  • Se, por padrão, knowledge/ não existir (test -d falha): não adivinhe outros diretórios; informe claramente ao usuário que o diretório raiz padrão não foi encontrado e peça que ele especifique o caminho real da base de conhecimento.

Princípio fundamental: primeiro aprender, depois processar

Lista de verificação obrigatória ao encontrar arquivos PDF ou Excel:

  • ✅ Já li a documentação de referências correspondente para aprender os métodos de processamento
  • ✅ Já compreendi as ferramentas e comandos recomendados
  • ✅ Concluí o processamento do arquivo (extração/conversão)
  • ⏭️ Agora é possível iniciar a pesquisa

Ações proibidas:

  • ❌ Tentar processar o PDF diretamente sem ter lido o arquivo pdf_reading.md
  • ❌ Tentar processar o Excel diretamente sem ter lido o arquivo excel_reading.md
  • ❌ Pular as etapas de processamento de arquivos e realizar a pesquisa diretamente no PDF/Excel original

Fluxo geral

  1. Compreender as necessidades do usuário

    • Ler a questão do usuário e extrair:
      • palavras-chave do tema/área (como “relatório de vendas”, “arquitetura de sistema”, “documentação de interface”)
      • Limites de tempo ou escopo (por exemplo, “1º trimestre de 2023”, “versão mais recente”)
      • Tipo de resultado desejado (explicação, resumo, valores específicos de campos, etc.)
    • Determinar o diretório raiz da base de conhecimento:
      • Verifique primeiro se o usuário especificou o caminho da base de conhecimento na pergunta.
      • Caso contrário, utilize o diretório raiz padrão knowledge/。
      • Se o diretório raiz padrão não existir ou a estrutura de diretórios estiver incorreta, deve-se solicitar a confirmação do usuário, em vez de fazer suposições por conta própria.
  2. Visualizar o índice de diretórios em camadas data_structure.md

    • Utilize o conceito de “diretório de trabalho atual”:
      • por padrão, a partir do diretório raiz da base de conhecimento especificado pelo usuário; se o usuário não tiver especificado, use o diretório atual.
    • No diretório de trabalho atual, se houver data_structure.md:
      • utilize o comando `Read` para ler as primeiras linhas do arquivo (por exemplo, `limit=300`); se necessário, continue a leitura em partes.
      • Objetivo:
        • Identificar quais subdiretórios e arquivos existem no diretório atual
        • Compreender a descrição da finalidade de cada subdiretório/arquivo
      • Com base na questão do usuário, selecionar os subdiretórios ou arquivos mais relevantes para formar um conjunto de candidatos.
    • Para os subdiretórios candidatos:
      • entrar recursivamente nesse subdiretório, considerando-o como o novo “diretório de trabalho atual”, e continuar a busca por data_structure.md e repetir o processo acima.
      • Durante o processo recursivo, evite explorar todas as ramificações de uma só vez; priorize a exploração das caminhos mais relevantes para a questão.
    • Para os arquivos de negócios candidatos (md/texto, PDF, Excel etc.):
      • Após concluir a exploração necessária da hierarquia de diretórios, reúna esses arquivos para formar a lista final de alvos de pesquisa.
    • Ao classificar por prioridade:
      • Dê prioridade a diretórios e arquivos cujas descrições de uso sejam altamente compatíveis com o tema da questão
      • Em segundo lugar, considere restrições como data/versão (se estiverem refletidas no índice)
      • Documentos de instruções gerais (como README.md e documentos de projeto geral) devem ter prioridade mais baixa
  3. Aprenda os métodos de processamento de arquivos (aplique-os obrigatoriamente ao encontrar arquivos PDF/Excel)

    • Antes de processar arquivos PDF:
      • é necessário ler primeiro o arquivo references/pdf_reading.md (observe que esse diretório está localizado no diretório Skills, e não no diretório Knowledge) Aprenda os métodos de extração
      • Concentre-se em: o comando pdftotext, o uso do pdfplumber e os métodos de extração de tabelas
    • Antes de processar arquivos Excel:
      • É necessário ler primeiro o arquivo references/excel_reading.md para aprender os métodos de leitura
      • É necessário ler primeiro o arquivo references/excel_analysis.md para aprender os métodos de análise
      • Pontos importantes a serem compreendidos: leitura com pandas, filtragem de colunas e filtragem de dados
    • Objetivo: garantir o uso das ferramentas e métodos corretos, evitando a recuperação aleatória
  4. Executar o processamento e a extração de acordo com o tipo de arquivo

    • Processar os arquivos utilizando os métodos recém-aprendidos (extração, conversão, estruturação)
    • Para cada categoria de arquivos candidatos, seguir as estratégias abaixo: “Markdown/texto”, “PDF” e “Excel”
    • Princípio geral:
      • Comece prioritariamente pelos arquivos mais relevantes e precisos
      • Realizar a busca local de forma progressiva dentro de cada arquivo, evitando carregar todo o conteúdo de uma só vez
      • Se o arquivo atual não fornecer informações satisfatórias, passe para o próximo arquivo candidato
  5. Pesquisa iterativa

    • Todos os tipos de arquivos utilizam um “mecanismo de pesquisa iterativa em várias rodadas” unificado (ver os princípios gerais de pesquisa acima)
  6. Organização e atribuição de fontes das respostas

    • Reúna o contexto obtido nas várias rodadas de pesquisa para responder de forma abrangente à pergunta do usuário.
    • Procure, na medida do possível:
      • Fornecer respostas claras e diretas
      • Indicar os nomes dos documentos utilizados (incluindo, quando necessário, a localização aproximada, como capítulo ou número aproximado de linhas/páginas)
    • Se a resposta for baseada em suposições ou em informações incompletas:
      • Indique claramente as suposições e as incertezas
      • Sugira ao usuário que complemente com um escopo mais específico do documento ou palavras-chave

Princípios de pesquisa pública

Estratégia de seleção de palavras-chave

  • Extrair de 3 a 8 palavras-chave da consulta do usuário (incluindo possíveis siglas em inglês, sinônimos, termos de nível superior/inferior)
  • Expressões combinadas (como “relatório de vendas”, “tempo limite da interface API”)
  • Incluir, quando necessário, termos de negócios, terminologia técnica e abreviações comuns (como “uv”, “pv”, “GMV”)

Princípios básicos da pesquisa com grep

  • Sempre especifique `include` e `path` da forma mais precisa possível, evitando pesquisar em todo o diretório
  • No padrão, priorize os substantivos e termos centrais da questão e, em seguida, tente sinônimos
  • Para cada resultado, leia apenas a área local próxima à correspondência (algumas linhas acima e abaixo)
  • Salve “nome do arquivo + informações de localização + trecho de texto”

Mecanismo de pesquisa iterativa em várias rodadas (no máximo 5 vezes)

Todos os tipos de arquivo adotam uma estratégia de iteração unificada:

  1. Controle de iteração
    • Manutenção do contador de “número de tentativas de pesquisa”, com limite máximo de 5 vezes
    • O contador é incrementado após cada tentativa de recuperação
  2. Fluxo de cada rodada de iteração
    1. Geração/atualização de palavras-chave de pesquisa com base na consulta (podem incluir sinônimos e termos relacionados)
    2. Selecionar arquivos ou partes de arquivos que ainda não foram pesquisados de forma adequada
    3. Executar a busca (grep/leitura local/chamada de Skill específica)
    4. Analisar os trechos de contexto obtidos
    5. Avaliar se são suficientes para responder à pergunta
  3. Condições de encerramento
    • Encontrar contexto suficiente para fundamentar a resposta; ou
    • Atingir 5 tentativas sem encontrar informações adequadas
  4. Tratamento em caso de informações insuficientes
    • Informar claramente ao usuário que faltam informações ou que elas podem não estar na base de conhecimento atual
    • Fornecer a informação mais próxima encontrada e explicar a incerteza
    • Sugira ao usuário como ele pode restringir a pesquisa (nome de arquivo mais específico, palavras-chave, intervalo de tempo etc.)

Observações

  • É proibido chamar diretamente, logo na primeira tentativa:Glob "knowledge" in . ou qualquer chamada que tente determinar a existência de um diretório usando Glob; a existência do diretório deve ser verificada por meio de comandos do shell (como test -d) para verificar a existência de diretórios.
  • Ao consultar a base de conhecimento com esta Skill, é proibido utilizar outras ferramentas, como pesquisas na internet, para obter informações

Políticas específicas para diferentes tipos de arquivos

1. Arquivos do tipo Markdown / texto (.md, .txt, .log etc.)

  1. Seleção de arquivos candidatos

    • Com base data_structure.md e do nome e caminho do arquivo
    • Priorizar a busca por arquivos do tipo título e índice (como documentos de resumo, visão geral do projeto)
  2. Localização com grep e leitura parcial

    • Utilizar a ferramenta grep nos arquivos candidatos especificados, com o parâmetro `include` para restringir a busca a extensões específicas (como "*.md")
    • Para arquivos com correspondência, use o Read para ler apenas a região local próxima à correspondência:
      • Controle a leitura por meio do deslocamento de linha e do parâmetro `limit` (por exemplo, lendo algumas dezenas de linhas antes e depois da linha correspondente)
      • Evite a leitura do arquivo inteiro
  3. Tratamento especial

    • Se o conteúdo for apenas um índice/título, continue a localização do conteúdo mais detalhado com base em links ou nomes de seções
    • Aplique o “mecanismo de pesquisa iterativa em várias rodadas” (consulte os princípios gerais de pesquisa acima)

2. Estratégia de pesquisa em arquivos PDF

Fluxo de trabalho:

  1. Primeiro: ler o guia de métodos de processamento

    • Antes de processar qualquer PDF, é necessário ler o arquivo references/pdf_reading.md (observe que esse diretório está localizado no diretório Skills, e não no diretório Knowledge)
    • Pontos importantes a serem compreendidos: o comando pdftotext, o uso do pdfplumber, métodos de extração de tabelas e a tabela de decisões rápidas
  2. Seleção dos PDFs candidatos

    • De acordo com data_structure.md , selecione de 1 a 3 arquivos mais relevantes
    • Se o usuário indicar um arquivo PDF específico, desse arquivo será dada prioridade
  3. Aplique os métodos aprendidos para extrair o texto

    • Utilize as ferramentas recomendadas no arquivo pdf_reading.md (de preferência pdftotext ou pdfplumber)
    • Importante: use pdftotext input.pdf output.txt Extrai o texto para um arquivo; não o envie diretamente para o stdout (para evitar o consumo excessivo de tokens)
    • Para extrair tabelas, use o recurso de extração de tabelas do pdfplumber
  4. Execute uma pesquisa nos resultados extraídos

    • Use o grep para realizar uma busca por palavras-chave no texto extraído
    • Para cada ocorrência, extraia o contexto próximo à ocorrência (dezenas de linhas acima e abaixo ou algumas páginas adjacentes)
    • Salve como “nome do arquivo + número da página/localização aproximada + trecho de texto”
    • Aplique o “mecanismo de pesquisa iterativo em várias rodadas” (consulte os princípios gerais de pesquisa acima)

3. Estratégia de pesquisa em arquivos do Excel

Fluxo de trabalho:

  1. Primeiro: ler o guia de métodos de processamento

    • Antes de processar qualquer arquivo do Excel, é necessário ler:
      • references/excel_reading.md — aprenda como ler planilhas (observe que esse diretório está localizado no diretório Skills, e não no diretório Knowledge)
      • references/excel_analysis.md — aprenda a analisar dados (observe que esse arquivo está localizado na pasta “Skills”, e não na pasta “Knowledge”)
    • Destaque: métodos de leitura do pandas, filtragem de colunas, filtragem de dados e operações de agregação
  2. Selecione um arquivo Excel candidato

    • Com base data_structure.md e à nomenclatura dos arquivos/planilhas, selecione a planilha mais relevante
    • Dê prioridade a pastas de trabalho/planilhas que contenham palavras-chave como “relatório”, “estatística”, “log”, “configuração” e “mapeamento”
    • Se o usuário indicar um arquivo do Excel específico, use esse arquivo prioritariamente
  3. Aplicar os métodos aprendidos para explorar a estrutura

    • Use o pandas para ler as primeiras 10 a 50 linhas (utilizando nrows limites de parâmetros)
    • Foco: nomes de colunas/campos, tipos de dados (numéricos, datas, texto), campos-chave
    • Comparar os nomes das colunas com a questão do usuário para identificar possíveis campos-chave (como “renda”, “vendas”, “error_code”, etc.)
  4. Executar a recuperação e a análise de dados

    • Utilizar os métodos do pandas aprendidos para filtrar e agregar (por exemplo, df[df['column'] == value])
    • ler apenas os dados próximos às linhas correspondentes de cada vez, evitando a leitura da tabela inteira de uma só vez
    • Se a pergunta incluir um intervalo de tempo, inclua um filtro de data na consulta
    • Aplicar o “mecanismo de recuperação iterativa em várias rodadas” (consulte os princípios gerais de recuperação acima)

Integração com outras ferramentas

Processamento de PDF

  • Antes de processar um PDF, é necessário ler o arquivo references/pdf_reading.md para aprender os métodos de processamento
  • Utilize o pdfplumber/pypdf para extração de texto, extração de tabelas e leitura de metadados
  • Priorizar o uso da ferramenta de linha de comando pdftotext para extração rápida de texto

Processamento de Excel

  • Antes de processar arquivos Excel, é necessário ler:
    • references/excel_reading.md — para aprender os métodos de leitura
    • references/excel_analysis.md — para aprender os métodos de análise
  • Utilizar o pandas para exploração, visualização, filtragem e análise de dados

Princípios de uso das ferramentas

  • Grep: usado para localizar números de linha e trechos correspondentes a palavras-chave em um arquivo específico; sempre especifique os parâmetros `include` e `path` da forma mais precisa possível
  • Read: usado apenas para leitura parcial de arquivos; sempre defina um `limit` razoável (por exemplo, 200 a 500 linhas) e um deslocamento adequado
  • Para qualquer arquivo que possa ser muito grande:
    • É proibido ler diretamente do início ao fim
    • Sempre reduza o escopo primeiro por meio de índices, diretórios, palavras-chave etc. antes de ler

Estilo de resposta e tratamento de erros

  • Estilo de resposta
    • Tente responder utilizando a mesma língua em que o usuário formulou a pergunta (chinês/inglês).
    • Apresente primeiro a conclusão e, em seguida, uma breve justificativa.
    • Se necessário, liste em seguida os arquivos citados e a localização aproximada, por exemplo:
      • Fonte: design/api_gateway.md, por volta da linha 100
      • Fonte: reports/2023_Q1_sales.xlsx, planilha “Summary”
  • Quando houver informações ausentes ou incertas
    • Deixe claro que não foi encontrada nenhuma informação que corresponda exatamente à consulta na base de conhecimento atual ou que a resposta seja apenas parcial.
    • Não invente fatos.
    • Sugira ao usuário como ele pode ajudar a restringir a busca:
      • especificar um diretório/arquivo mais específico
      • Forneça palavras-chave ou nomes de campos mais precisos
      • Especificar um intervalo de tempo/versão
Ver no GitHub
---
name: kb-retriever
description: Retrieves and answers questions from a local knowledge base directory by navigating hierarchical index files, then progressively searching Markdown, PDF, and Excel files using grep, Read, pdfplumber, and pandas.
---

# 本地知识库检索 Skill(kb-retriever)

## 知识库目录说明

- 知识库存放在一个根目录下,包含多种文件类型(如 `.md`/`.txt`、`.pdf`、`.xlsx` 等),通常按类型或业务用途拆分为多级子目录。
- 采用**分层目录索引文件**:
  - 根目录有一个 `data_structure.md`,说明主要的「领域目录」及其用途。
  - 每个领域目录下可以有自己的 `data_structure.md`,说明该目录下有哪些子目录/文件,以及各自用途。
  - 更深一层的子目录也可以继续有 `data_structure.md`,形成多级索引树。
- 知识库根目录约定:
  - 默认认为知识库位于当前项目根目录下的 `knowledge/` 目录。
  - 如果用户在对话中明确指定了其他路径(例如“我的知识库在 /data/kb”或“用 ./docs 这个目录作为知识库”),则以用户指定的路径作为根目录。
  - 当默认路径 `knowledge/` 不存在或访问失败时,应向用户确认实际的知识库根目录位置,而不是随意猜测。
- 单个业务文件可能很大:
  - 不要直接用 Read 读取整文件
  - 对 PDF、Excel 使用对应 Skill 进行结构化处理后,再结合 grep/局部读取做精细检索

### 定位 `knowledge` 根目录

- 根目录优先听用户:如果用户给了路径(如 `./docs`、`./knowledge-personal`),直接用用户提供的路径。
- 默认根目录:否则约定根目录为当前项目下的 `knowledge/`。
  - 使用 shell 显式检查目录是否存在:优先使用 `test -d knowledge`,或退而求其次使用 `ls -d knowledge`。
  - 注意:禁止使用 `Glob "knowledge" in .` 这类模式来判断目录是否存在,`Glob` 只返回文件路径,不返回目录本身,空结果并不能区分“目录不存在”和“目录存在但为空”。
- 只有在根目录已通过 `test -d` 等方式确认存在时,才使用 Glob 在该目录下检索内容,并把目录作为 `path`,例如:
  - 索引文件:`pattern="**/data_structure.md"`, `path="knowledge"`
  - 所有 Markdown:`pattern="**/*.md"`, `path="knowledge"`
- 如果默认 `knowledge/` 不存在(`test -d` 失败):不要猜测其他目录,明确告诉用户未找到默认根目录,并让用户指定实际知识库路径。

## 关键原则:先学习,再处理

**遇到 PDF 或 Excel 文件时的强制检查清单**:

- [ ] ✅ 已读取对应的 references 文档学习处理方法
- [ ] ✅ 已理解推荐的工具和命令
- [ ] ✅ 已将文件处理(提取/转换)完成
- [ ] ⏭️ 现在可以开始检索

**禁止行为**:
- ❌ 在未读取 pdf_reading.md 的情况下直接尝试处理 PDF
- ❌ 在未读取 excel_reading.md 的情况下直接尝试处理 Excel
- ❌ 跳过文件处理步骤,直接对原始 PDF/Excel 进行检索

## 总体流程

1. 理解用户需求
   - 读用户问题,提取:
     - 主题/领域关键词(如“销售报表”“系统架构”“接口文档”)
     - 时间或范围限定(如“2023 年 Q1”“最近版本”)
     - 需要的输出类型(解释、摘要、具体字段数值等)
   - 确定知识库根目录:
     - 优先检查用户是否在问题中指定了知识库路径。
     - 否则使用默认根目录 `knowledge/`。
     - 若默认根目录不存在或目录结构异常,应向用户询问确认,而不是自行假设。

2. 分层查看目录索引 `data_structure.md`
   - 使用一个「当前工作目录」的概念:
     - 默认从用户指定的知识库根目录开始;如果用户未指定,则使用当前目录。
   - 在当前工作目录下,如果存在 `data_structure.md`:
     - 使用 Read 读取该文件的前若干行(例如 limit=300),必要时分段继续读取。
     - 目标:
       - 了解当前目录下有哪些子目录和文件
       - 理解每个子目录/文件的用途说明
     - 基于用户问题,挑选**最相关的若干个子目录或文件**,构成候选集合。
   - 对于候选子目录:
     - 递归进入该子目录,将其作为新的「当前工作目录」,继续查找其中的 `data_structure.md` 并重复上述过程。
     - 在递归过程中,避免一次性深入所有分支,优先沿着与问题最相关的路径向下钻取。
   - 对于候选业务文件(md/文本、PDF、Excel 等):
     - 在完成必要的目录层级探索后,收集这些文件为最终的**检索目标列表**。
   - 在优先级排序时:
     - 优先选择用途说明与问题主题高度匹配的领域目录和文件
     - 其次考虑时间/版本等约束(如果索引中有体现)
     - 通用说明类文档(如 README.md、总体设计类文档)放在较后优先级

3. 学习文件处理方法(遇到 PDF/Excel 时强制执行)
   - **在处理 PDF 文件前**:
     - **必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)学习提取方法
     - 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法
   - **在处理 Excel 文件前**:
     - **必须先读取** [references/excel_reading.md](references/excel_reading.md)学习读取方法
     - **必须先读取** [references/excel_analysis.md](references/excel_analysis.md)学习分析方法
     - 重点了解:pandas 读取、列筛选、数据过滤
   - **目的**:确保使用正确的工具和方法,避免盲目检索

4. 按文件类型执行处理和检索
   - 使用刚学到的方法处理文件(提取、转换、结构化)
   - 对每类候选文件,按照下面「Markdown/文本」「PDF」「Excel」策略执行
   - 总原则:
     - 优先从最相关、最精确的文件开始
     - 每个文件内都渐进式地局部检索,避免一次性加载全内容
     - 若当前文件得不到满意信息,切换到下一个候选文件

5. 迭代检索
   - 所有文件类型都使用统一的「多轮迭代检索机制」(见上文公共检索原则)

6. 答案组织与溯源
   - 汇总多轮检索得到的上下文,综合回答用户问题。
   - 尽量:
     - 给出清晰、直接的回答
     - 指出使用过的文件名(必要时包含大致位置,如章节或大概行数/页数)
   - 如果答案基于推断或信息不完全:
     - 明确标注假设与不确定性
     - 提示用户可以补充更具体的文件范围或关键词

## 公共检索原则

### 关键词选择策略
- 从用户问题提取 3-8 个关键词(含可能的英文缩写、同义词、上位/下位词)
- 可组合词组(如 "销售 报表"、"API 接口 超时")
- 必要时包含业务词、技术术语、常见缩写(如 "uv"、"pv"、"GMV")

### grep 检索基本原则
- 始终指定尽量精准的 include 和 path,避免搜索整个目录
- pattern 优先尝试问题中的核心名词、术语,再尝试同义词
- 对于每个命中,只读取匹配附近的局部区域(上下若干行)
- 保存「文件名 + 位置信息 + 文本片段」

### 多轮迭代检索机制(最多 5 次)
所有文件类型都采用统一的迭代策略:
1. **迭代控制**
   - 维护「已尝试检索次数」计数,最多 5 次
   - 每次检索后累加计数
2. **每轮迭代流程**
   1. 基于问题生成/更新检索关键词(可包括同义词、扩展词)
   2. 选择尚未充分检索的文件或文件部分
   3. 执行检索(grep/局部读取/专用 Skill 调用)
   4. 分析获取的上下文片段
   5. 判断是否足够回答问题
3. **终止条件**
   - 找到足够支撑回答的上下文;或
   - 已达到 5 次尝试仍未找到合适信息
4. **信息不足时的处理**
   - 明确告知用户信息缺失或可能不在当前知识库中
   - 提供已找到的最接近信息,并说明不确定性
   - 提示用户可以如何缩小范围(更具体的文件名、关键词、时间范围等)

### 注意事项

- 禁止第一次就直接调用:`Glob "knowledge" in .` 或任何试图用 Glob 判定目录存在性的调用,目录存在性应通过 shell 命令(如 `test -d`)检查。
- 使用本 Skill 查询知识库时,禁止使用网络搜索等其他工具获取知识

## 针对不同文件类型的具体策略

### 1. Markdown / 文本类文件(.md, .txt, .log 等)

1. **候选文件选择**
   - 根据 `data_structure.md` 和文件名、路径判断相关度
   - 优先检索标题和目录类文件(如汇总文档、设计总览)

2. **grep 定位与局部读取**
   - 使用 Grep 工具对指定候选文件,include 限定具体后缀(如 "*.md")
   - 对于有匹配的文件,使用 Read 仅读取匹配附近的局部区域:
     - 通过行号偏移和 limit 控制读取(例如从匹配行附近往前后各读取几十行)
     - 避免整文件读取

3. **特殊处理**
   - 如内容仅是目录/标题,根据链接或小节名继续定位深入内容
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

### 2. PDF 文件检索策略

**工作流**:

1. **首先:读取处理方法指南**
   - 在处理任何 PDF 之前,**必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
   - 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法、快速决策表
   
2. **选择候选 PDF**
   - 根据 `data_structure.md` 中的描述,选择最相关的 1-3 个文件
   - 如果用户指明具体 PDF 文件,则优先使用该文件

3. **应用学到的方法提取文本**
   - 使用 pdf_reading.md 中推荐的工具(优先 pdftotext 或 pdfplumber)
   - **重要**:使用 `pdftotext input.pdf output.txt` 将文本提取到文件,不要直接输出到 stdout(避免占用大量 token)
   - 如需提取表格,使用 pdfplumber 的表格提取功能
   
4. **对提取结果执行检索**
   - 使用 grep 对提取的文本进行关键词搜索
   - 对于每个命中,提取命中附近范围的上下文(上下数十行或相邻几页)
   - 保存「文件名 + 页码/大致位置 + 文本片段」
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

### 3. Excel 文件检索策略

**工作流**:

1. **首先:读取处理方法指南**
   - 在处理任何 Excel 之前,**必须先读取**:
     - [references/excel_reading.md](references/excel_reading.md) - 学习如何读取工作表(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
     - [references/excel_analysis.md](references/excel_analysis.md) - 学习如何分析数据(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
   - 重点了解:pandas 读取方法、列筛选、数据过滤、聚合操作
   
2. **选择候选 Excel**
   - 根据 `data_structure.md` 和文件/工作表命名,选择最相关的表
   - 优先选择包含「报表」「统计」「日志」「配置」「映射」等关键词的工作簿/工作表
   - 若用户指明具体 Excel 文件,优先使用该文件

3. **应用学到的方法探索结构**
   - 使用 pandas 读取前 10-50 行(使用 `nrows` 参数限制)
   - 重点掌握:列名/字段名、数据类型(数值、日期、文本)、关键字段
   - 将列名与用户问题比对,识别潜在关键字段(如「收入」「销售额」「error_code」等)
   
4. **执行数据检索和分析**
   - 使用学到的 pandas 方法进行过滤和聚合(如 `df[df['column'] == value]`)
   - 每次只读取匹配行附近的数据,避免一次性读取整表
   - 如问题包含时间范围,在检索中加入时间过滤
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

## 与其他工具的协同

### PDF 处理
- **在处理 PDF 前必须先读取** [references/pdf_reading.md](references/pdf_reading.md) 学习处理方法
- 使用 pdfplumber/pypdf 进行文本提取、表格提取、元数据读取
- 优先使用 pdftotext 命令行工具进行快速文本提取

### Excel 处理
- **在处理 Excel 前必须先读取**:
  - [references/excel_reading.md](references/excel_reading.md) - 学习读取方法
  - [references/excel_analysis.md](references/excel_analysis.md) - 学习分析方法
- 使用 pandas 进行数据探索、预览、过滤和分析

### 工具使用原则
- **Grep**:用于按关键词在指定文件中查找行号与匹配片段,始终指定尽量精准的 include 和 path
- **Read**:只用于局部读取文件,始终设置合理的 limit(如 200-500 行)和合适的偏移
- **对于任何可能很大的文件**:
  - 禁止直接从头读到尾
  - 始终先通过索引、目录、关键词等方式缩小范围后再读

## 回答风格与错误处理

- 回答风格
  - 尽量用用户提问的语言(中文/英文)作答。
  - 先给出结论,再给出简要依据。
  - 如需要,可在后面列出引用的文件和大致位置,例如:
    - 来源:design/api_gateway.md 第 100 行附近
    - 来源:reports/2023_Q1_sales.xlsx Summary 工作表
- 信息缺失或不确定时
  - 明确说明在当前知识库中没有找到完全匹配的信息或只能部分回答。
  - 不臆造事实。
  - 提示用户可以如何帮助缩小范围:
    - 指定更具体的目录/文件
    - 提供更精确的关键词或字段名
    - 指定时间/版本范围


 

Instalar kb-retriever

Baixe e extraia os arquivos de habilidades para o diretório .claude/skills/.

Baixar ZIP

Clone o repositório e copie os arquivos da habilidade para o seu projeto.

git clone https://github.com/ConardLi/garden-skills/tree/main/skills/kb-retriever # Copy SKILL.md to your .claude/skills/ directory

Copiar Copiar
Configuração rápida: Copie a pasta da habilidade para .claude/skills/ O Claude detectará e utilizará a habilidade automaticamente
Repositório ConardLi/garden-skills

Habilidades relacionadas

microservices-patterns
Tempo atualizado 29 de Junho de 2026
jpa-patterns
Tempo atualizado 30 de Junho de 2026
fabric-lakehouse
Tempo atualizado 30 de Junho de 2026
prisma-expert
Tempo atualizado 29 de Junho de 2026
OR