option

Récupère et répond aux questions issues d'un répertoire de base de connaissances locale en parcourant des fichiers d'index hiérarchiques, puis en effectuant une recherche progressive dans des fichiers Markdown, PDF et Excel à l'aide de grep, Read, pdfplumber et pandas.

...Développer tout
0
Heure mise à jour 30 septembre 2026

Recherche dans la base de connaissances locale Skill (kb-retriever)

Description du répertoire de la base de connaissances

  • La base de connaissances est stockée dans un répertoire racine et contient divers types de fichiers (tels que .md/.txt、.pdf、.xlsx etc.), généralement répartis en sous-répertoires à plusieurs niveaux selon leur type ou leur utilisation opérationnelle.
  • Les fichiers sont indexés selon une structure de répertoires hiérarchique :
    • Le répertoire racine contient un fichier data_structure.mdfichier décrivant les principaux « répertoires thématiques » et leur utilité.
    • Chaque répertoire de domaine peut disposer de son propre data_structure.md, décrivant les sous-répertoires et fichiers qu’il contient, ainsi que leur utilisation respective.
    • Les sous-répertoires situés à un niveau plus profond peuvent également comporter data_structure.md, formant ainsi une arborescence d’index à plusieurs niveaux.
  • Convention relative au répertoire racine de la base de connaissances :
    • par défaut, la base de connaissances est située dans le répertoire knowledge/ .
    • Si l’utilisateur a explicitement spécifié un autre chemin d’accès dans la conversation (par exemple « Ma base de connaissances se trouve dans /data/kb » ou « Utilisez le répertoire ./docs comme base de connaissances »), le chemin d’accès spécifié par l’utilisateur est alors considéré comme le répertoire racine.
    • Lorsque le chemin par défaut knowledge/ n’existe pas ou que l’accès échoue, il convient de demander confirmation à l’utilisateur quant à l’emplacement réel du répertoire racine de la base de connaissances, plutôt que de faire des suppositions arbitraires.
  • Un fichier métier peut être très volumineux :
    • ne lisez pas directement le fichier entier avec la fonction Read
    • pour les fichiers PDF et Excel, utilisez les Skills correspondants afin de les structurer, puis combinez cette opération avec grep ou une lecture partielle pour effectuer une recherche précise

Localiser knowledge répertoire racine

  • Répertoire racine : privilégier les indications de l’utilisateur. Si celui-ci fournit un chemin d’accès (par exemple ./docs、./knowledge-personal), utilisez directement le chemin fourni par l’utilisateur.
  • Répertoire racine par défaut : dans le cas contraire, le répertoire racine est par convention défini comme étant knowledge/。
    • Vérifier explicitement l’existence du répertoire à l’aide du shell : privilégier l’utilisation de test -d knowledge, ou à défaut, utiliser ls -d knowledge。
    • Remarque : il est interdit d’utiliser Glob "knowledge" in . ce type de modèle pour déterminer si un répertoire existe,Glob car cela ne renvoie que le chemin d’accès au fichier, et non le répertoire lui-même ; un résultat vide ne permet pas de distinguer si le « répertoire n’existe pas » ou s’il « existe mais est vide ».
  • Ce n’est qu’après avoir vérifié l’existence du répertoire racine à l’aide de test -d , n’utilisez Glob pour rechercher du contenu dans ce répertoire et ne traitez le répertoire que comme path, par exemple :
    • fichier d’index :pattern="**/data_structure.md", path="knowledge"
    • Tous les fichiers Markdown :pattern="**/*.md", path="knowledge"
  • Si, par défaut, knowledge/ n'existe pas (test -d échec) : ne pas deviner d’autres répertoires, indiquer clairement à l’utilisateur que le répertoire racine par défaut est introuvable et lui demander de spécifier le chemin d’accès réel à la base de connaissances.

Principe clé : apprendre d’abord, traiter ensuite

Liste de contrôle obligatoire en cas de fichiers PDF ou Excel :

  • ✅ Avoir lu le document de référence correspondant pour apprendre la méthode de traitement
  • ✅ Les outils et commandes recommandés ont été compris
  • ✅ Le traitement du fichier (extraction/conversion) est terminé
  • ⏭️ Vous pouvez désormais commencer la recherche

Comportements interdits :

  • ❌ Tenter de traiter un fichier PDF sans avoir lu au préalable le fichier pdf_reading.md
  • ❌ Tenter de traiter directement un fichier Excel sans avoir lu le fichier excel_reading.md
  • ❌ Sauter les étapes de traitement des fichiers et effectuer directement la recherche sur les fichiers PDF/Excel d'origine

Processus global

  1. Comprendre les besoins de l’utilisateur

    • Lire la question de l’utilisateur et en extraire :
      • les mots-clés relatifs au thème ou au domaine (par exemple « rapports de ventes », « architecture système », « documentation d’interface »)
      • Les contraintes temporelles ou de portée (par exemple « 1er trimestre 2023 », « dernière version »)
      • Type de résultat souhaité (explication, résumé, valeurs spécifiques de champs, etc.)
    • Déterminer le répertoire racine de la base de connaissances :
      • Vérifier en priorité si l’utilisateur a spécifié un chemin d’accès à la base de connaissances dans sa question.
      • Sinon, utiliser le répertoire racine par défaut knowledge/。
      • Si le répertoire racine par défaut n’existe pas ou si la structure du répertoire est anormale, il convient de demander confirmation à l’utilisateur plutôt que de formuler des hypothèses de son propre chef.
  2. Parcourir l’index des répertoires de manière hiérarchique data_structure.md

    • Utiliser le concept de « répertoire de travail actuel » :
      • par défaut, à partir du répertoire racine de la base de connaissances spécifié par l’utilisateur ; si l’utilisateur n’en a pas spécifié, utilisez le répertoire courant.
    • Dans le répertoire de travail actuel, si le fichier data_structure.md:
      • Lire les premières lignes du fichier à l’aide de la commande « Read » (par exemple, limit=300) ; si nécessaire, poursuivre la lecture par segments.
      • Objectif :
        • Identifier les sous-répertoires et fichiers présents dans le répertoire courant
        • Comprendre la description de l’utilisation de chaque sous-répertoire/fichier
      • En fonction de la requête de l’utilisateur, sélectionner les sous-répertoires ou fichiers les plus pertinents afin de constituer un ensemble de candidats.
    • Pour chaque sous-répertoire candidat :
      • pénétrer de manière récursive dans ce sous-répertoire, en le considérant comme le nouveau « répertoire de travail actuel », et poursuivre la recherche à l’intérieur de celui-ci data_structure.md et répéter le processus décrit ci-dessus.
      • Au cours de ce processus récursif, éviter d’explorer toutes les branches en même temps ; privilégier l’exploration des chemins les plus pertinents par rapport au problème.
    • Pour les fichiers métier candidats (md/texte, PDF, Excel, etc.) :
      • Une fois l’exploration nécessaire de la structure des répertoires terminée, regroupez ces fichiers pour constituer la liste finale des cibles de recherche.
    • Lors du classement par ordre de priorité :
      • privilégiez les répertoires et fichiers dont la description d’utilisation correspond étroitement au sujet du problème
      • Prenez ensuite en compte les contraintes telles que la date ou la version (si elles sont présentes dans l’index)
      • Les documents de nature générale (tels que README.md ou les documents de conception globale) sont classés à une priorité moindre
  3. Apprendre les méthodes de traitement des fichiers (à appliquer systématiquement en cas de fichiers PDF ou Excel)

    • Avant de traiter un fichier PDF :
      • Il faut d’abord lire le fichier references/pdf_reading.md (attention : ce répertoire se trouve dans le répertoire « Skills », et non dans le répertoire « Knowledge ») Apprendre les méthodes d’extraction
      • Points clés à maîtriser : la commande pdftotext, l’utilisation de pdfplumber, les méthodes d’extraction des tableaux
    • Avant de traiter des fichiers Excel :
      • Il faut d’abord lire le fichier references/excel_reading.md pour apprendre les méthodes de lecture
      • Il est indispensable de lire au préalable le fichier references/excel_analysis.md pour apprendre les méthodes d’analyse
      • Points clés à retenir : lecture avec pandas, filtrage des colonnes, filtrage des données
    • Objectif : s'assurer d'utiliser les bons outils et les bonnes méthodes, afin d'éviter toute recherche aveugle
  4. Effectuer le traitement et l’extraction en fonction du type de fichier

    • Traiter les fichiers à l’aide des méthodes que vous venez d’apprendre (extraction, conversion, structuration)
    • Pour chaque catégorie de fichiers candidats, appliquez les stratégies suivantes : « Markdown/texte », « PDF » et « Excel »
    • Principe général :
      • Commencer en priorité par les fichiers les plus pertinents et les plus précis
      • Effectuer une recherche locale progressive au sein de chaque fichier, en évitant de charger l’intégralité du contenu en une seule fois
      • Si le fichier actuel ne fournit pas d’informations satisfaisantes, passer au fichier candidat suivant
  5. Recherche itérative

    • Utiliser un « mécanisme de recherche itérative en plusieurs étapes » uniforme pour tous les types de documents (voir les principes généraux de recherche ci-dessus)
  6. Organisation et traçabilité des réponses

    • Synthétiser le contexte issu des recherches itératives pour apporter une réponse globale à la question de l’utilisateur.
    • Dans la mesure du possible :
      • de fournir des réponses claires et directes
      • Indiquer les noms des documents utilisés (en précisant, si nécessaire, leur emplacement approximatif, par exemple le chapitre ou le nombre approximatif de lignes/pages)
    • Si la réponse repose sur des déductions ou des informations incomplètes :
      • indiquer clairement les hypothèses et les incertitudes
      • Indiquez à l’utilisateur qu’il peut préciser davantage la portée du document ou ajouter des mots-clés

Principes de recherche publique

Stratégie de sélection des mots-clés

  • Extraire 3 à 8 mots-clés de la requête de l'utilisateur (y compris les éventuelles abréviations en anglais, les synonymes, les termes génériques et spécifiques)
  • Expressions combinables (par exemple « rapports de ventes », « délai d'expiration de l'API »)
  • Inclure, si nécessaire, des termes métier, des termes techniques et des abréviations courantes (par exemple « uv », « pv », « GMV »)

Principes de base de la recherche avec grep

  • Spécifier toujours des paramètres « include » et « path » aussi précis que possible, afin d’éviter de parcourir l’intégralité du répertoire
  • Pour le `pattern`, privilégier d’abord les noms et termes clés présents dans la question, puis essayer les synonymes
  • Pour chaque résultat, ne lire que la zone locale proche de la correspondance (quelques lignes en amont et en aval)
  • Enregistrer « nom de fichier + informations de position + extrait de texte »

Mécanisme de recherche itératif (5 itérations au maximum)

Une stratégie itérative uniforme est appliquée à tous les types de fichiers :

  1. Contrôle des itérations
    • Tenir à jour le compteur du « nombre de tentatives de recherche », avec un maximum de 5
    • Le compteur est incrémenté après chaque recherche
  2. Déroulement de chaque cycle d’itération
    1. Génération/mise à jour des mots-clés de recherche en fonction du problème (pouvant inclure des synonymes et des mots dérivés)
    2. Sélectionner les fichiers ou parties de fichiers qui n’ont pas encore été suffisamment explorés
    3. Effectuer la recherche (grep / lecture locale / appel d’une Skill dédiée)
    4. Analyse des extraits de contexte obtenus
    5. Déterminer si les informations sont suffisantes pour répondre à la question
  3. Conditions de sortie
    • Contexte suffisant pour étayer la réponse ; ou
    • 5 tentatives ont été effectuées sans trouver d’informations pertinentes
  4. Traitement en cas d’informations insuffisantes
    • Informer clairement l’utilisateur que l’information fait défaut ou qu’elle n’est peut-être pas présente dans la base de connaissances actuelle
    • Fournir l’information la plus proche trouvée, en précisant le degré d’incertitude
    • Indiquer à l’utilisateur comment affiner sa recherche (nom de fichier plus précis, mots-clés, période, etc.)

Points à retenir

  • Il est interdit d’appeler directement dès la première tentative :Glob "knowledge" in . ou tout appel visant à vérifier l’existence d’un répertoire à l’aide de Glob ; l’existence d’un répertoire doit être vérifiée via une commande shell (par exemple test -d).
  • Lors de l’utilisation de cette Skill pour interroger la base de connaissances, il est interdit d’utiliser d’autres outils, tels que les moteurs de recherche sur Internet, pour obtenir des informations

Stratégies spécifiques pour différents types de fichiers

1. Fichiers Markdown / fichiers texte ( .md, .txt, .log, etc.)

  1. Sélection des fichiers candidats

    • En fonction data_structure.md du nom et du chemin d’accès du fichier
    • Priorité accordée aux fichiers de type titre et table des matières (tels que les documents récapitulatifs, les aperçus de conception)
  2. Localisation et lecture partielle avec grep

    • Utilisation de l’outil grep sur les fichiers candidats spécifiés, avec l’opérateur « include » pour limiter la recherche à des extensions spécifiques (par exemple « *.md »)
    • Pour les fichiers contenant des correspondances, utiliser « Read » pour ne lire que la zone locale proche de la correspondance :
      • Contrôler la lecture à l’aide d’un décalage de ligne et de l’option `limit` (par exemple, lire quelques dizaines de lignes en avant et en arrière de la ligne correspondant à la correspondance)
      • Éviter la lecture intégrale du fichier
  3. Traitement particulier

    • Si le contenu se limite à une table des matières ou à des titres, poursuivre le positionnement vers le contenu détaillé en fonction des liens ou des noms de sous-sections
    • Appliquer le « mécanisme de recherche itératif en plusieurs étapes » (voir les principes généraux de recherche ci-dessus)

2. Stratégie de recherche dans les fichiers PDF

Flux de travail :

  1. Tout d’abord : lire le guide des méthodes de traitement

    • Avant de traiter tout fichier PDF, il est indispensable de lire le fichier references/pdf_reading.md (notez que ce répertoire se trouve dans le répertoire « Skills » et non dans le répertoire « Knowledge »)
    • Points clés à retenir : la commande pdftotext, l’utilisation de pdfplumber, les méthodes d’extraction de tableaux, le tableau d’aide à la décision rapide
  2. Sélection des fichiers PDF candidats

    • En fonction data_structure.md , sélectionnez 1 à 3 fichiers parmi les plus pertinents
    • Si l’utilisateur spécifie un fichier PDF en particulier, privilégiez ce fichier
  3. Appliquer les méthodes apprises pour extraire le texte

    • Utilisez les outils recommandés dans le fichier pdf_reading.md (de préférence pdftotext ou pdfplumber)
    • Important : utilisez pdftotext input.pdf output.txt Extrayez le texte vers un fichier, ne l’affichez pas directement sur stdout (pour éviter de consommer trop de tokens)
    • Pour extraire des tableaux, utiliser la fonctionnalité d’extraction de tableaux de pdfplumber
  4. Effectuez une recherche sur les résultats de l'extraction

    • Utilisez `grep` pour effectuer une recherche par mots-clés dans le texte extrait
    • Pour chaque occurrence, extraire le contexte autour de celle-ci (les dizaines de lignes au-dessus et en dessous ou les pages adjacentes)
    • Enregistrer « nom de fichier + numéro de page/emplacement approximatif + extrait de texte »
    • Appliquer le « mécanisme de recherche itérative en plusieurs étapes » (voir les principes généraux de recherche ci-dessus)

3. Stratégie de recherche dans les fichiers Excel

Flux de travail :

  1. Tout d’abord : lire le guide des méthodes de traitement

    • Avant de traiter tout fichier Excel, il est indispensable de lire :
      • references/excel_reading.md – pour apprendre à lire les feuilles de calcul (attention : ce répertoire se trouve dans le répertoire « Skills », et non dans le répertoire « Knowledge »)
      • references/excel_analysis.md – pour apprendre à analyser les données (attention : ce fichier se trouve dans le répertoire « Skills » et non dans le répertoire « Knowledge »)
    • Points clés à maîtriser : méthodes de lecture avec pandas, filtrage des colonnes, filtrage des données, opérations d’agrégation
  2. Sélection d’un fichier Excel candidat

    • En fonction data_structure.md et des noms des fichiers/feuilles de calcul, sélectionnez la feuille la plus pertinente
    • Privilégiez les classeurs/feuilles de calcul contenant des mots-clés tels que « rapport », « statistiques », « journal », « configuration » ou « mappage »
    • Si l’utilisateur précise un fichier Excel en particulier, privilégiez l’utilisation de ce fichier
  3. Appliquer les méthodes apprises pour explorer la structure

    • Utiliser pandas pour lire les 10 à 50 premières lignes (en respectant les nrows )
    • Points clés à maîtriser : noms de colonnes/champs, types de données (nombres, dates, texte), champs clés
    • Comparer les noms de colonnes avec les questions de l’utilisateur afin d’identifier les champs clés potentiels (tels que « revenu », « chiffre d’affaires », « error_code », etc.)
  4. Effectuer la recherche et l’analyse des données

    • Utiliser les méthodes pandas apprises pour filtrer et agréger les données (par exemple df[df['column'] == value])
    • ne lire à chaque fois que les données proches des lignes correspondantes, afin d’éviter de lire l’intégralité du tableau en une seule fois
    • Si la question comporte une plage de dates, ajouter un filtre temporel à la requête
    • Appliquer le « mécanisme de recherche itérative en plusieurs étapes » (voir les principes généraux de recherche ci-dessus)

Interaction avec d’autres outils

Traitement des PDF

  • Avant de traiter un PDF, il est indispensable de consulter le fichier references/pdf_reading.md pour prendre connaissance des méthodes de traitement
  • Utiliser pdfplumber/pypdf pour l'extraction de texte, l'extraction de tableaux et la lecture des métadonnées
  • Privilégier l’utilisation de l’outil en ligne de commande pdftotext pour une extraction rapide du texte

Traitement des fichiers Excel

  • Avant de traiter des fichiers Excel, vous devez d'abord consulter :
    • references/excel_reading.md – pour découvrir les méthodes de lecture
    • references/excel_analysis.md - pour découvrir les méthodes d'analyse
  • Utiliser pandas pour l'exploration, la prévisualisation, le filtrage et l'analyse des données

Principes d'utilisation des outils

  • Grep : sert à rechercher, dans un fichier donné, les numéros de ligne et les extraits correspondant à un mot-clé ; veillez à toujours spécifier des paramètres « include » et « path » aussi précis que possible
  • Read : à utiliser uniquement pour la lecture partielle de fichiers ; définissez toujours une limite raisonnable (par exemple, 200 à 500 lignes) et un décalage approprié
  • Pour tout fichier susceptible d’être volumineux :
    • il est interdit de lire directement le fichier de bout en bout
    • Commencez toujours par affiner la recherche à l’aide d’index, de répertoires ou de mots-clés avant de procéder à la lecture

Style de réponse et gestion des erreurs

  • Style de réponse
    • Répondez autant que possible dans la langue utilisée par l'utilisateur (chinois/anglais).
    • Commencez par présenter la conclusion, puis donnez brièvement les raisons qui la justifient.
    • Si nécessaire, vous pouvez indiquer à la fin les fichiers cités et leur emplacement approximatif, par exemple :
      • Source : design/api_gateway.md, vers la ligne 100
      • Source : reports/2023_Q1_sales.xlsx, feuille de calcul « Summary »
  • En cas d’informations manquantes ou incertaines
    • Précisez clairement qu’aucune information correspondant exactement n’a été trouvée dans la base de connaissances actuelle ou que la réponse n’est que partielle.
    • Ne pas inventer de faits.
    • Indiquez à l’utilisateur comment il peut aider à affiner la recherche :
      • en indiquant un répertoire ou un fichier plus précis
      • fournir des mots-clés ou des noms de champs plus précis
      • Spécifier une période ou une version
Voir sur GitHub
---
name: kb-retriever
description: Retrieves and answers questions from a local knowledge base directory by navigating hierarchical index files, then progressively searching Markdown, PDF, and Excel files using grep, Read, pdfplumber, and pandas.
---

# 本地知识库检索 Skill(kb-retriever)

## 知识库目录说明

- 知识库存放在一个根目录下,包含多种文件类型(如 `.md`/`.txt`、`.pdf`、`.xlsx` 等),通常按类型或业务用途拆分为多级子目录。
- 采用**分层目录索引文件**:
  - 根目录有一个 `data_structure.md`,说明主要的「领域目录」及其用途。
  - 每个领域目录下可以有自己的 `data_structure.md`,说明该目录下有哪些子目录/文件,以及各自用途。
  - 更深一层的子目录也可以继续有 `data_structure.md`,形成多级索引树。
- 知识库根目录约定:
  - 默认认为知识库位于当前项目根目录下的 `knowledge/` 目录。
  - 如果用户在对话中明确指定了其他路径(例如“我的知识库在 /data/kb”或“用 ./docs 这个目录作为知识库”),则以用户指定的路径作为根目录。
  - 当默认路径 `knowledge/` 不存在或访问失败时,应向用户确认实际的知识库根目录位置,而不是随意猜测。
- 单个业务文件可能很大:
  - 不要直接用 Read 读取整文件
  - 对 PDF、Excel 使用对应 Skill 进行结构化处理后,再结合 grep/局部读取做精细检索

### 定位 `knowledge` 根目录

- 根目录优先听用户:如果用户给了路径(如 `./docs`、`./knowledge-personal`),直接用用户提供的路径。
- 默认根目录:否则约定根目录为当前项目下的 `knowledge/`。
  - 使用 shell 显式检查目录是否存在:优先使用 `test -d knowledge`,或退而求其次使用 `ls -d knowledge`。
  - 注意:禁止使用 `Glob "knowledge" in .` 这类模式来判断目录是否存在,`Glob` 只返回文件路径,不返回目录本身,空结果并不能区分“目录不存在”和“目录存在但为空”。
- 只有在根目录已通过 `test -d` 等方式确认存在时,才使用 Glob 在该目录下检索内容,并把目录作为 `path`,例如:
  - 索引文件:`pattern="**/data_structure.md"`, `path="knowledge"`
  - 所有 Markdown:`pattern="**/*.md"`, `path="knowledge"`
- 如果默认 `knowledge/` 不存在(`test -d` 失败):不要猜测其他目录,明确告诉用户未找到默认根目录,并让用户指定实际知识库路径。

## 关键原则:先学习,再处理

**遇到 PDF 或 Excel 文件时的强制检查清单**:

- [ ] ✅ 已读取对应的 references 文档学习处理方法
- [ ] ✅ 已理解推荐的工具和命令
- [ ] ✅ 已将文件处理(提取/转换)完成
- [ ] ⏭️ 现在可以开始检索

**禁止行为**:
- ❌ 在未读取 pdf_reading.md 的情况下直接尝试处理 PDF
- ❌ 在未读取 excel_reading.md 的情况下直接尝试处理 Excel
- ❌ 跳过文件处理步骤,直接对原始 PDF/Excel 进行检索

## 总体流程

1. 理解用户需求
   - 读用户问题,提取:
     - 主题/领域关键词(如“销售报表”“系统架构”“接口文档”)
     - 时间或范围限定(如“2023 年 Q1”“最近版本”)
     - 需要的输出类型(解释、摘要、具体字段数值等)
   - 确定知识库根目录:
     - 优先检查用户是否在问题中指定了知识库路径。
     - 否则使用默认根目录 `knowledge/`。
     - 若默认根目录不存在或目录结构异常,应向用户询问确认,而不是自行假设。

2. 分层查看目录索引 `data_structure.md`
   - 使用一个「当前工作目录」的概念:
     - 默认从用户指定的知识库根目录开始;如果用户未指定,则使用当前目录。
   - 在当前工作目录下,如果存在 `data_structure.md`:
     - 使用 Read 读取该文件的前若干行(例如 limit=300),必要时分段继续读取。
     - 目标:
       - 了解当前目录下有哪些子目录和文件
       - 理解每个子目录/文件的用途说明
     - 基于用户问题,挑选**最相关的若干个子目录或文件**,构成候选集合。
   - 对于候选子目录:
     - 递归进入该子目录,将其作为新的「当前工作目录」,继续查找其中的 `data_structure.md` 并重复上述过程。
     - 在递归过程中,避免一次性深入所有分支,优先沿着与问题最相关的路径向下钻取。
   - 对于候选业务文件(md/文本、PDF、Excel 等):
     - 在完成必要的目录层级探索后,收集这些文件为最终的**检索目标列表**。
   - 在优先级排序时:
     - 优先选择用途说明与问题主题高度匹配的领域目录和文件
     - 其次考虑时间/版本等约束(如果索引中有体现)
     - 通用说明类文档(如 README.md、总体设计类文档)放在较后优先级

3. 学习文件处理方法(遇到 PDF/Excel 时强制执行)
   - **在处理 PDF 文件前**:
     - **必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)学习提取方法
     - 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法
   - **在处理 Excel 文件前**:
     - **必须先读取** [references/excel_reading.md](references/excel_reading.md)学习读取方法
     - **必须先读取** [references/excel_analysis.md](references/excel_analysis.md)学习分析方法
     - 重点了解:pandas 读取、列筛选、数据过滤
   - **目的**:确保使用正确的工具和方法,避免盲目检索

4. 按文件类型执行处理和检索
   - 使用刚学到的方法处理文件(提取、转换、结构化)
   - 对每类候选文件,按照下面「Markdown/文本」「PDF」「Excel」策略执行
   - 总原则:
     - 优先从最相关、最精确的文件开始
     - 每个文件内都渐进式地局部检索,避免一次性加载全内容
     - 若当前文件得不到满意信息,切换到下一个候选文件

5. 迭代检索
   - 所有文件类型都使用统一的「多轮迭代检索机制」(见上文公共检索原则)

6. 答案组织与溯源
   - 汇总多轮检索得到的上下文,综合回答用户问题。
   - 尽量:
     - 给出清晰、直接的回答
     - 指出使用过的文件名(必要时包含大致位置,如章节或大概行数/页数)
   - 如果答案基于推断或信息不完全:
     - 明确标注假设与不确定性
     - 提示用户可以补充更具体的文件范围或关键词

## 公共检索原则

### 关键词选择策略
- 从用户问题提取 3-8 个关键词(含可能的英文缩写、同义词、上位/下位词)
- 可组合词组(如 "销售 报表"、"API 接口 超时")
- 必要时包含业务词、技术术语、常见缩写(如 "uv"、"pv"、"GMV")

### grep 检索基本原则
- 始终指定尽量精准的 include 和 path,避免搜索整个目录
- pattern 优先尝试问题中的核心名词、术语,再尝试同义词
- 对于每个命中,只读取匹配附近的局部区域(上下若干行)
- 保存「文件名 + 位置信息 + 文本片段」

### 多轮迭代检索机制(最多 5 次)
所有文件类型都采用统一的迭代策略:
1. **迭代控制**
   - 维护「已尝试检索次数」计数,最多 5 次
   - 每次检索后累加计数
2. **每轮迭代流程**
   1. 基于问题生成/更新检索关键词(可包括同义词、扩展词)
   2. 选择尚未充分检索的文件或文件部分
   3. 执行检索(grep/局部读取/专用 Skill 调用)
   4. 分析获取的上下文片段
   5. 判断是否足够回答问题
3. **终止条件**
   - 找到足够支撑回答的上下文;或
   - 已达到 5 次尝试仍未找到合适信息
4. **信息不足时的处理**
   - 明确告知用户信息缺失或可能不在当前知识库中
   - 提供已找到的最接近信息,并说明不确定性
   - 提示用户可以如何缩小范围(更具体的文件名、关键词、时间范围等)

### 注意事项

- 禁止第一次就直接调用:`Glob "knowledge" in .` 或任何试图用 Glob 判定目录存在性的调用,目录存在性应通过 shell 命令(如 `test -d`)检查。
- 使用本 Skill 查询知识库时,禁止使用网络搜索等其他工具获取知识

## 针对不同文件类型的具体策略

### 1. Markdown / 文本类文件(.md, .txt, .log 等)

1. **候选文件选择**
   - 根据 `data_structure.md` 和文件名、路径判断相关度
   - 优先检索标题和目录类文件(如汇总文档、设计总览)

2. **grep 定位与局部读取**
   - 使用 Grep 工具对指定候选文件,include 限定具体后缀(如 "*.md")
   - 对于有匹配的文件,使用 Read 仅读取匹配附近的局部区域:
     - 通过行号偏移和 limit 控制读取(例如从匹配行附近往前后各读取几十行)
     - 避免整文件读取

3. **特殊处理**
   - 如内容仅是目录/标题,根据链接或小节名继续定位深入内容
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

### 2. PDF 文件检索策略

**工作流**:

1. **首先:读取处理方法指南**
   - 在处理任何 PDF 之前,**必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
   - 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法、快速决策表
   
2. **选择候选 PDF**
   - 根据 `data_structure.md` 中的描述,选择最相关的 1-3 个文件
   - 如果用户指明具体 PDF 文件,则优先使用该文件

3. **应用学到的方法提取文本**
   - 使用 pdf_reading.md 中推荐的工具(优先 pdftotext 或 pdfplumber)
   - **重要**:使用 `pdftotext input.pdf output.txt` 将文本提取到文件,不要直接输出到 stdout(避免占用大量 token)
   - 如需提取表格,使用 pdfplumber 的表格提取功能
   
4. **对提取结果执行检索**
   - 使用 grep 对提取的文本进行关键词搜索
   - 对于每个命中,提取命中附近范围的上下文(上下数十行或相邻几页)
   - 保存「文件名 + 页码/大致位置 + 文本片段」
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

### 3. Excel 文件检索策略

**工作流**:

1. **首先:读取处理方法指南**
   - 在处理任何 Excel 之前,**必须先读取**:
     - [references/excel_reading.md](references/excel_reading.md) - 学习如何读取工作表(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
     - [references/excel_analysis.md](references/excel_analysis.md) - 学习如何分析数据(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
   - 重点了解:pandas 读取方法、列筛选、数据过滤、聚合操作
   
2. **选择候选 Excel**
   - 根据 `data_structure.md` 和文件/工作表命名,选择最相关的表
   - 优先选择包含「报表」「统计」「日志」「配置」「映射」等关键词的工作簿/工作表
   - 若用户指明具体 Excel 文件,优先使用该文件

3. **应用学到的方法探索结构**
   - 使用 pandas 读取前 10-50 行(使用 `nrows` 参数限制)
   - 重点掌握:列名/字段名、数据类型(数值、日期、文本)、关键字段
   - 将列名与用户问题比对,识别潜在关键字段(如「收入」「销售额」「error_code」等)
   
4. **执行数据检索和分析**
   - 使用学到的 pandas 方法进行过滤和聚合(如 `df[df['column'] == value]`)
   - 每次只读取匹配行附近的数据,避免一次性读取整表
   - 如问题包含时间范围,在检索中加入时间过滤
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

## 与其他工具的协同

### PDF 处理
- **在处理 PDF 前必须先读取** [references/pdf_reading.md](references/pdf_reading.md) 学习处理方法
- 使用 pdfplumber/pypdf 进行文本提取、表格提取、元数据读取
- 优先使用 pdftotext 命令行工具进行快速文本提取

### Excel 处理
- **在处理 Excel 前必须先读取**:
  - [references/excel_reading.md](references/excel_reading.md) - 学习读取方法
  - [references/excel_analysis.md](references/excel_analysis.md) - 学习分析方法
- 使用 pandas 进行数据探索、预览、过滤和分析

### 工具使用原则
- **Grep**:用于按关键词在指定文件中查找行号与匹配片段,始终指定尽量精准的 include 和 path
- **Read**:只用于局部读取文件,始终设置合理的 limit(如 200-500 行)和合适的偏移
- **对于任何可能很大的文件**:
  - 禁止直接从头读到尾
  - 始终先通过索引、目录、关键词等方式缩小范围后再读

## 回答风格与错误处理

- 回答风格
  - 尽量用用户提问的语言(中文/英文)作答。
  - 先给出结论,再给出简要依据。
  - 如需要,可在后面列出引用的文件和大致位置,例如:
    - 来源:design/api_gateway.md 第 100 行附近
    - 来源:reports/2023_Q1_sales.xlsx Summary 工作表
- 信息缺失或不确定时
  - 明确说明在当前知识库中没有找到完全匹配的信息或只能部分回答。
  - 不臆造事实。
  - 提示用户可以如何帮助缩小范围:
    - 指定更具体的目录/文件
    - 提供更精确的关键词或字段名
    - 指定时间/版本范围


 

Installer kb-retriever

Téléchargez et décompressez les fichiers de compétences dans votre répertoire .claude/skills/.

Télécharger le ZIP

Clonez le dépôt et copiez les fichiers de compétence dans votre projet.

git clone https://github.com/ConardLi/garden-skills/tree/main/skills/kb-retriever # Copy SKILL.md to your .claude/skills/ directory

Copier Copier
Configuration rapide: Copiez le dossier de la compétence dans .claude/skills/ Claude détectera automatiquement la compétence et l'utilisera

Compétences similaires

microservices-patterns
Heure mise à jour 29 juin 2026
jpa-patterns
Heure mise à jour 30 juin 2026
fabric-lakehouse
Heure mise à jour 30 juin 2026
prisma-expert
Heure mise à jour 29 juin 2026
OR