Option

Ruft Fragen aus einem lokalen Wissensdatenbankverzeichnis ab und beantwortet diese, indem es hierarchische Indexdateien durchläuft und anschließend Markdown-, PDF- und Excel-Dateien schrittweise mithilfe von grep, Read, pdfplumber und pandas durchsucht.

...Alle erweitern
0
Zeit aktualisiert 30. September 2026

Suche in der lokalen Wissensdatenbank – Skill (kb-retriever)

Erläuterungen zum Wissensdatenbankverzeichnis

  • Die Wissensdatenbank ist in einem Stammverzeichnis abgelegt und enthält verschiedene Dateitypen (z. B. .md/.txt、.pdf、.xlsx usw.) und ist in der Regel nach Typ oder Verwendungszweck in mehrstufige Unterverzeichnisse unterteilt.
  • Die Dateien werden in einer hierarchischen Verzeichnisstruktur indiziert:
    • Im Stammverzeichnis befindet sich eine data_structure.md, in der die wichtigsten „Bereichsverzeichnisse“ und deren Verwendungszweck beschrieben werden.
    • Jedes Fachverzeichnis kann ein eigenes data_structure.md, in dem aufgeführt ist, welche Unterverzeichnisse/Dateien sich in diesem Verzeichnis befinden und welchem Zweck sie jeweils dienen.
    • Auch Unterverzeichnisse auf tieferer Ebene können wiederum data_structure.mdund bilden so eine mehrstufige Verzeichnisstruktur.
  • Konvention für das Stammverzeichnis der Wissensdatenbank:
    • Standardmäßig wird davon ausgegangen, dass sich die Wissensdatenbank im Verzeichnis knowledge/ .
    • Wenn der Benutzer im Dialog ausdrücklich einen anderen Pfad angibt (z. B. „Meine Wissensdatenbank befindet sich unter /data/kb“ oder „Verwende den Ordner ./docs als Wissensdatenbank“), gilt der vom Benutzer angegebene Pfad als Stammverzeichnis.
    • Wenn der Standardpfad knowledge/ nicht vorhanden ist oder der Zugriff fehlschlägt, sollte der Benutzer nach dem tatsächlichen Speicherort des Stammverzeichnisses der Wissensdatenbank gefragt werden, anstatt willkürliche Vermutungen anzustellen.
  • Einzelne Geschäftsdokumente können sehr groß sein:
    • Lesen Sie nicht direkt die gesamte Datei mit „Read“
    • Verwenden Sie für PDF- und Excel-Dateien die entsprechenden Skills zur Strukturierung und führen Sie anschließend mithilfe von grep oder lokalem Lesen eine detaillierte Suche durch

Lokalisierung knowledge Stammverzeichnis

  • Stammverzeichnis: Bevorzugt die Angaben des Benutzers: Wenn der Benutzer einen Pfad angibt (z. B. ./docs、./knowledge-personal), wird direkt der vom Benutzer angegebene Pfad verwendet.
  • Standard-Stammverzeichnis: Andernfalls gilt als Stammverzeichnis das Verzeichnis knowledge/。
    • Exprimite mit der Shell prüfen, ob das Verzeichnis existiert: Vorzugsweise test -d knowledgeverwendet, oder alternativ ls -d knowledge。
    • Hinweis: Die Verwendung von Glob "knowledge" in . solcher Muster zur Feststellung, ob ein Verzeichnis existiert,Glob da dabei nur der Dateipfad zurückgegeben wird, nicht das Verzeichnis selbst; ein leeres Ergebnis lässt keine Unterscheidung zwischen „Verzeichnis existiert nicht“ und „Verzeichnis existiert, ist aber leer“ zu.
  • Erst wenn das Stammverzeichnis bereits durch test -d bestätigt wurde, sollte man mit Glob nach Inhalten in diesem Verzeichnis suchen und das Verzeichnis als path, zum Beispiel:
    • Indexdatei:pattern="**/data_structure.md", path="knowledge"
    • Alle Markdown-Dateien:pattern="**/*.md", path="knowledge"
  • Wenn standardmäßig knowledge/ nicht vorhanden ist (test -d Fehler): Versuchen Sie nicht, andere Verzeichnisse zu erraten, sondern teilen Sie dem Benutzer ausdrücklich mit, dass das Standard-Stammverzeichnis nicht gefunden wurde, und lassen Sie ihn den tatsächlichen Pfad zur Wissensdatenbank angeben.

Grundprinzip: Erst lernen, dann verarbeiten

Obligatorische Checkliste beim Auftreten von PDF- oder Excel-Dateien:

  • ✅ Die entsprechenden Referenzdokumente zur Verarbeitungsmethode wurden gelesen
  • ✅ Die empfohlenen Tools und Befehle wurden verstanden
  • ✅ Die Verarbeitung der Datei (Extrahieren/Konvertieren) ist abgeschlossen
  • ⏭️ Jetzt kann mit der Recherche begonnen werden

Verbotene Vorgehensweisen:

  • ❌ Versuchen Sie nicht, PDF-Dateien zu verarbeiten, ohne zuvor die Datei „pdf_reading.md“ gelesen zu haben
  • ❌ Versuchen, Excel-Dateien direkt zu verarbeiten, ohne zuvor die Datei „excel_reading.md“ gelesen zu haben
  • ❌ Die Dateiverarbeitungsschritte überspringen und direkt eine Suche in den Original-PDF- bzw. Excel-Dateien durchführen

Gesamtablauf

  1. Benutzeranforderungen verstehen

    • Benutzeranfrage lesen und Folgendes extrahieren:
      • Themen-/Fachschlüsselwörter (z. B. „Verkaufsberichte“, „Systemarchitektur“, „Schnittstellendokumentation“)
      • Zeitliche oder bereichsbezogene Einschränkungen (z. B. „1. Quartal 2023“, „neueste Version“)
      • Gewünschte Ausgabeform (Erläuterung, Zusammenfassung, konkrete Feldwerte usw.)
    • Ermitteln des Stammverzeichnisses der Wissensdatenbank:
      • Zunächst prüfen, ob der Nutzer in seiner Frage einen Pfad zur Wissensdatenbank angegeben hat.
      • Andernfalls wird das Standard-Stammverzeichnis verwendet knowledge/。
      • Sollte das Standard-Stammverzeichnis nicht vorhanden sein oder die Verzeichnisstruktur fehlerhaft sein, sollte der Benutzer um Bestätigung gebeten werden, anstatt eigene Annahmen zu treffen.
  2. Anzeige des Verzeichnisindexes in Hierarchieebenen data_structure.md

    • Verwenden Sie das Konzept eines „aktuellen Arbeitsverzeichnisses“:
      • Standardmäßig wird vom vom Benutzer angegebenen Stammverzeichnis der Wissensdatenbank ausgegangen; hat der Benutzer nichts angegeben, wird das aktuelle Verzeichnis verwendet.
    • Wenn im aktuellen Arbeitsverzeichnis eine Datei data_structure.md:
      • Lesen Sie die ersten paar Zeilen der Datei mit „Read“ ein (z. B. limit=300) und lesen Sie bei Bedarf in Abschnitten weiter.
      • Ziel:
        • Ermitteln, welche Unterverzeichnisse und Dateien sich im aktuellen Verzeichnis befinden
        • die Zweckbeschreibungen der einzelnen Unterverzeichnisse/Dateien zu verstehen
      • Ausgehend von der Benutzeranfrage werden die relevantesten Unterverzeichnisse oder Dateien ausgewählt, um eine Kandidatenmenge zu bilden.
    • Für die Unterverzeichnisse der Kandidatenliste:
      • Rekursiv in diesen Unterordner wechseln, ihn als neuen „aktuellen Arbeitsordner“ festlegen und die Suche darin fortsetzen data_structure.md und wiederholen den oben beschriebenen Vorgang.
      • Vermeiden Sie es während des rekursiven Durchlaufs, alle Verzweigungen auf einmal zu durchforsten, und verfolgen Sie vorrangig den Pfad, der für das Problem am relevantesten ist.
    • Für die in Frage kommenden Geschäftsdokumente (MD/Text, PDF, Excel usw.):
      • Nach Abschluss der erforderlichen Durchsuchung der Verzeichnisebenen werden diese Dateien in einer endgültigen Liste der Suchtreffer zusammengefasst.
    • Bei der Priorisierung:
      • Wählen Sie vorrangig Bereichsverzeichnisse und Dateien aus, deren Verwendungszweck in hohem Maße mit dem Thema des Problems übereinstimmt.
      • Berücksichtigen Sie an zweiter Stelle Einschränkungen wie Zeit oder Version (sofern diese im Index erfasst sind)
      • Allgemeine Anleitungen (z. B. README.md, Dokumente zur Gesamtkonzeption) erhalten eine niedrigere Priorität
  3. Lernen Sie die Methoden zur Dateiverarbeitung (zwingend anzuwenden bei PDF- und Excel-Dateien)

    • Vor der Verarbeitung von PDF-Dateien:
      • Lesen Sie zunächst unbedingt die Datei „references/pdf_reading.md“ (beachten Sie, dass sich dieses Verzeichnis im Verzeichnis „Skills“ und nicht im Verzeichnis „Knowledge“ befindet). Lernen Sie die Methoden zur Extraktion kennen
      • Schwerpunkt: Der Befehl „pdftotext“, die Verwendung von „pdfplumber“ und Methoden zur Tabellen-Extraktion
    • Vor der Bearbeitung von Excel-Dateien:
      • Lesen Sie zunächst die Datei „references/excel_reading.md“, um die Auslesemethoden zu erlernen
      • Lesen Sie zunächst die Datei „references/excel_analysis.md“, um die Analysemethoden zu erlernen
      • Wichtige Inhalte: Einlesen mit pandas, Spaltenauswahl, Datenfilterung
    • Ziel: Sicherstellen, dass die richtigen Werkzeuge und Methoden verwendet werden, um eine blindes Durchsuchen zu vermeiden
  4. Führen Sie die Verarbeitung und das Abrufen entsprechend dem Dateityp durch

    • Verarbeiten Sie die Dateien mit den gerade erlernten Methoden (Extrahieren, Konvertieren, Strukturieren)
    • Für jede Kategorie von in Frage kommenden Dateien die folgenden Strategien anwenden: „Markdown/Text“, „PDF“, „Excel“
    • Allgemeiner Grundsatz:
      • Beginnen Sie vorrangig mit den relevantesten und präzisesten Dokumenten
      • Führen Sie in jeder Datei schrittweise eine partielle Suche durch, um zu vermeiden, dass der gesamte Inhalt auf einmal geladen wird
      • Wenn die aktuelle Datei keine zufriedenstellenden Informationen liefert, wechsle zur nächsten in Frage kommenden Datei
  5. Iterative Suche

    • Für alle Dokumenttypen wird ein einheitlicher „Mehrrunden-Iterationsmechanismus“ verwendet (siehe oben: Allgemeine Suchprinzipien)
  6. Antwortgestaltung und Quellenangabe

    • Der aus mehreren Suchrunden gewonnene Kontext wird zusammengefasst, um die Frage des Nutzers umfassend zu beantworten.
    • Soweit möglich:
      • klare und direkte Antworten zu geben
      • die Namen der verwendeten Dokumente angeben (ggf. einschließlich der ungefähren Position, z. B. Kapitel oder ungefähre Zeilen-/Seitenzahl)
    • Falls die Antwort auf Vermutungen beruht oder die Informationen unvollständig sind:
      • Weisen Sie ausdrücklich auf Annahmen und Unsicherheiten hin
      • Weisen Sie den Nutzer darauf hin, dass er den Dokumentbereich oder die Stichwörter konkretisieren kann

Grundsätze der öffentlichen Recherche

Strategie zur Auswahl von Schlüsselwörtern

  • 3–8 Schlüsselwörter aus der Nutzeranfrage extrahieren (einschließlich möglicher englischer Abkürzungen, Synonyme sowie Ober- und Unterbegriffe)
  • Kombinierbare Wortgruppen (z. B. „Verkaufsberichte“, „API-Timeout“)
  • Bei Bedarf Fachbegriffe, technische Begriffe und gängige Abkürzungen einbeziehen (z. B. „uv“, „pv“, „GMV“)

Grundprinzipien der grep-Suche

  • Geben Sie stets möglichst präzise „include“- und „path“-Angaben an, um eine Suche im gesamten Verzeichnis zu vermeiden
  • Versuchen Sie bei „pattern“, zunächst die Kernbegriffe und Fachbegriffe aus der Anfrage zu verwenden, bevor Sie auf Synonyme zurückgreifen
  • Lesen Sie bei jedem Treffer nur den lokalen Bereich in der Nähe der Übereinstimmung (einige Zeilen darüber und darunter)
  • Speichern Sie „Dateiname + Positionsangabe + Textausschnitt“

Mehrstufiger iterativer Suchmechanismus (maximal 5 Durchläufe)

Für alle Dateitypen wird eine einheitliche Iterationsstrategie angewendet:

  1. Iterationssteuerung
    • Führt einen Zähler für die „Anzahl der Suchversuche“ (maximal 5)
    • Der Zähler wird nach jeder Suche erhöht
  2. Ablauf einer Iterationsrunde
    1. Erstellung/Aktualisierung von Suchbegriffen auf Basis der Anfrage (kann Synonyme und erweiterte Begriffe enthalten)
    2. Auswahl von Dateien oder Dateiteilen, die noch nicht ausreichend durchsucht wurden
    3. Durchführung der Suche (grep/lokales Auslesen/Aufruf eines speziellen Skills)
    4. Analyse der gewonnenen Kontextfragmente
    5. Beurteilung, ob diese zur Beantwortung der Frage ausreichen
  3. Abbruchkriterien
    • Es wurde ausreichend Kontext gefunden, der die Antwort stützt; oder
    • Nach 5 Versuchen wurden noch keine geeigneten Informationen gefunden
  4. Vorgehensweise bei unzureichenden Informationen
    • Den Nutzer ausdrücklich darüber informieren, dass Informationen fehlen oder möglicherweise nicht in der aktuellen Wissensdatenbank enthalten sind
    • Die am ehesten passende Information bereitstellen und die Unsicherheit erläutern
    • Dem Nutzer Hinweise geben, wie er die Suche eingrenzen kann (konkretere Dateinamen, Stichwörter, Zeitrahmen usw.)

Zu beachtende Punkte

  • Es ist verboten, beim ersten Mal direkt folgende Aufrufe zu verwenden:Glob "knowledge" in . oder jegliche Aufrufe, die versuchen, die Existenz eines Verzeichnisses mit „Glob“ zu prüfen; die Existenz eines Verzeichnisses sollte über einen Shell-Befehl (z. B. test -d) überprüft werden.
  • Bei der Abfrage der Wissensdatenbank mit diesem Skill ist die Verwendung anderer Tools wie der Internetsuche zum Abrufen von Wissen untersagt

Konkrete Richtlinien für verschiedene Dateitypen

1. Markdown-/Textdateien (.md, .txt, .log usw.)

  1. Auswahl der in Frage kommenden Dateien

    • Basierend auf data_structure.md dem Dateinamen und dem Pfad
    • Vorrangige Suche nach Titeln und Dokumenten mit Inhaltsverzeichnis (z. B. Zusammenfassungsdokumente, Designübersichten)
  2. Lokalisierung und partielles Einlesen mit grep

    • Verwendung des Grep-Tools für bestimmte Kandidatendateien, wobei mit „include“ bestimmte Dateiendungen (z. B. „*.md“) eingeschränkt werden
    • Bei Dateien mit Übereinstimmungen wird mit „Read“ nur der lokale Bereich um die Übereinstimmung herum gelesen:
      • Steuerung des Lesevorgangs über Zeilenversatz und „limit“ (z. B. jeweils einige Dutzend Zeilen vor und nach der übereinstimmenden Zeile lesen)
      • Vermeiden Sie das Einlesen der gesamten Datei
  3. Spezielle Behandlung

    • Wenn der Inhalt lediglich aus einem Inhaltsverzeichnis oder einer Überschrift besteht, wird anhand von Links oder Abschnittsnamen die Suche im Inhalt fortgesetzt
    • Anwendung des „mehrstufigen iterativen Suchmechanismus“ (siehe oben unter „Allgemeine Suchprinzipien“)

2. Suchstrategie für PDF-Dateien

Arbeitsablauf:

  1. Zunächst: Lesen Sie die Anleitung zur Verarbeitung

    • Bevor Sie eine PDF-Datei bearbeiten, müssen Sie zunächst die Datei „references/pdf_reading.md“ lesen (beachten Sie, dass sich dieses Verzeichnis im Ordner „Skills“ und nicht im Ordner „Knowledge“ befindet)
    • Wichtige Informationen: Der Befehl „pdftotext“, die Verwendung von „pdfplumber“, Methoden zur Tabellenextraktion und die Schnellentscheidungstabelle
  2. Auswahl der in Frage kommenden PDF-Dateien

    • Wählen Sie gemäß data_structure.md Wählen Sie die 1–3 relevantesten Dateien aus
    • Wenn der Benutzer eine bestimmte PDF-Datei angibt, wird diese vorrangig verwendet
  3. Wenden Sie die erlernten Methoden zur Textextraktion an

    • Verwenden Sie die in pdf_reading.md empfohlenen Tools (vorrangig pdftotext oder pdfplumber)
    • Wichtig: Verwenden Sie pdftotext input.pdf output.txt den Text in eine Datei extrahieren, nicht direkt über stdout ausgeben (um den Verbrauch einer großen Anzahl von Tokens zu vermeiden)
    • Zum Extrahieren von Tabellen die Tabellen-Extraktionsfunktion von pdfplumber verwenden
  4. Führen Sie eine Suche in den extrahierten Ergebnissen durch

    • Führen Sie mit `grep` eine Stichwortsuche im extrahierten Text durch
    • Extrahieren Sie für jeden Treffer den Kontext im Umfeld des Treffers (die obigen und unteren Dutzend Zeilen oder die benachbarten Seiten)
    • Speichern Sie „Dateiname + Seitenzahl/ungefähre Position + Textausschnitt“
    • Wenden Sie den „Mehrrunden-Iterationsmechanismus“ an (siehe oben unter „Allgemeine Suchprinzipien“)

3. Strategie zur Suche in Excel-Dateien

Ablauf:

  1. Zunächst: Leitfaden zur Verarbeitungsmethode lesen

    • Bevor Sie eine Excel-Datei bearbeiten, müssen Sie zunächst Folgendes lesen:
      • references/excel_reading.md – Erfahren Sie, wie man Arbeitsblätter ausliest (beachten Sie, dass sich dieses Verzeichnis im Verzeichnis „Skills“ und nicht im Verzeichnis „Knowledge“ befindet)
      • references/excel_analysis.md – Hier erfahren Sie, wie Sie Daten analysieren (beachten Sie, dass sich dieser Ordner im Verzeichnis „Skills“ und nicht im Verzeichnis „Knowledge“ befindet)
    • Besondere Schwerpunkte: pandas-Leseverfahren, Spaltenauswahl, Datenfilterung, Aggregationsoperationen
  2. Auswahl einer geeigneten Excel-Datei

    • Anhand data_structure.md und der Benennung der Dateien/Arbeitsblätter die relevanteste Tabelle auswählen
    • Bevorzugen Sie Arbeitsmappen/Arbeitsblätter, die Schlüsselwörter wie „Bericht“, „Statistik“, „Protokoll“, „Konfiguration“ oder „Zuordnung“ enthalten
    • Wenn der Benutzer eine bestimmte Excel-Datei angibt, wird diese Datei vorrangig verwendet
  3. Wenden Sie die erlernten Methoden an, um die Struktur zu erkunden

    • Lese mit pandas die ersten 10–50 Zeilen ein (unter Berücksichtigung von nrows Parameterbegrenzung)
    • Schwerpunkt: Spaltennamen/Feldnamen, Datentypen (Zahlen, Datumsangaben, Text), Schlüsselfelder
    • Vergleiche die Spaltennamen mit den Fragen des Benutzers, um potenzielle Schlüsselfelder zu identifizieren (z. B. „Einkommen“, „Umsatz“, „error_code“ usw.)
  4. Datenabfrage und -analyse durchführen

    • Filtern und Aggregieren mit den erlernten pandas-Methoden (z. B. df[df['column'] == value])
    • Lesen Sie jeweils nur die Daten in der Nähe der übereinstimmenden Zeilen ein, um zu vermeiden, dass die gesamte Tabelle auf einmal eingelesen wird
    • Wenn die Frage einen Zeitrahmen enthält, fügen Sie bei der Abfrage einen Zeitfilter hinzu
    • Anwendung des „Mehrrundigen Iterationsabfrageverfahrens“ (siehe oben unter „Allgemeine Abfrageprinzipien“)

Zusammenarbeit mit anderen Tools

PDF-Verarbeitung

  • Vor der Bearbeitung von PDF-Dateien muss zunächst die Datei „references/pdf_reading.md“ gelesen werden, um die Vorgehensweise zu erlernen
  • Verwenden Sie pdfplumber/pypdf zur Textextraktion, Tabellenextraktion und zum Auslesen von Metadaten
  • Für eine schnelle Textextraktion sollte vorzugsweise das Befehlszeilentool „pdftotext“ verwendet werden

Excel-Verarbeitung

  • Bevor Sie Excel-Dateien verarbeiten, müssen Sie unbedingt folgende Datei lesen:
    • references/excel_reading.md – hier erfahren Sie, wie das Einlesen funktioniert
    • references/excel_analysis.md – Erlernen der Analysemethoden
  • Verwenden Sie pandas zur Datenexploration, Vorschau, Filterung und Analyse

Grundsätze zur Verwendung der Tools

  • Grep: Dient zum Suchen von Zeilennummern und übereinstimmenden Fragmenten anhand von Schlüsselwörtern in einer bestimmten Datei; geben Sie stets möglichst genaue „include“- und „path“-Angaben an
  • Read: Dient ausschließlich zum partiellen Einlesen von Dateien; legen Sie stets einen angemessenen „limit“-Wert (z. B. 200–500 Zeilen) und einen geeigneten Offset fest
  • Bei Dateien, die möglicherweise sehr groß sind:
    • Darf nicht direkt von Anfang bis Ende gelesen werden
    • Schränken Sie den Umfang stets zunächst durch Indizes, Verzeichnisse, Schlüsselwörter usw. ein, bevor Sie mit dem Lesen beginnen

Antwortstil und Fehlerbehandlung

  • Antwortstil
    • Antworten Sie möglichst in der Sprache der Nutzerfrage (Chinesisch/Englisch).
    • Geben Sie zunächst die Schlussfolgerung an, gefolgt von einer kurzen Begründung.
    • Falls erforderlich, können Sie anschließend die zitierten Dokumente und deren ungefähre Position angeben, zum Beispiel:
      • Quelle: design/api_gateway.md, etwa in Zeile 100
      • Quelle: reports/2023_Q1_sales.xlsx, Arbeitsblatt „Summary“
  • Bei fehlenden oder ungewissen Informationen
    • Geben Sie deutlich an, dass in der aktuellen Wissensdatenbank keine vollständig übereinstimmenden Informationen gefunden wurden oder die Frage nur teilweise beantwortet werden kann.
    • Erfinden Sie keine Fakten.
    • Geben Sie dem Nutzer Hinweise, wie er die Suche eingrenzen kann:
      • Geben Sie spezifischere Verzeichnisse/Dateien an
      • Geben Sie präzisere Schlüsselwörter oder Feldnamen an
      • einen Zeit- bzw. Versionsbereich angeben
Auf GitHub ansehen
---
name: kb-retriever
description: Retrieves and answers questions from a local knowledge base directory by navigating hierarchical index files, then progressively searching Markdown, PDF, and Excel files using grep, Read, pdfplumber, and pandas.
---

# 本地知识库检索 Skill(kb-retriever)

## 知识库目录说明

- 知识库存放在一个根目录下,包含多种文件类型(如 `.md`/`.txt`、`.pdf`、`.xlsx` 等),通常按类型或业务用途拆分为多级子目录。
- 采用**分层目录索引文件**:
  - 根目录有一个 `data_structure.md`,说明主要的「领域目录」及其用途。
  - 每个领域目录下可以有自己的 `data_structure.md`,说明该目录下有哪些子目录/文件,以及各自用途。
  - 更深一层的子目录也可以继续有 `data_structure.md`,形成多级索引树。
- 知识库根目录约定:
  - 默认认为知识库位于当前项目根目录下的 `knowledge/` 目录。
  - 如果用户在对话中明确指定了其他路径(例如“我的知识库在 /data/kb”或“用 ./docs 这个目录作为知识库”),则以用户指定的路径作为根目录。
  - 当默认路径 `knowledge/` 不存在或访问失败时,应向用户确认实际的知识库根目录位置,而不是随意猜测。
- 单个业务文件可能很大:
  - 不要直接用 Read 读取整文件
  - 对 PDF、Excel 使用对应 Skill 进行结构化处理后,再结合 grep/局部读取做精细检索

### 定位 `knowledge` 根目录

- 根目录优先听用户:如果用户给了路径(如 `./docs`、`./knowledge-personal`),直接用用户提供的路径。
- 默认根目录:否则约定根目录为当前项目下的 `knowledge/`。
  - 使用 shell 显式检查目录是否存在:优先使用 `test -d knowledge`,或退而求其次使用 `ls -d knowledge`。
  - 注意:禁止使用 `Glob "knowledge" in .` 这类模式来判断目录是否存在,`Glob` 只返回文件路径,不返回目录本身,空结果并不能区分“目录不存在”和“目录存在但为空”。
- 只有在根目录已通过 `test -d` 等方式确认存在时,才使用 Glob 在该目录下检索内容,并把目录作为 `path`,例如:
  - 索引文件:`pattern="**/data_structure.md"`, `path="knowledge"`
  - 所有 Markdown:`pattern="**/*.md"`, `path="knowledge"`
- 如果默认 `knowledge/` 不存在(`test -d` 失败):不要猜测其他目录,明确告诉用户未找到默认根目录,并让用户指定实际知识库路径。

## 关键原则:先学习,再处理

**遇到 PDF 或 Excel 文件时的强制检查清单**:

- [ ] ✅ 已读取对应的 references 文档学习处理方法
- [ ] ✅ 已理解推荐的工具和命令
- [ ] ✅ 已将文件处理(提取/转换)完成
- [ ] ⏭️ 现在可以开始检索

**禁止行为**:
- ❌ 在未读取 pdf_reading.md 的情况下直接尝试处理 PDF
- ❌ 在未读取 excel_reading.md 的情况下直接尝试处理 Excel
- ❌ 跳过文件处理步骤,直接对原始 PDF/Excel 进行检索

## 总体流程

1. 理解用户需求
   - 读用户问题,提取:
     - 主题/领域关键词(如“销售报表”“系统架构”“接口文档”)
     - 时间或范围限定(如“2023 年 Q1”“最近版本”)
     - 需要的输出类型(解释、摘要、具体字段数值等)
   - 确定知识库根目录:
     - 优先检查用户是否在问题中指定了知识库路径。
     - 否则使用默认根目录 `knowledge/`。
     - 若默认根目录不存在或目录结构异常,应向用户询问确认,而不是自行假设。

2. 分层查看目录索引 `data_structure.md`
   - 使用一个「当前工作目录」的概念:
     - 默认从用户指定的知识库根目录开始;如果用户未指定,则使用当前目录。
   - 在当前工作目录下,如果存在 `data_structure.md`:
     - 使用 Read 读取该文件的前若干行(例如 limit=300),必要时分段继续读取。
     - 目标:
       - 了解当前目录下有哪些子目录和文件
       - 理解每个子目录/文件的用途说明
     - 基于用户问题,挑选**最相关的若干个子目录或文件**,构成候选集合。
   - 对于候选子目录:
     - 递归进入该子目录,将其作为新的「当前工作目录」,继续查找其中的 `data_structure.md` 并重复上述过程。
     - 在递归过程中,避免一次性深入所有分支,优先沿着与问题最相关的路径向下钻取。
   - 对于候选业务文件(md/文本、PDF、Excel 等):
     - 在完成必要的目录层级探索后,收集这些文件为最终的**检索目标列表**。
   - 在优先级排序时:
     - 优先选择用途说明与问题主题高度匹配的领域目录和文件
     - 其次考虑时间/版本等约束(如果索引中有体现)
     - 通用说明类文档(如 README.md、总体设计类文档)放在较后优先级

3. 学习文件处理方法(遇到 PDF/Excel 时强制执行)
   - **在处理 PDF 文件前**:
     - **必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)学习提取方法
     - 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法
   - **在处理 Excel 文件前**:
     - **必须先读取** [references/excel_reading.md](references/excel_reading.md)学习读取方法
     - **必须先读取** [references/excel_analysis.md](references/excel_analysis.md)学习分析方法
     - 重点了解:pandas 读取、列筛选、数据过滤
   - **目的**:确保使用正确的工具和方法,避免盲目检索

4. 按文件类型执行处理和检索
   - 使用刚学到的方法处理文件(提取、转换、结构化)
   - 对每类候选文件,按照下面「Markdown/文本」「PDF」「Excel」策略执行
   - 总原则:
     - 优先从最相关、最精确的文件开始
     - 每个文件内都渐进式地局部检索,避免一次性加载全内容
     - 若当前文件得不到满意信息,切换到下一个候选文件

5. 迭代检索
   - 所有文件类型都使用统一的「多轮迭代检索机制」(见上文公共检索原则)

6. 答案组织与溯源
   - 汇总多轮检索得到的上下文,综合回答用户问题。
   - 尽量:
     - 给出清晰、直接的回答
     - 指出使用过的文件名(必要时包含大致位置,如章节或大概行数/页数)
   - 如果答案基于推断或信息不完全:
     - 明确标注假设与不确定性
     - 提示用户可以补充更具体的文件范围或关键词

## 公共检索原则

### 关键词选择策略
- 从用户问题提取 3-8 个关键词(含可能的英文缩写、同义词、上位/下位词)
- 可组合词组(如 "销售 报表"、"API 接口 超时")
- 必要时包含业务词、技术术语、常见缩写(如 "uv"、"pv"、"GMV")

### grep 检索基本原则
- 始终指定尽量精准的 include 和 path,避免搜索整个目录
- pattern 优先尝试问题中的核心名词、术语,再尝试同义词
- 对于每个命中,只读取匹配附近的局部区域(上下若干行)
- 保存「文件名 + 位置信息 + 文本片段」

### 多轮迭代检索机制(最多 5 次)
所有文件类型都采用统一的迭代策略:
1. **迭代控制**
   - 维护「已尝试检索次数」计数,最多 5 次
   - 每次检索后累加计数
2. **每轮迭代流程**
   1. 基于问题生成/更新检索关键词(可包括同义词、扩展词)
   2. 选择尚未充分检索的文件或文件部分
   3. 执行检索(grep/局部读取/专用 Skill 调用)
   4. 分析获取的上下文片段
   5. 判断是否足够回答问题
3. **终止条件**
   - 找到足够支撑回答的上下文;或
   - 已达到 5 次尝试仍未找到合适信息
4. **信息不足时的处理**
   - 明确告知用户信息缺失或可能不在当前知识库中
   - 提供已找到的最接近信息,并说明不确定性
   - 提示用户可以如何缩小范围(更具体的文件名、关键词、时间范围等)

### 注意事项

- 禁止第一次就直接调用:`Glob "knowledge" in .` 或任何试图用 Glob 判定目录存在性的调用,目录存在性应通过 shell 命令(如 `test -d`)检查。
- 使用本 Skill 查询知识库时,禁止使用网络搜索等其他工具获取知识

## 针对不同文件类型的具体策略

### 1. Markdown / 文本类文件(.md, .txt, .log 等)

1. **候选文件选择**
   - 根据 `data_structure.md` 和文件名、路径判断相关度
   - 优先检索标题和目录类文件(如汇总文档、设计总览)

2. **grep 定位与局部读取**
   - 使用 Grep 工具对指定候选文件,include 限定具体后缀(如 "*.md")
   - 对于有匹配的文件,使用 Read 仅读取匹配附近的局部区域:
     - 通过行号偏移和 limit 控制读取(例如从匹配行附近往前后各读取几十行)
     - 避免整文件读取

3. **特殊处理**
   - 如内容仅是目录/标题,根据链接或小节名继续定位深入内容
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

### 2. PDF 文件检索策略

**工作流**:

1. **首先:读取处理方法指南**
   - 在处理任何 PDF 之前,**必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
   - 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法、快速决策表
   
2. **选择候选 PDF**
   - 根据 `data_structure.md` 中的描述,选择最相关的 1-3 个文件
   - 如果用户指明具体 PDF 文件,则优先使用该文件

3. **应用学到的方法提取文本**
   - 使用 pdf_reading.md 中推荐的工具(优先 pdftotext 或 pdfplumber)
   - **重要**:使用 `pdftotext input.pdf output.txt` 将文本提取到文件,不要直接输出到 stdout(避免占用大量 token)
   - 如需提取表格,使用 pdfplumber 的表格提取功能
   
4. **对提取结果执行检索**
   - 使用 grep 对提取的文本进行关键词搜索
   - 对于每个命中,提取命中附近范围的上下文(上下数十行或相邻几页)
   - 保存「文件名 + 页码/大致位置 + 文本片段」
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

### 3. Excel 文件检索策略

**工作流**:

1. **首先:读取处理方法指南**
   - 在处理任何 Excel 之前,**必须先读取**:
     - [references/excel_reading.md](references/excel_reading.md) - 学习如何读取工作表(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
     - [references/excel_analysis.md](references/excel_analysis.md) - 学习如何分析数据(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
   - 重点了解:pandas 读取方法、列筛选、数据过滤、聚合操作
   
2. **选择候选 Excel**
   - 根据 `data_structure.md` 和文件/工作表命名,选择最相关的表
   - 优先选择包含「报表」「统计」「日志」「配置」「映射」等关键词的工作簿/工作表
   - 若用户指明具体 Excel 文件,优先使用该文件

3. **应用学到的方法探索结构**
   - 使用 pandas 读取前 10-50 行(使用 `nrows` 参数限制)
   - 重点掌握:列名/字段名、数据类型(数值、日期、文本)、关键字段
   - 将列名与用户问题比对,识别潜在关键字段(如「收入」「销售额」「error_code」等)
   
4. **执行数据检索和分析**
   - 使用学到的 pandas 方法进行过滤和聚合(如 `df[df['column'] == value]`)
   - 每次只读取匹配行附近的数据,避免一次性读取整表
   - 如问题包含时间范围,在检索中加入时间过滤
   - 应用「多轮迭代检索机制」(见上文公共检索原则)

## 与其他工具的协同

### PDF 处理
- **在处理 PDF 前必须先读取** [references/pdf_reading.md](references/pdf_reading.md) 学习处理方法
- 使用 pdfplumber/pypdf 进行文本提取、表格提取、元数据读取
- 优先使用 pdftotext 命令行工具进行快速文本提取

### Excel 处理
- **在处理 Excel 前必须先读取**:
  - [references/excel_reading.md](references/excel_reading.md) - 学习读取方法
  - [references/excel_analysis.md](references/excel_analysis.md) - 学习分析方法
- 使用 pandas 进行数据探索、预览、过滤和分析

### 工具使用原则
- **Grep**:用于按关键词在指定文件中查找行号与匹配片段,始终指定尽量精准的 include 和 path
- **Read**:只用于局部读取文件,始终设置合理的 limit(如 200-500 行)和合适的偏移
- **对于任何可能很大的文件**:
  - 禁止直接从头读到尾
  - 始终先通过索引、目录、关键词等方式缩小范围后再读

## 回答风格与错误处理

- 回答风格
  - 尽量用用户提问的语言(中文/英文)作答。
  - 先给出结论,再给出简要依据。
  - 如需要,可在后面列出引用的文件和大致位置,例如:
    - 来源:design/api_gateway.md 第 100 行附近
    - 来源:reports/2023_Q1_sales.xlsx Summary 工作表
- 信息缺失或不确定时
  - 明确说明在当前知识库中没有找到完全匹配的信息或只能部分回答。
  - 不臆造事实。
  - 提示用户可以如何帮助缩小范围:
    - 指定更具体的目录/文件
    - 提供更精确的关键词或字段名
    - 指定时间/版本范围


 

kb-retriever installieren

Laden Sie die Skill-Dateien herunter und entpacken Sie sie in Ihr Verzeichnis „.claude/skills/“.

ZIP herunterladen

Klonen Sie das Repository und kopieren Sie die Skill-Dateien in Ihr Projekt.

git clone https://github.com/ConardLi/garden-skills/tree/main/skills/kb-retriever # Copy SKILL.md to your .claude/skills/ directory

Kopieren Kopieren
Schnelle Einrichtung: Kopiere den Skill-Ordner nach .claude/skills/ Claude erkennt den Skill automatisch und nutzt ihn.

Ähnliche Skills

microservices-patterns
Zeit aktualisiert 29. Juni 2026
jpa-patterns
Zeit aktualisiert 30. Juni 2026
fabric-lakehouse
Zeit aktualisiert 30. Juni 2026
prisma-expert
Zeit aktualisiert 29. Juni 2026
OR