kb-retriever
ConardLi/garden-skills
階層的なインデックスファイルを辿ってローカルのナレッジベースディレクトリから質問を取得・回答し、grep、Read、pdfplumber、pandas を使用して、Markdown、PDF、Excel ファイルを順次検索します。
...すべて拡張しますローカルナレッジベース検索スキル(kb-retriever)
ナレッジベースのディレクトリ説明
- ナレッジベースは1つのルートディレクトリ下に格納されており、さまざまなファイル形式(例:
.md/.txt、.pdf、.xlsxなど)が含まれており、通常は種類や業務用途に応じて多階層の子ディレクトリに分割されます。 - 階層的なディレクトリ構造でファイルをインデックス化しています:
- ルートディレクトリには
data_structure.mdがあり、主要な「分野別ディレクトリ」とその用途が記載されています。 - 各分野ディレクトリの下には、独自の
data_structure.mdがあり、そのディレクトリの下にあるサブディレクトリやファイル、およびそれぞれの用途を説明しています。 - さらに深い階層の子ディレクトリにも引き続き
data_structure.mdを作成し、多階層のインデックスツリーを形成することができます。
- ルートディレクトリには
- ナレッジベースのルートディレクトリに関する規定:
- デフォルトでは、ナレッジベースは現在のプロジェクトのルートディレクトリ下の
knowledge/ディレクトリにあるものとみなされます。 - ユーザーが対話の中で他のパスを明示的に指定した場合(例:「私のナレッジベースは /data/kb にあります」や「./docs ディレクトリをナレッジベースとして使用します」など)、ユーザー指定のパスをルートディレクトリとします。
- デフォルトのパスが
knowledge/が存在しない、またはアクセスに失敗した場合は、勝手に推測するのではなく、ユーザーに実際のナレッジベースのルートディレクトリの位置を確認する必要があります。
- デフォルトでは、ナレッジベースは現在のプロジェクトのルートディレクトリ下の
- 個々のビジネスファイルは容量が大きくなる可能性があります:
- Read を使用してファイル全体を直接読み込まないでください
- PDFやExcelについては、対応するSkillを使用して構造化処理を行った後、grepや部分読み取りを組み合わせて詳細な検索を行う
特定 knowledge ルートディレクトリ
- ルートディレクトリについては、ユーザーの指定を優先してください。ユーザーがパス(例:
./docs、./knowledge-personal)、ユーザーが指定したパスをそのまま使用します。 - デフォルトのルートディレクトリ:それ以外の場合は、ルートディレクトリを現在のプロジェクト下の
knowledge/。- シェルを使用してディレクトリの存在を明示的に確認する:優先的に
test -d knowledgeを優先し、それが不可能な場合はls -d knowledge。 - 注意:
Glob "knowledge" in .この種のパターンを使用してディレクトリの存在を確認することは禁止されています。Globファイルパスのみを返し、ディレクトリ自体は返さないため、結果が空の場合、「ディレクトリが存在しない」と「ディレクトリは存在するが空である」を区別できない。
- シェルを使用してディレクトリの存在を明示的に確認する:優先的に
- ルートディレクトリの存在が
test -dなどの方法で存在が確認された場合にのみ、Glob を使用してそのディレクトリ内のコンテンツを検索し、ディレクトリをpathとして扱ってください。例:- インデックスファイル:
pattern="**/data_structure.md",path="knowledge" - すべての Markdown:
pattern="**/*.md",path="knowledge"
- インデックスファイル:
- デフォルトで
knowledge/が存在しない場合(test -d失敗):他のディレクトリを推測せず、デフォルトのルートディレクトリが見つからないことをユーザーに明確に伝え、実際のナレッジベースのパスを指定してもらうようにしてください。
重要な原則:まず確認し、その後処理する
PDF や Excel ファイルに遭遇した際の必須チェックリスト:
- ✅ 対応する「references」ドキュメントを読み、処理方法を学習済み
- ✅ 推奨されるツールとコマンドを理解済み
- ✅ ファイルの処理(抽出/変換)を完了した
- ⏭️ これで検索を開始できます
禁止事項:
- ❌ pdf_reading.md を読まずに、いきなり PDF の処理を試みること
- ❌ excel_reading.md を読まずに、直接 Excel の処理を試みること
- ❌ ファイル処理の手順を飛ばし、元の PDF/Excel に対して直接検索を行うこと
全体的なフロー
ユーザー要件の把握
- ユーザーの質問を読み、以下を抽出する:
- テーマ/分野のキーワード(例:「売上レポート」「システムアーキテクチャ」「インターフェースドキュメント」)
- 期間または範囲の指定(例:「2023年第1四半期」「最新バージョン」)
- 必要な出力形式(解説、要約、具体的なフィールド値など)
- ナレッジベースのルートディレクトリを特定する:
- まず、ユーザーが質問の中でナレッジベースのパスを指定しているかどうかを確認する。
- 指定されていない場合は、デフォルトのルートディレクトリを使用する
knowledge/。 - デフォルトのルートディレクトリが存在しない、またはディレクトリ構造に異常がある場合は、独自に推測するのではなく、ユーザーに確認を求めること。
- ユーザーの質問を読み、以下を抽出する:
ディレクトリインデックスを階層的に確認する
data_structure.md- 「現在の作業ディレクトリ」という概念を使用する:
- デフォルトでは、ユーザーが指定したナレッジベースのルートディレクトリから開始します。ユーザーが指定していない場合は、現在のディレクトリを使用します。
- 現在の作業ディレクトリ下に
data_structure.md:- Read を使用してそのファイルの先頭数行(例:limit=300)を読み込み、必要に応じて分割して読み込みを継続する。
- 目的:
- 現在のディレクトリ下にどのようなサブディレクトリやファイルがあるかを把握する
- 各サブディレクトリ/ファイルの用途説明を理解する
- ユーザーの質問に基づき、最も関連性の高いサブディレクトリやファイルをいくつか選び出し、候補集合を構成する。
- 候補となるサブディレクトリについて:
- そのサブディレクトリへ再帰的に進入し、それを新しい「現在の作業ディレクトリ」として、その中の
data_structure.md検索を続け、上記のプロセスを繰り返す。 - 再帰処理中は、すべての分岐を一度に深く掘り下げることを避け、問題と最も関連性の高いパスを優先して探索する。
- そのサブディレクトリへ再帰的に進入し、それを新しい「現在の作業ディレクトリ」として、その中の
- 候補となる業務ファイル(md/テキスト、PDF、Excelなど)については:
- 必要なディレクトリ階層の探索が完了したら、これらのファイルを最終的な検索対象リストとして収集する。
- 優先順位付けを行う際は:
- 用途の説明が問題のテーマと高度に一致する領域ディレクトリおよびファイルを優先的に選択する
- 次に、時間やバージョンなどの制約(インデックスに反映されている場合)を考慮する
- 一般的な説明文書(README.md、全体設計文書など)は、優先順位を比較的低く設定する
- 「現在の作業ディレクトリ」という概念を使用する:
ファイル処理方法を習得する(PDFやExcelに遭遇した場合は強制的に実行する)
- PDFファイルを処理する前に:
- 必ず先に references/pdf_reading.md を読むこと(このディレクトリは Knowledge ディレクトリではなく、Skills ディレクトリ下にあることに注意)抽出方法を習得する
- 重点的に理解すべき点:pdftotext コマンド、pdfplumber の使い方、表の抽出方法
- Excelファイルを処理する前に:
- まず references/excel_reading.md を読み、読み取り方法を学ぶ必要があります
- まず references/excel_analysis.md を読み、分析方法を学ぶ必要があります
- 重点的に理解すべき点:pandas による読み込み、列の絞り込み、データのフィルタリング
- 目的:適切なツールと方法を使用し、無計画な検索を避ける
- PDFファイルを処理する前に:
ファイルの種類に応じて処理と検索を実行する
- 学んだばかりの方法(抽出、変換、構造化)を用いてファイルを処理する
- 各種類の候補ファイルについて、以下の「Markdown/テキスト」「PDF」「Excel」の戦略に従って実行する
- 基本原則:
- 最も関連性が高く、正確なファイルから優先的に処理する
- 各ファイル内では、コンテンツ全体を一括で読み込むことを避け、段階的に部分的な検索を行う
- 現在のファイルから満足のいく情報が得られない場合は、次の候補ファイルに切り替える
反復検索
- すべてのファイルタイプにおいて、統一された「多段階反復検索メカニズム」を採用する(上記の共通検索原則を参照)
回答の構成と出典の特定
- 複数回の検索で得られた文脈をまとめ、ユーザーの質問に総合的に回答する。
- 可能な限り:
- 明確かつ直接的な回答を提供する
- 使用したファイル名を明記する(必要に応じて、章やおおよその行数・ページ数などの大まかな位置を含む)
- 回答が推論に基づいている場合や情報が不完全な場合は:
- 仮定や不確実性を明確に明記する
- ユーザーがより具体的なファイルの範囲やキーワードを追加できることを示す
公開検索の原則
キーワード選定戦略
- ユーザーの質問から3~8個のキーワードを抽出する(英語の略語、同義語、上位語/下位語を含む)
- 組み合わせ可能な語句(例:「売上 レポート」、「API インターフェース タイムアウト」)
- 必要に応じて、業務用語、技術用語、一般的な略語(例:「uv」、「pv」、「GMV」)を含める
grep検索の基本原則
- 常に可能な限り正確な include および path を指定し、ディレクトリ全体の検索は避ける
- pattern では、まず問題文中の核心となる名詞や用語を試み、次に同義語を試す
- 各ヒットについては、一致した箇所周辺の局所的な領域(上下数行)のみを読み取る
- 「ファイル名 + 位置情報 + テキスト断片」を保存する
複数回の反復検索メカニズム(最大5回)
すべてのファイルタイプに対して統一された反復戦略を採用する:
- 反復制御
- 「検索試行回数」をカウントし、最大5回までとする
- 検索のたびにカウントを累積
- 各反復のプロセス
- 問題に基づいて検索キーワードを生成/更新する(同義語や拡張語を含む場合あり)
- まだ十分に検索されていないファイルまたはファイルの一部を選択する
- 検索を実行(grep/部分読み取り/専用Skillの呼び出し)
- 取得した文脈の断片を分析
- 質問への回答として十分かどうかを判断する
- 終了条件
- 回答を裏付けるのに十分なコンテキストが見つかった場合、または
- 5回の試行を経ても適切な情報が見つからない
- 情報が不足している場合の処理
- ユーザーに対し、情報が不足していること、または現在のナレッジベースには存在しない可能性があることを明確に伝える
- 見つかった中で最も近い情報を提供し、不確実性について説明する
- ユーザーが検索範囲を絞り込む方法(より具体的なファイル名、キーワード、期間など)を提示する
注意事項
- 初回から直接以下の呼び出しを行うことは禁止する:
Glob "knowledge" in .またはGlobを使用してディレクトリの存在を確認しようとする呼び出しは一切禁止する。ディレクトリの存在確認は、シェルコマンド(例:test -d)を介して確認してください。 - 本Skillを使用してナレッジベースを検索する際、ウェブ検索などの他のツールを使用して情報を取得することは禁止されています
ファイルタイプごとの具体的な方針
1. Markdown / テキストファイル(.md、.txt、.log など)
候補ファイルの選択
- 以下の基準に基づき
data_structure.mdファイル名やパスに基づいて関連性を判断します - タイトルや目次類のファイル(要約文書、設計概要など)を優先的に検索
- 以下の基準に基づき
grepによる位置特定と部分読み取り
- Grep ツールを使用して指定された候補ファイルを検索し、include で具体的な拡張子(例:「*.md」)を指定する
- 一致するファイルについては、Read を使用して一致箇所周辺の局所的な領域のみを読み込む:
- 行番号のオフセットと `limit` オプションで読み取り範囲を制御する(例:一致した行の前後それぞれ数十行を読み取る)
- ファイル全体の読み込みを回避する
特別な処理
- 内容が単に目次や見出しのみの場合は、リンクや小見出し名に基づいて、より詳細な内容へと遷移する
- 「多段階反復検索メカニズム」(前述の共通検索原則参照)を適用する
2. PDFファイルの検索戦略
ワークフロー:
まず:処理方法ガイドを読む
- いかなるPDFを処理する前にも、必ず references/pdf_reading.md を読むこと(このディレクトリは Knowledge ディレクトリではなく、Skills ディレクトリ内にあることに注意)
- 重点的に理解すべき点:pdftotext コマンド、pdfplumber の使い方、表の抽出方法、迅速な意思決定表
候補となる PDF の選択
- 上記の
data_structure.mdの説明に基づき、最も関連性の高い1~3つのファイルを選択してください - ユーザーが特定の PDF ファイルを指定した場合は、そのファイルを優先して使用します
- 上記の
学習した手法を適用してテキストを抽出する
- pdf_reading.md で推奨されているツール(優先的に pdftotext または pdfplumber)を使用する
- 重要:
pdftotext input.pdf output.txtテキストをファイルに抽出してください。stdout への直接出力は避けてください(トークンの大量消費を防ぐため) - 表を抽出する必要がある場合は、pdfplumber の表抽出機能を使用する
抽出結果に対して検索を実行する
- grep を使用して、抽出されたテキストからキーワードを検索する
- 各ヒットについて、ヒット周辺のコンテキスト(上下数十行または隣接する数ページ)を抽出する
- 「ファイル名 + ページ番号/おおよその位置 + テキスト断片」を保存する
- 「多段階反復検索メカニズム」(上記の共通検索原則を参照)を適用する
3. Excel ファイルの検索戦略
ワークフロー:
まず:処理方法ガイドラインを読む
- Excel ファイルを処理する前に、必ず以下を読み込んでください:
- references/excel_reading.md - ワークシートの読み取り方法を学ぶ(このディレクトリは Knowledge ディレクトリではなく、Skills ディレクトリ内にあることに注意)
- references/excel_analysis.md - データの分析方法を学ぶ(このディレクトリは Knowledge ディレクトリではなく、Skills ディレクトリ内にあることに注意)
- 重点的に理解すべき点:pandas による読み込み方法、列の絞り込み、データのフィルタリング、集計操作
- Excel ファイルを処理する前に、必ず以下を読み込んでください:
対象となるExcelファイルの選択
- 以下の
data_structure.mdファイル名やワークシート名に基づき、最も関連性の高いシートを選択する - 「レポート」「統計」「ログ」「設定」「マッピング」などのキーワードを含むワークブック/ワークシートを優先的に選択する
- ユーザーが具体的なExcelファイルを指定した場合は、そのファイルを優先して使用する
- 以下の
学習した手法を適用して構造を探索する
- pandas を使用して最初の 10~50 行を読み込む(
nrowsパラメータで制限) - 重点的に把握すべき点:列名/フィールド名、データ型(数値、日付、テキスト)、重要なフィールド
- 列名をユーザーの質問と照合し、潜在的なキーフィールド(「収入」「売上高」「error_code」など)を特定する
- pandas を使用して最初の 10~50 行を読み込む(
データの抽出と分析を実行する
- 学んだ pandas メソッドを使用してフィルタリングと集計を行う(例:
df[df['column'] == value]) - 一度にテーブル全体を読み込むのではなく、一致する行の周辺のデータのみを読み取る
- 質問に期間が含まれている場合は、検索に日時フィルターを追加する
- 「多段階反復検索メカニズム」(上記の「一般的な検索原則」参照)を適用する
- 学んだ pandas メソッドを使用してフィルタリングと集計を行う(例:
他のツールとの連携
PDFの処理
- PDFを処理する前に、必ず references/pdf_reading.md を参照し、処理方法を学習すること
- pdfplumber/pypdf を使用して、テキスト抽出、表の抽出、メタデータの読み取りを行う
- 迅速なテキスト抽出には、優先的に pdftotext コマンドラインツールを使用する
Excelの処理
- Excel を処理する前に、必ず以下を読み込んでください:
- references/excel_reading.md - 読み取り方法を学ぶ
- references/excel_analysis.md - 分析方法を学ぶ
- pandas を使用してデータの探索、プレビュー、フィルタリング、分析を行う
ツールの使用原則
- Grep:指定したファイル内でキーワードに基づいて行番号と一致する部分を探すために使用します。常に、できるだけ正確な include と path を指定してください
- Read:ファイルの一部のみを読み込む場合にのみ使用し、常に適切な limit(例:200~500行)と適切なオフセットを設定すること
- ファイルサイズが膨大になる可能性がある場合は:
- 最初から最後まで直接読み込むことは禁止
- 常に、インデックス、ディレクトリ、キーワードなどを用いて範囲を絞り込んだ上で読み込むこと
回答のスタイルとエラー処理
- 回答のスタイル
- できるだけユーザーの質問と同じ言語(中国語/英語)で回答すること。
- まず結論を述べ、その後に簡潔な根拠を示してください。
- 必要に応じて、参照したファイルと大まかな位置を後に記載してもよい。例:
- 出典:design/api_gateway.md の 100 行付近
- 出典:reports/2023_Q1_sales.xlsx の「Summary」シート
- 情報が不足している、または不確かな場合
- 現在のナレッジベースに完全に一致する情報が見つからないこと、または部分的な回答しかできないことを明確に説明します。
- 事実をでっち上げないでください。
- ユーザーに、検索範囲を絞り込むためのヒントを提供する:
- より具体的なディレクトリやファイルを指定する
- より正確なキーワードやフィールド名を提供する
- 期間やバージョンの範囲を指定する
---
name: kb-retriever
description: Retrieves and answers questions from a local knowledge base directory by navigating hierarchical index files, then progressively searching Markdown, PDF, and Excel files using grep, Read, pdfplumber, and pandas.
---
# 本地知识库检索 Skill(kb-retriever)
## 知识库目录说明
- 知识库存放在一个根目录下,包含多种文件类型(如 `.md`/`.txt`、`.pdf`、`.xlsx` 等),通常按类型或业务用途拆分为多级子目录。
- 采用**分层目录索引文件**:
- 根目录有一个 `data_structure.md`,说明主要的「领域目录」及其用途。
- 每个领域目录下可以有自己的 `data_structure.md`,说明该目录下有哪些子目录/文件,以及各自用途。
- 更深一层的子目录也可以继续有 `data_structure.md`,形成多级索引树。
- 知识库根目录约定:
- 默认认为知识库位于当前项目根目录下的 `knowledge/` 目录。
- 如果用户在对话中明确指定了其他路径(例如“我的知识库在 /data/kb”或“用 ./docs 这个目录作为知识库”),则以用户指定的路径作为根目录。
- 当默认路径 `knowledge/` 不存在或访问失败时,应向用户确认实际的知识库根目录位置,而不是随意猜测。
- 单个业务文件可能很大:
- 不要直接用 Read 读取整文件
- 对 PDF、Excel 使用对应 Skill 进行结构化处理后,再结合 grep/局部读取做精细检索
### 定位 `knowledge` 根目录
- 根目录优先听用户:如果用户给了路径(如 `./docs`、`./knowledge-personal`),直接用用户提供的路径。
- 默认根目录:否则约定根目录为当前项目下的 `knowledge/`。
- 使用 shell 显式检查目录是否存在:优先使用 `test -d knowledge`,或退而求其次使用 `ls -d knowledge`。
- 注意:禁止使用 `Glob "knowledge" in .` 这类模式来判断目录是否存在,`Glob` 只返回文件路径,不返回目录本身,空结果并不能区分“目录不存在”和“目录存在但为空”。
- 只有在根目录已通过 `test -d` 等方式确认存在时,才使用 Glob 在该目录下检索内容,并把目录作为 `path`,例如:
- 索引文件:`pattern="**/data_structure.md"`, `path="knowledge"`
- 所有 Markdown:`pattern="**/*.md"`, `path="knowledge"`
- 如果默认 `knowledge/` 不存在(`test -d` 失败):不要猜测其他目录,明确告诉用户未找到默认根目录,并让用户指定实际知识库路径。
## 关键原则:先学习,再处理
**遇到 PDF 或 Excel 文件时的强制检查清单**:
- [ ] ✅ 已读取对应的 references 文档学习处理方法
- [ ] ✅ 已理解推荐的工具和命令
- [ ] ✅ 已将文件处理(提取/转换)完成
- [ ] ⏭️ 现在可以开始检索
**禁止行为**:
- ❌ 在未读取 pdf_reading.md 的情况下直接尝试处理 PDF
- ❌ 在未读取 excel_reading.md 的情况下直接尝试处理 Excel
- ❌ 跳过文件处理步骤,直接对原始 PDF/Excel 进行检索
## 总体流程
1. 理解用户需求
- 读用户问题,提取:
- 主题/领域关键词(如“销售报表”“系统架构”“接口文档”)
- 时间或范围限定(如“2023 年 Q1”“最近版本”)
- 需要的输出类型(解释、摘要、具体字段数值等)
- 确定知识库根目录:
- 优先检查用户是否在问题中指定了知识库路径。
- 否则使用默认根目录 `knowledge/`。
- 若默认根目录不存在或目录结构异常,应向用户询问确认,而不是自行假设。
2. 分层查看目录索引 `data_structure.md`
- 使用一个「当前工作目录」的概念:
- 默认从用户指定的知识库根目录开始;如果用户未指定,则使用当前目录。
- 在当前工作目录下,如果存在 `data_structure.md`:
- 使用 Read 读取该文件的前若干行(例如 limit=300),必要时分段继续读取。
- 目标:
- 了解当前目录下有哪些子目录和文件
- 理解每个子目录/文件的用途说明
- 基于用户问题,挑选**最相关的若干个子目录或文件**,构成候选集合。
- 对于候选子目录:
- 递归进入该子目录,将其作为新的「当前工作目录」,继续查找其中的 `data_structure.md` 并重复上述过程。
- 在递归过程中,避免一次性深入所有分支,优先沿着与问题最相关的路径向下钻取。
- 对于候选业务文件(md/文本、PDF、Excel 等):
- 在完成必要的目录层级探索后,收集这些文件为最终的**检索目标列表**。
- 在优先级排序时:
- 优先选择用途说明与问题主题高度匹配的领域目录和文件
- 其次考虑时间/版本等约束(如果索引中有体现)
- 通用说明类文档(如 README.md、总体设计类文档)放在较后优先级
3. 学习文件处理方法(遇到 PDF/Excel 时强制执行)
- **在处理 PDF 文件前**:
- **必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)学习提取方法
- 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法
- **在处理 Excel 文件前**:
- **必须先读取** [references/excel_reading.md](references/excel_reading.md)学习读取方法
- **必须先读取** [references/excel_analysis.md](references/excel_analysis.md)学习分析方法
- 重点了解:pandas 读取、列筛选、数据过滤
- **目的**:确保使用正确的工具和方法,避免盲目检索
4. 按文件类型执行处理和检索
- 使用刚学到的方法处理文件(提取、转换、结构化)
- 对每类候选文件,按照下面「Markdown/文本」「PDF」「Excel」策略执行
- 总原则:
- 优先从最相关、最精确的文件开始
- 每个文件内都渐进式地局部检索,避免一次性加载全内容
- 若当前文件得不到满意信息,切换到下一个候选文件
5. 迭代检索
- 所有文件类型都使用统一的「多轮迭代检索机制」(见上文公共检索原则)
6. 答案组织与溯源
- 汇总多轮检索得到的上下文,综合回答用户问题。
- 尽量:
- 给出清晰、直接的回答
- 指出使用过的文件名(必要时包含大致位置,如章节或大概行数/页数)
- 如果答案基于推断或信息不完全:
- 明确标注假设与不确定性
- 提示用户可以补充更具体的文件范围或关键词
## 公共检索原则
### 关键词选择策略
- 从用户问题提取 3-8 个关键词(含可能的英文缩写、同义词、上位/下位词)
- 可组合词组(如 "销售 报表"、"API 接口 超时")
- 必要时包含业务词、技术术语、常见缩写(如 "uv"、"pv"、"GMV")
### grep 检索基本原则
- 始终指定尽量精准的 include 和 path,避免搜索整个目录
- pattern 优先尝试问题中的核心名词、术语,再尝试同义词
- 对于每个命中,只读取匹配附近的局部区域(上下若干行)
- 保存「文件名 + 位置信息 + 文本片段」
### 多轮迭代检索机制(最多 5 次)
所有文件类型都采用统一的迭代策略:
1. **迭代控制**
- 维护「已尝试检索次数」计数,最多 5 次
- 每次检索后累加计数
2. **每轮迭代流程**
1. 基于问题生成/更新检索关键词(可包括同义词、扩展词)
2. 选择尚未充分检索的文件或文件部分
3. 执行检索(grep/局部读取/专用 Skill 调用)
4. 分析获取的上下文片段
5. 判断是否足够回答问题
3. **终止条件**
- 找到足够支撑回答的上下文;或
- 已达到 5 次尝试仍未找到合适信息
4. **信息不足时的处理**
- 明确告知用户信息缺失或可能不在当前知识库中
- 提供已找到的最接近信息,并说明不确定性
- 提示用户可以如何缩小范围(更具体的文件名、关键词、时间范围等)
### 注意事项
- 禁止第一次就直接调用:`Glob "knowledge" in .` 或任何试图用 Glob 判定目录存在性的调用,目录存在性应通过 shell 命令(如 `test -d`)检查。
- 使用本 Skill 查询知识库时,禁止使用网络搜索等其他工具获取知识
## 针对不同文件类型的具体策略
### 1. Markdown / 文本类文件(.md, .txt, .log 等)
1. **候选文件选择**
- 根据 `data_structure.md` 和文件名、路径判断相关度
- 优先检索标题和目录类文件(如汇总文档、设计总览)
2. **grep 定位与局部读取**
- 使用 Grep 工具对指定候选文件,include 限定具体后缀(如 "*.md")
- 对于有匹配的文件,使用 Read 仅读取匹配附近的局部区域:
- 通过行号偏移和 limit 控制读取(例如从匹配行附近往前后各读取几十行)
- 避免整文件读取
3. **特殊处理**
- 如内容仅是目录/标题,根据链接或小节名继续定位深入内容
- 应用「多轮迭代检索机制」(见上文公共检索原则)
### 2. PDF 文件检索策略
**工作流**:
1. **首先:读取处理方法指南**
- 在处理任何 PDF 之前,**必须先读取** [references/pdf_reading.md](references/pdf_reading.md)(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
- 重点了解:pdftotext 命令、pdfplumber 用法、表格提取方法、快速决策表
2. **选择候选 PDF**
- 根据 `data_structure.md` 中的描述,选择最相关的 1-3 个文件
- 如果用户指明具体 PDF 文件,则优先使用该文件
3. **应用学到的方法提取文本**
- 使用 pdf_reading.md 中推荐的工具(优先 pdftotext 或 pdfplumber)
- **重要**:使用 `pdftotext input.pdf output.txt` 将文本提取到文件,不要直接输出到 stdout(避免占用大量 token)
- 如需提取表格,使用 pdfplumber 的表格提取功能
4. **对提取结果执行检索**
- 使用 grep 对提取的文本进行关键词搜索
- 对于每个命中,提取命中附近范围的上下文(上下数十行或相邻几页)
- 保存「文件名 + 页码/大致位置 + 文本片段」
- 应用「多轮迭代检索机制」(见上文公共检索原则)
### 3. Excel 文件检索策略
**工作流**:
1. **首先:读取处理方法指南**
- 在处理任何 Excel 之前,**必须先读取**:
- [references/excel_reading.md](references/excel_reading.md) - 学习如何读取工作表(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
- [references/excel_analysis.md](references/excel_analysis.md) - 学习如何分析数据(注意这个目录位于 Skills 目录下,而不是 Knowledge 目录下)
- 重点了解:pandas 读取方法、列筛选、数据过滤、聚合操作
2. **选择候选 Excel**
- 根据 `data_structure.md` 和文件/工作表命名,选择最相关的表
- 优先选择包含「报表」「统计」「日志」「配置」「映射」等关键词的工作簿/工作表
- 若用户指明具体 Excel 文件,优先使用该文件
3. **应用学到的方法探索结构**
- 使用 pandas 读取前 10-50 行(使用 `nrows` 参数限制)
- 重点掌握:列名/字段名、数据类型(数值、日期、文本)、关键字段
- 将列名与用户问题比对,识别潜在关键字段(如「收入」「销售额」「error_code」等)
4. **执行数据检索和分析**
- 使用学到的 pandas 方法进行过滤和聚合(如 `df[df['column'] == value]`)
- 每次只读取匹配行附近的数据,避免一次性读取整表
- 如问题包含时间范围,在检索中加入时间过滤
- 应用「多轮迭代检索机制」(见上文公共检索原则)
## 与其他工具的协同
### PDF 处理
- **在处理 PDF 前必须先读取** [references/pdf_reading.md](references/pdf_reading.md) 学习处理方法
- 使用 pdfplumber/pypdf 进行文本提取、表格提取、元数据读取
- 优先使用 pdftotext 命令行工具进行快速文本提取
### Excel 处理
- **在处理 Excel 前必须先读取**:
- [references/excel_reading.md](references/excel_reading.md) - 学习读取方法
- [references/excel_analysis.md](references/excel_analysis.md) - 学习分析方法
- 使用 pandas 进行数据探索、预览、过滤和分析
### 工具使用原则
- **Grep**:用于按关键词在指定文件中查找行号与匹配片段,始终指定尽量精准的 include 和 path
- **Read**:只用于局部读取文件,始终设置合理的 limit(如 200-500 行)和合适的偏移
- **对于任何可能很大的文件**:
- 禁止直接从头读到尾
- 始终先通过索引、目录、关键词等方式缩小范围后再读
## 回答风格与错误处理
- 回答风格
- 尽量用用户提问的语言(中文/英文)作答。
- 先给出结论,再给出简要依据。
- 如需要,可在后面列出引用的文件和大致位置,例如:
- 来源:design/api_gateway.md 第 100 行附近
- 来源:reports/2023_Q1_sales.xlsx Summary 工作表
- 信息缺失或不确定时
- 明确说明在当前知识库中没有找到完全匹配的信息或只能部分回答。
- 不臆造事实。
- 提示用户可以如何帮助缩小范围:
- 指定更具体的目录/文件
- 提供更精确的关键词或字段名
- 指定时间/版本范围
kb-retrieverをインストール
スキルファイルをダウンロードし、.claude/skills/ ディレクトリに解凍してください。
ZIPをダウンロードリポジトリをクローンし、スキルファイルをプロジェクトにコピーしてください。
git clone https://github.com/ConardLi/garden-skills/tree/main/skills/kb-retriever # Copy SKILL.md to your .claude/skills/ directory
コピー





家
