エージェントのウェブリサーチと抽出のためのセルフホステッドMCPフェッチャー
master-fetch、Dondai1234によって、AIエージェントがモデルコンテキストと研究のためにライブウェブコンテンツにローカルアクセスを提供するモデルコンテキストプロトコルサーバーです。ページを取得し、クリーンなテキストと検索結果を返し、JavaScriptが多いサイトやボット対策の壁を処理します。このアプリは、ゼロ構成、キーなしの操作、デバイス上での文書処理を強調しています。開発者やAIパワーユーザーは、ローカリゼーション、文書取り込み、エージェント駆動の研究ワークフローのためのプライベートで自己ホストされた取得パイプラインを得ることができます。
実際にどのようなタスクに使用できますか?
master-fetchは、ai-text-localizationや研究タスクに焦点を当てた、下流モデルに読みやすいソース資料を提供するリトリーバルエンジンとして機能します。典型的な成果には、翻訳のための文書の抽出、ローカライズされた文字列のためのウェブページのスクレイピング、モデルプロンプトのためのサイトコンテンツのマッピングが含まれます。実用的なタスクタイプ:
- モデル入力のためのHTMLの取得とクリーンアップ
- サイトマップを介したサイト全体のクロール
- PDFや画像をテキストに変換して取り込む
取得した出力はどれほど信頼性が高く、クリーンですか?
このツールは、Trafilaturaとlxmlを使用して広告やボイラープレートを削除し、モデル準備が整ったテキストを生成し、プロンプトコンテキストに適したMarkdownまたはプレーンテキストを出力できます。画像が多い文書には、ローカルのONNXベースのOCRパイプラインを適用して文字を抽出します。このプロジェクトには、検索結果を再順位付けするローカルのニューラルリランキングステップも含まれており、エージェントの消費のために最も関連性の高い取得ページを優先するのに役立ちます。
どのような入力と運用制限が予想されますか?
受け入れられる入力には、URL、深いクロールのためのサイトマップ、OCR用のアップロードされたPDFや画像が含まれます。インストールにはPython 3.10+環境とパッケージ(pip install hound-mcp)が必要で、ステルス取得はオプションでローカルのChromeまたはChromiumバイナリを使用できます。サーバーはClaude Desktop、Cursor、OpenCodeなどのMCPホストと統合されており、その検索はローカルのスクレイピングとルーティングロジックに依存して外部APIキーなしで動作します。
重いオーバーヘッドなしに開発者のワークフローに適合しますか?
この設計は、自己ホストし、エージェントスタックにMCPエンドポイントを統合できる開発者やAIパワーユーザーを対象としています。開発者は、HTTP、ブラウザレンダリング、ステルスモード間の自動エスカレーションを実装し、保護されたサイトからの成功した取得を増やすことができ、コミュニティはその自動エスカレーションの強みを指摘しています。このサービスは完全にローカルで実行されるため、データの管理を優先するチームは、モデルコンテキスト生成のために既存の社内パイプラインに組み込むことができます。
誰がそれを採用すべきか、誰が他を探すべきか
master-fetchは、エージェント駆動の研究やローカリゼーションパイプラインを構築するチーム向けの開発者志向の選択肢であり、自己ホスト型サーバーを運営できるチームに適しています。取得した資料の管理を重視し、Pythonベースのサービスを維持できるグループに適しています。社内にエンジニアリング能力がない組織や、ホスティングの責任を取り除く管理されたターンキーのスクレイピングサービスを好む組織は、代替案を検討すべきです。





