MCPサーバーと双方向エクスポートを備えたドキュメントからMarkdownへの変換ツール
all2mdは、トーマス・ヴィラーニによって開発され、複雑な文書形式を構造化されたMarkdownに変換し、LLMの取り込みと自動文書ワークフローを実現します。このツールは40以上の形式間で双方向変換を行い、内蔵のモデルコンテキストプロトコルサーバーを実行し、高忠実度のパースのためにRAGネイティブのチャンク化とASTベースの変換を提供します。高度なPDFテーブル回復、オプションのOCRサポート、CLIバッチユーティリティが含まれています。ターゲットユーザーは、LLMおよびRAGビルダー、Python開発者、プログラムによる文書準備を扱うパワーユーザーです。
複雑なファイルをLLM対応のMarkdownに変換してRAG取り込みを行います
このツールは、PDF、DOCX、PPTX、HTML、メール、スプレッドシートなど、40種類以上のファイルタイプを、モデルコンテキスト取り込み用に設計されたクリーンなGitHub Flavored Markdownに変換します。パイプラインは抽象構文木を使用して文書構造を保持し、プログラムによる変換を可能にし、MarkdownをDOCXやPDFなどのリッチフォーマットに書き戻すことができ、モデル生成コンテンツのラウンドトリップ編集を可能にします。
複雑なレイアウトに対して測定可能な忠実度で構造化された出力を生成します
PDF処理は、テーブル回復、マルチカラムレイアウト分析、ヘッダー/フッターの削除に焦点を当てており、より単純なパーサーと比較して、虚偽または「発明された」テキストの量を減少させます。このプロジェクトは、Doclingおよびpymupdf4llmに対するベンチマーキングを報告し、低い発明テキスト率を強調しています。RAGネイティブのチャンク化は、セマンティック、見出し、トークンスプリットを含む11の戦略を提供し、検索ワークフローのためにセクションとページの出所を保持します。
開発者の慣れが必要ですが、拡張可能でフォーマット特有のインストールを提供します
このツールは、PythonライブラリおよびPC、macOS、Linux用のCLIとして利用可能で、Python 3.x環境を対象としています。インストーラーはモジュラー依存関係システムを使用しているため、特定のフォーマットに必要なコーデックのみがインストールされ、スキャンされたPDF用のTesseractやEasyOCRなどのOCRオプションはオプションです。プラグインAPIとAST変換により、開発者はカスタムフォーマットを追加したり、プログラム的にパース動作を調整したりできます。
MCPおよびバッチツールを介してAIアシスタントパイプラインに適合します
組み込みのモデルコンテキストプロトコルサーバーは、変換パイプラインをAIアシスタントに直接接続し、このプロジェクトはClaude Desktopなどのクライアント用にワンクリックMCPBバンドルを提供します。コマンドラインユーティリティは、ディレクトリ監視、バッチ変換、セマンティック検索、文書の差分をサポートして取り込みを自動化します。これらの統合は、構造化されたMarkdownを検索システムに供給し、開発者が変換されたコンテンツを下流のモデルプロンプトやRAGストアに組み込むことを可能にします。
モデル取り込みパイプラインを構築する開発者のための実用的な選択肢
取得およびコンテキストレイヤーを構築するチームにとって、このツールはソースの忠実度と出所に対する測定可能な制御を提供します。モジュラーでコードファーストのデザインは、スクリプト化されたパイプラインやバッチ操作に適しています。非技術的なユーザーは、急なセットアップ曲線に直面する可能性があります。実用的なアドバイス:GitHub Flavored Markdownを出力し、文書をモデルコンテキストストアにインポートする際に出所を保持するために、セマンティックまたは見出しベースのチャンクを好んで使用してください。バッチ実行の前に、画像ベースのPDF用のOCRエクストラを有効にしてください。





