メインコンテンツへスキップ
見出し画像

ObsidianでPDFを含めた全文検索する方法

    前回の記事で、Zoteroで管理している論文をObsidianに統合する方法を紹介した。しかし、Obsidian本体の検索機能では 添付ファイル(PDF・画像・Office文書)の中身はインデックス対象外。

    Obsidian でZoteroにぶっ込んだ全文献を全文検索。写真はOCRされてる。。。エグすぎる。。。 pic.twitter.com/rqZHT7REWm

    — Gyroid (@shutoito) May 17, 2025

    これを解決する方法を紹介する。コミュニティプラグインの併用により、Vault 全体を対象とした PDF の全文検索が可能となる。現時点で最も安定かつ容易な方法は、Text Extractor と Omnisearch の併用。以下に導入手順、代替案、注意点を記す。
    (参考:Obsidian Forum 1、Obsidian Forum 2)


    1. Obsidian 標準機能の限界

    • Obsidian のグローバル検索は `.md` ファイルおよびそのメタデータに限定され、添付された PDF のテキスト層や OCR 結果はインデックスされない。そのため、PDF 全文の検索は標準機能では不可能。
      (参考:Obsidian Forum)

    • PDF ビューア上で `⌘/Ctrl + F` を使用すれば 個別 PDF 内の検索は可能 だが、Vault 全体を対象とした検索には対応していない。
      (参考:Reddit)


    2. プラグインによる全文検索の実現

    2-A. Text Extractor(OCR・テキスト抽出)


    画像
    画像
    OCR Languagesでjpnを追加すると日本語も検索できるようになる。


    参考:GitHub Plugin, GitHub Discussion


    2-B. Omnisearch(全文インデックス・高速検索)


    画像

    参考:GitHub Plugin


    補足事項
    ① Text Extractor 単体では検索不可(抽出のみ)。② Omnisearch 単体でも添付ファイルは対象外。両者の併用が必須。
    (参考:Text Extractor GitHub、Omnisearch GitHub)


    3. インストール後の手順

    1. 全文キャッシュの生成
       自動でcashを生成するが、PDF が多数ある場合は完了まで待機が必要。(夜に起動しておくと10G程度pdfならの一晩で完了していた。)
      (参考:GitHub)

    2. 検索の実行
       Omnisearch パレットを開く(Quick-Switcher のキー割り当て変更も可能)。キーワードを入力すると、PDF 内の一致ページ単位で候補が表示される。Enter キーで該当 PDF を開くか、`Tab` で該当位置へジャンプ可能。
      (参考:GitHub, YouTube)


     
     
     

    Gyroid

     
     
    生物学の博士号を持った材料研究者です。生物の形と機能を材料実装するための活動をしています。仲間と一緒に生物の機能形態の研究会であるBiomatter Labを立ち上げて毎週活動中です。

    あなたへのおすすめ