ISHII DESIGN INSTITUTE シンボルマーク

展示会運営支援の

石井デザイン研究所

ISHII DESIGN INSTITUTE

JAEN

TECH NOTES / 01

見た目は正常なのに、文字が読めないPDF

2026年10月 石井 洋平(合同会社石井デザイン研究所 代表)

刷れば何の問題もない。画面で見ても崩れていない。エラーも警告も出ない。それなのに、PDF の中の文字が「文字として」読めなくなっていることがあります。

検索しても見つからない。コピーして貼り付けると記号の羅列になる。スクリーンリーダーは読み上げられない。そして、AI も読めません。

この記事は、2026年8月に自社の校正作業の途中で見つけた現象を、手元にある PDF を全数調べて確かめた記録です。

何が起きるか

Illustrator でバリアブルフォント(太さや幅を連続的に変えられるフォント)を使って PDF を書き出すと、そのテキストを機械的に取り出せなくなることがあります。取り出すと、\x8b\x1f\x18\x06… のような制御文字の列になります。

原因は、PDF に埋め込まれたフォントに ToUnicode が出力されないことです。ToUnicode は、PDF の中の字形(グリフ)を、もとの文字(Unicode)に戻すための対応表です。これが無いと、見た目の形は出せても、それが何という文字なのかが分からなくなります。

見た目には一切影響しないので、印刷の現場では気づきようがありません。壊れるのは次の用途です。

  • PDF 内の検索、コピー&ペースト
  • スクリーンリーダーによる読み上げ(アクセシビリティ)
  • 検索エンジンや AI による内容の読み取り
  • 校正の自動化など、テキストを機械で扱う作業

どのくらい起きているか

自社に残っている PDF と Illustrator ファイルを全部開き、フォントごとに「取り出したテキストのうち、読めない文字が何割か」を測りました。

調べた件数10,452 ファイル
文字数約 2,749 万字
フォントの種類1,150 種
読めない文字約 55 万字(2.0%)
読めない文字を含むファイル(バリアブルフォント由来)292 ファイル(約35件に1件)

読めない文字のほとんどは、Illustrator に付属するバリアブルフォント「Acumin Variable Concept」によるものでした。同じ系列の Minion・Myriad の Variable Concept でも、例外なく読めなくなっていました。

フォント読めない割合ファイル数
AcuminVariableConcept98%288
MinionVariableConcept100%3
MyriadVariableConcept100%4

該当するファイルは、2023年に24件、2024年に42件、2025年に202件ありました。2025年に急に増えたのは、自社でこのフォントを使う機会が増えた年だからです。フォントの選び方ひとつで、気づかないうちに何百件も積み上がります。

原因の切り分け

「バリアブルフォントだから壊れる」と言い切る前に、2つのことを確かめました。

1. ToUnicode が無いフォントが、全部読めなくなるわけではない。
たとえば HelveticaNeueLTStd-Cn は、Acumin と同じ形式(Type1 のサブセット)で埋め込まれ、同じく ToUnicode を持っていません。それでも 61 万字すべてが読めました。ArialMT や MS-PGothic も、ToUnicode なしで読めています。「形式のせい」でも「ToUnicode が無いせい」でもなく、バリアブルフォントであることだけが違いでした。

2. バリアブルフォントでも、書き出す側によっては壊れない。
同じ書体から、バリアブル版と、形がまったく同じ固定版(静的インスタンス)を作り、Chrome で PDF にして比べました。どちらも ToUnicode が出力され、テキストは正常に取り出せました。Chrome は、バリアブルフォントでも壊しません。

つまり、原因はバリアブルフォントそのものではなく、Illustrator が PDF を書き出すときの埋め込みの処理にあります。実際、該当ファイルの書き出し元は Adobe PDF Library でした。

同じ構造の事故がほかにもある

調べていくと、バリアブルフォント以外にも、同じ形の事故が見つかりました。

  • NotoSansJP の数字:Illustrator から書き出した PDF で、数字だけが外字領域(U+F6B1〜F6BA)に落ちていた。金額・年号・電話番号・郵便番号が、検索もコピーもできない。原因は、文字の言語の設定が日本語になっていないときに、フォントの機能(locl)が数字を別の字形に差し替えること。
  • Adobe Garamond Expert:専門的な字形を集めたフォント。99% が読めなかった。

どれも共通しているのは、字形を差し替えた先が、もとの文字に戻れないことです。見た目を良くするための機能ほど、機械で読めることを壊しやすい、と言えます。

なぜ誰も気づかないのか

この現象に気づける人と、気づく機会がある人が、別々だからだと思います。

PDF を作る側の制作者は、作った PDF から文字を機械で取り出すことがありません。刷れば正しいからです。一方、PDF から文字を取り出す側の人は、PDF を作りません。そのうえ、エラーが一度も出ない。

「自分で作った PDF を、自分で機械的に読む道具を持っている」組み合わせが無いと、表に出てきません。自社が気づいたのは、校正を自動化する道具を自分で作っていたからです。

Web 上にも、バリアブルフォントと PDF の相性の悪さについての報告はあります。ただ、それらは「印刷されない」「太さが反映されない」といった、目で見て分かる不具合でした。見た目は正常なまま、機械で読めることだけが失われる、という整理は見当たりませんでした。

確かめ方

  1. PDF を開き、本文を数行選んでコピーし、テキストエディタに貼り付ける。記号の羅列になったり、数字だけが抜けたりすれば該当します。
  2. Acrobat の「文書のプロパティ」→「フォント」で、フォント名に VariableConcept を含むものが無いかを見る。
  3. 数字を含む語(電話番号や年号)で PDF 内を検索し、見つかるかを確かめる。

フォント一覧に ToUnicode の有無が出るツールもありますが、上のとおり「ToUnicode が無い=読めない」ではありません。実際に取り出して確かめるのが確実です。

防ぎ方

  • 欧文には固定版(静的)のフォントを使う。Acumin なら、Adobe Fonts の「Acumin Pro」が使えます(Creative Cloud に含まれ、追加料金はありません)。Illustrator 付属の Acumin Variable Concept は別物です。差し替えると字幅が少し変わるので、行の折り返しを確かめてください。
  • NotoSansJP の数字は、段落スタイルか文字スタイルの「詳細文字形式」→「言語」を日本語にする。文字パネルの「言語」には日本語が出てきません。こちらは欧文のスペルチェックやハイフネーション用の別の設定です。
  • 書き出したら、一度テキストを取り出して確かめる。見た目では絶対に分からないからです。

すでに公開してしまった PDF は、元データがあれば、フォントを差し替えて書き出し直すことで直せます。元データが残っていない場合は、組み直しが必要になります。

調査は 2026年8月時点の Illustrator(Adobe PDF Library 15〜18)で行いました。調べた PDF の中身や案件名は公開していません。

技術コラムの一覧へ

元データの無い PDF からの組み直し(アウトライン復元)

TECH NOTES の記事は、筆者の実務と検証にもとづく記録です。お使いの環境やアプリケーションのバージョンによって結果が異なるため、記載内容について当社は責任を負いかねます。スクリプトを試すときは、必ず複製したデータで行ってください。

CONTACT アウトライン復元 急ぎ案件 進路レビュー
→ CONTACT