TECH NOTES / 01
見た目は正常なのに、文字が読めないPDF
刷れば何の問題もない。画面で見ても崩れていない。エラーも警告も出ない。それなのに、PDF の中の文字が「文字として」読めなくなっていることがあります。
検索しても見つからない。コピーして貼り付けると記号の羅列になる。スクリーンリーダーは読み上げられない。そして、AI も読めません。
この記事は、2026年8月に自社の校正作業の途中で見つけた現象を、手元にある PDF を全数調べて確かめた記録です。
何が起きるか
Illustrator でバリアブルフォント(太さや幅を連続的に変えられるフォント)を使って PDF を書き出すと、そのテキストを機械的に取り出せなくなることがあります。取り出すと、\x8b\x1f\x18\x06… のような制御文字の列になります。
原因は、PDF に埋め込まれたフォントに ToUnicode が出力されないことです。ToUnicode は、PDF の中の字形(グリフ)を、もとの文字(Unicode)に戻すための対応表です。これが無いと、見た目の形は出せても、それが何という文字なのかが分からなくなります。
見た目には一切影響しないので、印刷の現場では気づきようがありません。壊れるのは次の用途です。
- PDF 内の検索、コピー&ペースト
- スクリーンリーダーによる読み上げ(アクセシビリティ)
- 検索エンジンや AI による内容の読み取り
- 校正の自動化など、テキストを機械で扱う作業
どのくらい起きているか
自社に残っている PDF と Illustrator ファイルを全部開き、フォントごとに「取り出したテキストのうち、読めない文字が何割か」を測りました。
| 調べた件数 | 10,452 ファイル |
|---|---|
| 文字数 | 約 2,749 万字 |
| フォントの種類 | 1,150 種 |
| 読めない文字 | 約 55 万字(2.0%) |
| 読めない文字を含むファイル(バリアブルフォント由来) | 292 ファイル(約35件に1件) |
読めない文字のほとんどは、Illustrator に付属するバリアブルフォント「Acumin Variable Concept」によるものでした。同じ系列の Minion・Myriad の Variable Concept でも、例外なく読めなくなっていました。
| フォント | 読めない割合 | ファイル数 |
|---|---|---|
| AcuminVariableConcept | 98% | 288 |
| MinionVariableConcept | 100% | 3 |
| MyriadVariableConcept | 100% | 4 |
該当するファイルは、2023年に24件、2024年に42件、2025年に202件ありました。2025年に急に増えたのは、自社でこのフォントを使う機会が増えた年だからです。フォントの選び方ひとつで、気づかないうちに何百件も積み上がります。
原因の切り分け
「バリアブルフォントだから壊れる」と言い切る前に、2つのことを確かめました。
1. ToUnicode が無いフォントが、全部読めなくなるわけではない。
たとえば HelveticaNeueLTStd-Cn は、Acumin と同じ形式(Type1 のサブセット)で埋め込まれ、同じく ToUnicode を持っていません。それでも 61 万字すべてが読めました。ArialMT や MS-PGothic も、ToUnicode なしで読めています。「形式のせい」でも「ToUnicode が無いせい」でもなく、バリアブルフォントであることだけが違いでした。
2. バリアブルフォントでも、書き出す側によっては壊れない。
同じ書体から、バリアブル版と、形がまったく同じ固定版(静的インスタンス)を作り、Chrome で PDF にして比べました。どちらも ToUnicode が出力され、テキストは正常に取り出せました。Chrome は、バリアブルフォントでも壊しません。
つまり、原因はバリアブルフォントそのものではなく、Illustrator が PDF を書き出すときの埋め込みの処理にあります。実際、該当ファイルの書き出し元は Adobe PDF Library でした。
同じ構造の事故がほかにもある
調べていくと、バリアブルフォント以外にも、同じ形の事故が見つかりました。
- NotoSansJP の数字:Illustrator から書き出した PDF で、数字だけが外字領域(U+F6B1〜F6BA)に落ちていた。金額・年号・電話番号・郵便番号が、検索もコピーもできない。原因は、文字の言語の設定が日本語になっていないときに、フォントの機能(
locl)が数字を別の字形に差し替えること。 - Adobe Garamond Expert:専門的な字形を集めたフォント。99% が読めなかった。
どれも共通しているのは、字形を差し替えた先が、もとの文字に戻れないことです。見た目を良くするための機能ほど、機械で読めることを壊しやすい、と言えます。
なぜ誰も気づかないのか
この現象に気づける人と、気づく機会がある人が、別々だからだと思います。
PDF を作る側の制作者は、作った PDF から文字を機械で取り出すことがありません。刷れば正しいからです。一方、PDF から文字を取り出す側の人は、PDF を作りません。そのうえ、エラーが一度も出ない。
「自分で作った PDF を、自分で機械的に読む道具を持っている」組み合わせが無いと、表に出てきません。自社が気づいたのは、校正を自動化する道具を自分で作っていたからです。
Web 上にも、バリアブルフォントと PDF の相性の悪さについての報告はあります。ただ、それらは「印刷されない」「太さが反映されない」といった、目で見て分かる不具合でした。見た目は正常なまま、機械で読めることだけが失われる、という整理は見当たりませんでした。
確かめ方
- PDF を開き、本文を数行選んでコピーし、テキストエディタに貼り付ける。記号の羅列になったり、数字だけが抜けたりすれば該当します。
- Acrobat の「文書のプロパティ」→「フォント」で、フォント名に
VariableConceptを含むものが無いかを見る。 - 数字を含む語(電話番号や年号)で PDF 内を検索し、見つかるかを確かめる。
フォント一覧に ToUnicode の有無が出るツールもありますが、上のとおり「ToUnicode が無い=読めない」ではありません。実際に取り出して確かめるのが確実です。
防ぎ方
- 欧文には固定版(静的)のフォントを使う。Acumin なら、Adobe Fonts の「Acumin Pro」が使えます(Creative Cloud に含まれ、追加料金はありません)。Illustrator 付属の Acumin Variable Concept は別物です。差し替えると字幅が少し変わるので、行の折り返しを確かめてください。
- NotoSansJP の数字は、段落スタイルか文字スタイルの「詳細文字形式」→「言語」を日本語にする。文字パネルの「言語」には日本語が出てきません。こちらは欧文のスペルチェックやハイフネーション用の別の設定です。
- 書き出したら、一度テキストを取り出して確かめる。見た目では絶対に分からないからです。
すでに公開してしまった PDF は、元データがあれば、フォントを差し替えて書き出し直すことで直せます。元データが残っていない場合は、組み直しが必要になります。
調査は 2026年8月時点の Illustrator(Adobe PDF Library 15〜18)で行いました。調べた PDF の中身や案件名は公開していません。
TECH NOTES の記事は、筆者の実務と検証にもとづく記録です。お使いの環境やアプリケーションのバージョンによって結果が異なるため、記載内容について当社は責任を負いかねます。スクリプトを試すときは、必ず複製したデータで行ってください。