採用動画のナレーションを、ナレーターに読んでもらわずに音声合成(TTS=文章を読み上げ音声に変換する技術)で作る会社が増えています。弊社も自社運用ぶんと制作物の両方で使っています。安く速いのは事実ですが、壊れ方が人間のナレーターとまったく違うため、人間相手の検収手順をそのまま当てると素通りします。
ここでは、弊社が実際に踏んだ壊れ方を、日付と件数つきでそのまま出します。企業名・番組名・出演者名は出しません。これから採用動画にAIナレーションを入れる担当者が、最初から同じ穴に落ちないための記録です。
1. 音だけが間違っていると、目で見ても尺を測っても見つからない
2026-08-30、弊社は自社運用のSNS向け短尺動画13本を「完成」と報告して入稿しました。実際には9本に誤読がありました(自社実測)。
問題は、その9本のスライドもキャプションも原稿も、すべて正しかったことです。間違っているのは音だけでした。つまり、ファイル一覧を眺めても、尺を測っても、テロップを読み合わせても、1件も見つかりません。動画制作の検収でふつうに行う確認作業が、この欠陥に対しては原理的に無力です。
指摘を受けて6本、そのあと音声を文字起こしし直して照合したところ、さらに3本出ました。具体的には「連休」が別の語に、「箱へ」が別の語に、「黄金色」が読み違いに、それぞれなっていました。どれも文脈を知っていれば人間なら間違えない語です。
ここから弊社が固定した工程は1行です。生成した音声は、音声認識(STT=音声を文字に戻す技術)で文字に戻し、原稿と突き合わせてから入稿する。「動画ができた」は「内容が正しい」の証明になりません。
2. 誤読は「もう一度生成し直す」では直らない
最初に試したのは再生成でした。効きません。
採用系のショート動画で「施工管理」が「走行管理」と読まれた件では、3回連続で同じ誤読が出ました(自社実測)。語順を入れ替えると、今度は別の誤りになりました。つまりこれは確率的なブレではなく、前後の文脈から読みが固定されている現象です。何度引き直しても同じ面が出ます。
対処は、読み方を辞書として外から与えることです。弊社では音声用のテキストだけをかなに置換し、テロップと概要欄は漢字のまま残す作りにしました。画面に出る文字まで平仮名にしてしまうと、今度は見た目が壊れます。音声用と表示用を分けるのが要点です。
切り分けの型も決めました。すでに配信済みの回で同じ語を照合にかける。そこで正しく読めていれば、今回のものは本物の誤読です。読めていなければ、その語はもともと読みが割れる語なので、辞書に載せます。
3. 固有名詞を読み辞書に入れると、社名が割れる
これは弊社が自分で作り込んでしまった欠陥です。
2026-09-08、社名とコンテンツ名が連続する箇所の読みを安定させようとして、その連結部分をまとめてかな置換しました。結果、読点の位置が社名の内側に寄り、社名が途中で割れて発音されました。それ以前の回には無かった欠陥を、こちらの修正が新たに作ったことになります。該当する5本を全数差し替えました。
教訓は明確です。読み辞書に入れてよいのは一般語の読み割れだけで、固有名詞には触らない。社名・ブランド名・番組名は、置換した瞬間に区切りの制御権をこちらが握ってしまい、元の自然な区切りに戻せなくなります。
しかもこの欠陥は、次の節で書くとおり機械の照合では検出できません。採用動画で社名が割れて読まれるのは、読み間違い一般よりはるかに重い事故です。ここだけは人が耳で確認する工程を外せません。
4. 機械で聞き直しても取れない誤読がある
音声を文字に戻して原稿と比べる方法にも、はっきりした穴が3つあります。いずれも自社の実測で確認したものです。
穴その1:文字起こし側が漢字に書き戻してしまう。 「黄金色」を別の読みで発音しても、文字起こしの結果は「黄金色」と出ます。原稿と完全一致するので、差分は消えます。読みが割れる語は、検出を待つのではなく最初から辞書にかなで登録するしかありません。
穴その2:区切りの崩れは正規化されて消える。 前節の社名が割れた件でも、文字起こしは単語をつなげて出力するため、原稿と一致してしまいます。機械側には「割れている」という情報が届きません。
穴その3:文字起こし自体が揺れる。 まったく同じ音声ファイルを2回かけて、判定が変わることがあります。弊社では合格は2回連続で取ることにしました。1回通っただけでは通ったことになりません。
比較の単位も重要です。字面ではなく読み(かな)で比べること。字面で比べると「ちがう/違う」のような表記ゆれが全部差分として出て、本物の誤読が埋もれます。
なお、句点で間を置いて読ませたい原稿は、1文ずつ別々に生成して無音でつなぐほうが安定します。長い原稿を一度に投げた場合、弊社の実測では4本中3本で、句をまたいだ繰り返しや語の挿入といった崩れが出ました。
5. テロップの全数照合は、方向を間違えると取りこぼしを見つけられない
ナレーションと並んで壊れるのが、焼き込みテロップと確定原稿のズレです。ここでも弊社は一度外しました。
ある採用動画で、画面から抽出した286件のテロップを原稿と全数照合し、「相違なし」として先方に送付しました。その後、先方が全編を視聴して相違を指摘されました。当たり直した結果、原稿側の被覆率は88.6%、36件のテロップが抽出から漏れていたことが分かりました(自社実測)。
原因は照合の方向です。「抽出したテロップが原稿に載っているか」という一方向しか見ていなかったため、そもそも抽出できていなかったテロップは、検査の視界に入りません。自分の取りこぼしを構造的に検知できない作りでした。
直したのは、逆向きの被覆率検査を足すことです。原稿の各行が動画のどこかで表示されたかを数え、被覆率がほぼ100%になるまで送付しない。漏れていた分は動画を1秒ごとに全フレーム切り出して読み直し、全数版322行で解消しました。
付随して分かった実務上の注意が3つあります。
- 一定秒数ごとの切り出しや、単純な画面変化の検出ではテロップを取りこぼす。 短時間だけ出て消えるテロップが落ちます。目視の穴埋めも当てになりませんでした
- 画像の切り出し位置は1秒ずれることがある。 時刻を指定して1枚ずつ取り出すのではなく、全フレームを吐き出してから該当フレームを選ぶほうが正確でした
- 自動文字起こしで後から補填された字幕行は信用しない。 画面に出ている表記と一致している保証がありません。画面準拠の行と、音声から起こした行は、分けて扱う必要があります
実際に回している順序
現在、弊社が固定している順序はこれだけです。
- 原稿を確定する(この時点で、読みが割れる一般語を辞書に入れる。固有名詞は入れない)
- 音声を生成する(長い原稿は1文ずつ生成して無音連結)
- 音声を文字に戻し、読み(かな)で原稿と照合する。合格は2回連続
- テロップは、抽出側と原稿側の双方向で照合し、原稿の被覆率を確認する
- 人が最後に通しで聞く。 固有名詞の区切りと、社名の発音だけは機械では取れない
この工程で、費用が大きく増えるのは4の画像読み取りだけです。切り出しや差分照合の処理そのものは、ほぼ費用がかかりません。読み取り費用は動画の尺に比例するので、検査の費用は尺で見積もれば読めます。
まとめ:人間のナレーターとは壊れ方が違う
人間のナレーターに頼んだとき、事故はたいてい「読み方が意図と違う」という形で出て、その場で直せます。音声合成の場合、壊れ方は次の3つに寄ります。
- 画面と原稿は正しく、音だけが間違っている(目視の検収では絶対に出てこない)
- 同じ誤読が何度でも再現する(引き直しでは解決しない)
- こちらの修正が新しい欠陥を作る(固有名詞の読み置換で社名が割れる)
どれも「良い音声合成サービスを選べば避けられる」種類のものではありません。避けられるのは工程のほうです。採用動画は、社名と職種名が正しく読まれることが最低条件の制作物です。そこだけは、機械の照合を全部通したうえで、人が一度耳で確かめる。弊社がここまでの失敗から残した結論はそれだけです。