なぜこう書くのか
AIナレーション原稿を作る際によくある失敗は、既存のテキストをそのまま音声合成ツールに入力してしまうことです。しかし、目で読む文章と耳で聞く文章はまったく異なります。括弧書きが含まれた長文はツールが適切な間を取れず一気に読み上げてしまい、「3/1〜3/14」のような表記は不自然な発音で読み上げられてしまいます。
課題の指示はすべて「耳で聞くこと」を基準にしています。1文40文字、1文1メッセージ、括弧の展開、数字の読み仮名化などです。特に数字や略語をあらかじめ発音通りのテキストにしておけば、ツールがどう読むかを心配する必要がなくなります。原稿を整えるほうが、音声ツールの設定を細かく調整するよりもはるかに確実です。
形式で段落ごとの予想読み上げ時間を指定しているのは、動画全体の長さに合わせるためです。完成後に再生してみて10秒オーバーしていた場合、映像側の再編集が必要になってしまいます。変更箇所のリストを同時に出力させることで、リライトによって意図が変わってしまった部分がないかを素早く確認できます。
制約は、AIが原稿を整える過程で勝手な宣伝文句を追加したり、原稿にない数値を補完したりするのを防ぎます。最後のセルフチェックは、声に出して読むシチュエーションをAIにシミュレーションさせ、目で見る分には問題なくても耳で聞くと引っかかる表現を排除させるための工夫です。
用語が分からなければAha AIで: output-format, self-consistency
悪い例との比較
この原稿を音声読み上げさせたいので自然に整えて (原稿を貼り付け)
「自然に」とだけ指示すると、大抵は文章を少し短くするだけで終わってしまいます。数字や日付の表記、括弧、アルファベットの略語がそのまま残り、機械音声が読み上げた際に不自然になります。また長さを測っていないため、動画に音声を乗せた段階で尺が合わないことに気づき、映像を作り直す手間が発生します。
バリエーション
2人の掛け合い形式にしたいとき
{{動画の長さ}}の動画に2人の声を交互に乗せたいと考えています。以下の原稿を、進行役と解説役の2人が掛け合う対話形式のスクリプトに変換してください。話者が変わるたびに改行し、先頭に名前を記載してください。1人が3文以上続けて話さないようにし、段落ごとに予想読み上げ時間を記載してください。
原稿: """ {{原稿}} """
1人の声だけだと長い説明は単調になりがちです。対話形式にすることで、視聴者が最後まで集中して聞きやすくなります。
動画の長さに合わせて要約・短縮したいとき
以下の原稿を、{{動画の長さ}}以内で読み切れる分量に要約してください。1秒あたり日本語4〜5文字で計算した目標文字数を最初に提示し、その文字数に収まるよう推敲してください。文章を過度に圧縮するのではなく、重要度の低い文をまるごと削る形で短縮し、削った内容を箇条書きで教えてください。
原稿: """ {{原稿}} """
読み上げ原稿は、無理に文章を圧縮すると情報が詰まりすぎて耳で理解しにくくなります。文の数を減らすことで、残った文をゆったりと自然に読めるようにしています。
モデル別の注意
音声合成ツールによって句読点で入る間の長さが異なり、同じ原稿でも選ぶ声の種類によって読み上げスピードが変わります。「1秒あたり4〜5文字」は計算上の目安ですので、最初の1段落を実際に生成して時間を計測し、目標文字数を微調整してください。速度や抑揚をタグで指定できるツールもありますが、記法がツールごとに異なるため、原稿内には含めずツールの管理画面側で調整するのが無難です。
関連プロンプト
最終更新 2026-09-02 · 誤りがありますか? 知らせる