声の高さをそろえようとしたら、ロボットの声になった ― AI音声のリール動画で「補正しない」を選ぶまで
J-WORKSでは、2人のキャラクターが掛け合うInstagramリール動画を、AIの読み上げ音声で自動作成している。キャラクターらしく聞こえるように声の高さを機械的に補正していたところ、補正を大きくかけた回で「別人の声に聞こえる」「一言目がロボットのよう」という指摘を受けた。補正の上限を設け、最終的に会話の声の高さ補正そのものをやめ、台本を書くAIを変え、1行目に読み方の指示を付けた記録。
検証条件
J-WORKSのInstagramリールは、2人のキャラクター(低めの声のキャラクターと高めの声のキャラクター)が短く掛け合う動画である。セリフはAIが台本として書き、声はAIの音声合成(読み上げ)で作り、動画も自動で組み立てる。今回確認したのは、キャラクターごとの声の高さをそろえるために入れていた「声の高さの機械的な補正」が、聞いたときの自然さにどう影響していたか、という点である。
実行内容
2026-09-29、同じキャラクターでもセリフごとに声の高さがばらつく(一言目が低く二言目が高い)という指摘を受け、セリフごとの声の高さを測り、キャラクターごとの目標の高さへ機械的に合わせる補正を入れた。同じ日に、セリフごとに別々に声を作ると別人の声に聞こえるという指摘も受け、会話全体の声を1回でまとめて作ってから切り分ける方式に変えた。2026-10-01、このまま作られたリールがOWNERに却下され、「2人の声が違う」「一言目がロボットがしゃべっているよう」という指摘を受けた。記録を確認すると、この回は目標の高さに合わせるために約10%の補正をかけており、OWNERが承認した回の補正は約4%だった。
結果
最初の対応として、補正は5%までにとどめ、目標から5%より離れた回は無理に補正せず会話の音声を作り直して(最大3回)一番近いものを使うようにし、完成動画の自動検査でも補正が5%を超えていたら不合格にした。その後、OWNERが複数の作り方の音声を実際に聞き比べ、「台本を別の高性能なAIモデル(Claude Opus 5.5)で書き、声の高さは補正しない」組み合わせが一番良いが、一言目だけはまだ機械的に聞こえる、と判断した。これを受けて、会話の声の高さ補正をやめ(高さは測って記録するだけ)、台本を書くAIを切り替え、1行目だけ読み上げの際に演技の指示を付ける(字幕には出さない)よう変更した。各回の変更は自動テストで確認し、すべて合格している。
失敗原因
声の高さを後から機械的に大きく変えると、高さだけでなく声の質そのものまで変わってしまい、別人のように、また機械的に聞こえる。キャラクターらしさを数値(声の高さ)でそろえようとした補正が、聞いたときの自然さを損ねていた。自動の検査で測れるのは声の高さなどの数値であり、「自然に聞こえるか」はこの仕組みでは判定していなかった。
改善
声の自然さは数値では判定できないため、OWNERが実際に聞き比べて選んだ組み合わせを正式な作り方とし、その決定を文章のルール(リールのルール)にも書き残した。声の高さは補正せず測って記録するだけにし、作り直しは音声の切り分けや読み上げに失敗した時だけに限定した。1行目の機械的な読みについては、読み上げの指示を付けるという対応にとどめている。
現在の結論
2026-10-01時点で確認できているのは、声の高さ補正をやめ、台本を書くAIを切り替え、1行目に読み上げの指示を付ける変更を行い、関連する自動テストが合格していることである。声の良し悪しはOWNERが聞いて判断したものであり、数値で測った評価ではない。また、1行目に付けた読み上げの指示によって一言目の機械的な読みが解消したかどうかは、この記録の時点ではまだ確認していない。
根拠
2026-09-29〜2026-10-01に行ったリール動画作成の仕組みの修正記録(各回の変更内容と、それぞれの自動テスト全件合格の記録)、およびOWNERが実際の音声を聞き比べて判断した2026-10-01の決定記録によるJ-WORKS内部の実施記録。