僕は前に、音の錯覚の動画を聞いたことがある。
最初は、ただの雑音にしか聞こえなかった。
でもあるタイミングから、鼻歌のようにメロディが聞き取れるようになったんだ。
そして曲のどこなのかがわかると、裏で鳴っているオケもある程度聞き取れるようになった。
原曲の音源をMIDIに変換して再生し、ピアノの音だけで鳴らす「音の錯覚」という動画のシリーズがある。
MIDIというのは音そのものではなく、音の高さ・大きさ・長さなどを数値にした「演奏の情報」のことだ。
その中でも、歌の音声ファイルをMIDIに変換した動画が知られている。
ただのピアノの音なのに、歌詞が聞こえてくるというものだ。
でも実は、声はピアノの中にはないんだ。
そしてその聞こえ方には、聞く側が元の音を知っているかどうかも関わっている。
今回は、ピアノから声が聞こえる不思議を、音の仕組みから見てみようと思う。
それでは、僕と一緒に未来を覗き見てみよう。
ピアノだけなのに声が聞こえる動画は、音ではなく演奏の指示で鳴っていた

MIDIは、電子楽器やコンピューターのあいだで演奏情報を伝えるための統一規格なんだ。
楽器やコンピューターのあいだで受け渡す、共通の決まりだと考えるとわかりやすい。
その演奏情報の中身は、音の高さ・大きさ・長さと、音色や効果を数値にしたもの。
ちなみにMIDIは、1983年に提唱された規格だ。
動画の制作者は、MIDIを「機械にこう演奏しろ!と命令するデータ」と説明している。
僕なりに言い換えると、MIDIは音そのものではなく演奏の指示なんだ。
そして制作者によると、動画では原曲の音源から作ったMIDIを再生しているんだ。
その音は、原曲に近くなるように作られているそうだ。
声の場合は、音声ファイルからMIDIファイルに変換して、それをピアノで演奏するんだ。
変換ツールの一例を見てみると、区切った時間ごとに音の周波数を分析して、12音階の音に振り分けている。
周波数というのは、1秒間に振動する回数のことだ。
ただし、動画の制作者がこのツールを使ったかどうかはわからない。
ある投稿者が自作したツールでの例では、変換したMIDIを再生すると、ピアノの不協和音が連続したような音になったそうだ。
じゃあ、そんな音からどうして声が聞こえてくるんだろう?
ピアノが声に聞こえるなら、そもそも声は何でできているのか

声の話をする前に、まずは音の高さの話をしておこう。
1秒間に振動する回数を周波数といって、回数が多ければ高い音、少なければ低い音に聞こえるんだ。
いちばん単純なのは、高さが1つだけの音なんだ。
この音を正弦波と呼ぶ。
周波数を横軸にとって、それぞれの周波数の成分がどれくらいの大きさなのかを棒グラフにしたものを、スペクトルという。
音にどの周波数がどれだけ含まれているかが、ひと目でわかる図なんだ。
正弦波のスペクトルには、線が1本立つだけになる。
じゃあ、声のほうはどうなっているのか?
母音には、それぞれ特定の周波数が強くなっている部分があって、これをフォルマントと呼ぶ。
このフォルマントが、母音の特徴になっているんだ。
フォルマントの周波数を決めているのは、声道だ。
声道は、舌の位置や唇の形で形が変わる。
だから、共鳴する周波数、つまりフォルマントの値が変わるんだ。
第1フォルマントは口の開き具合、第2フォルマントは舌の位置に対応するといわれている。
つまり母音の違いは、どの高さの音が強く出ているかの違いでもあるんだ。
ここで気になるのが、ピアノのMIDIにもこのフォルマントが残っているのか?ということだ。
実はこれについて書いた資料は、僕が調べた範囲では見つからなかったんだ。
2009年には、もう同じ発想の「しゃべるピアノ」があった

ピアノに声をしゃべらせるという発想は、2009年にはもう作品になっていた。
作曲家ペーター・アブリンガーの作品で、コンピューター制御のピアノが英語の朗読を再現したんだ。
この作品は2009年に、ウィーン・モデルン音楽祭とワールド・ベネチア・フォーラム2009のために作られている。
やり方はこうだ。
録音した音の「時間」と「周波数」を小さなマス目に分けて、そのマスを楽器や自動ピアノで鳴らし直す。
自動ピアノというのは、人の代わりにコンピューターが鍵を動かして鳴らす、本物のピアノのことだ。
声をマス目に分けて、ピアノの鍵で鳴らし直す。
だから、ピアノから声のような音が出るんだ。
自動ピアノは、88の鍵をすべて同時に、それぞれ違う強さで鳴らすことができる。
しかもその同時打鍵を、1秒に少なくとも16回繰り返せるんだ。
マス目を1秒に16個まで細かく区切れるから、自動ピアノでも、話し言葉として聞き取れる構造を演奏できるんだ。
この1秒に16個という細かさは、自動ピアノのほぼ限界なんだそうだ。
そして聞き取れるようになるには聴く練習がいる、と作曲者は書いている。
ただ、動画の制作者がこの手法を受け継いだのかどうかは、僕が調べた範囲ではわからなかった。
言えるのは、2009年には、もう同じ発想の作品があったということなんだ。
知っている音ほど、声になって聞こえる

1981年には、こんな実験もある。
声を3つの単純な音、つまり正弦波に置き換えても、聞き手は発話を聞き取れたんだ。
この音は、発話のフォルマントの中心を追いかけるように作られている。
こうして作った人工の音声を、サイン波音声と呼ぶ。
時間とともに変わる性質が残っているから、普通の音声の手がかりがなくても、言葉として聞き取れるんだ。
何も知らずにサイン波音声を聞くと、多くの人には、同時に鳴る口笛やSFの効果音に聞こえる。
ところが、元の音声を一度聞いたあとだと、同じ音が文としてはっきり聞こえるようになるんだ。
動画の制作者も、歌詞を見ながらだと、知らない曲でも聞き取れる場合があると書いている。
ここで、最初に書いた僕の体験を思い出してほしい。
最初は雑音で、途中からメロディが聞き取れて、曲のどこなのかわかったらオケも聞き取れるようになった。
この流れは、サイン波音声を元の音声のあとに聞いたときの変わり方と、形が似ていると僕は思っている。
ただし、ピアノの声とサイン波音声が同じ仕組みで聞こえていると書いた資料は、僕が調べた範囲では見つからなかったんだ。
ピアノの声を言葉にしているのは、聞く側でもあった
ピアノは、元の音をピアノの音で鳴らし直しているだけなんだ。
それを言葉として受け取れるかどうかは、聞く側にもかかっている。
僕の場合、アコギで楽器の音が声に聞こえたことはない。
特定の倍音(基準になる音の周波数の整数倍の周波数を持つ音)が鳴る楽器や効果音なら、声に聞こえることもある。
ただし、それはかなり限定的だ。
一方で普段の生活では、人の声とは全然違う音が、人の声や話し声に聞こえることがある。
僕はこれを、周波数が近い音が出ていて、それに反応しているんじゃないかと思っている。
あくまで僕の推測だけどね。
もし、気になる声が聞こえて困っている場合は、医療機関に相談してほしい。
ピアノから声が聞こえる錯覚には、調べても答えが見つからなかったことがある。
MIDIへの変換が、フォルマントを残しているのかどうか。
ピアノの声と3つの音の声が、同じ仕組みで聞こえているのかどうか。
それでも、3つの音で作った声が、元の音声を聞く前とあとで違って聞こえることはわかっている。
次にピアノの声を聞くときは、その変わる瞬間を少し意識してみてほしい。
今回も未来を覗き見れたかな?それじゃ、バイバイ!
参考にした資料
・【音の錯覚】シリーズについて(UNKNOWN OFFICIAL)
・ピアノの音なのに歌詞が聞こえる“音の錯覚”で合成音声作ってみた!(ニコニコニュース, 2025年7月30日)
・音声分析実験テキスト(工学院大学 情報科学研究教育センター)
・トルコ語 発音モジュール 理論編 4-5章(東京外国語大学)
・Deus Cantando(Peter Ablinger)
・ピアノの音だけなのに本当に人が話しているように聞こえる(GIGAZINE, 2009年10月10日)
・Speech Perception Without Traditional Speech Cues(Remez ほか, Science 212, 1981)
・An Introduction to Sine-Wave Speech(MRC Cognition and Brain Sciences Unit)





コメント