音の超解像から「隠れた評価関数」へ — AudioSR・Demucs・AlphaFoldを横断する問い
音の超解像から「隠れた評価関数」へ — AudioSR・Demucs・AlphaFoldを横断する問い
ValmisTech ilog #004 2026年4月9日 / Claude Opus 4.6 との対話
前回の ilog #003 では、1981年のYMOカセット音源に Demucs + AudioSR のパイプラインを実際に走らせた。今回はその背景にある技術と、AIが「解ける問題」と「解けない問題」を分ける構造について掘り下げる。
AudioSRとは何か
Ito: AudioSRとは?音質の超解像?
Claude: AudioSRは、まさに「音の超解像」です。画像のSuper Resolutionと同じコンセプトを音声に適用したもので、Haohe Liuらが2023年に発表した拡散モデル(Diffusion Model)ベースの生成AIです。
低解像度の音声から高周波成分を予測・補完して、音質を引き上げます。具体的には、帯域2kHz〜16kHzの入力音声を、帯域24kHz・サンプリングレート48kHzの高解像度音声にアップサンプリングできます。
従来手法との大きな違いは汎用性です。以前の手法は対応できる音声の種類(音楽のみ、スピーチのみ等)や帯域設定が限定的でしたが、AudioSRは効果音・音楽・スピーチすべてに対応します。
技術的なポイント:
- 拡散モデルベースの生成的アプローチ。失われた高周波を「推測して生成する」ので、単なる補間とは質が違う
- プラグアンドプレイで使える。AudioLDM、FastSpeech2、MusicGenなど他の音声生成モデルの出力品質を後処理的に向上させるモジュールとしても機能する
- CLIツールとして pip install で使え、basic(汎用)と speech(音声特化)の2モデルを選択可能
DJ的に見ると、古い音源やストリーミング由来の低ビットレート音源を48kHzに持ち上げられるので、セットに使う素材の底上げに使える可能性があります。ただし、あくまで「AIが推測した高周波」であって、原音の復元ではない点は注意が必要です。ローパスフィルタ後のようなクリーンなカットオフパターンが得意で、MP3圧縮のような不規則なスペクトログラムの穴がある場合は、先にローパスフィルタをかけてから処理したほうが良い結果が出ます。
音源分離のOSS
Ito: あといわゆるDeMixしてくれるツールもOSSであると聞いた。
Claude: 代表的なOSSがいくつかあります。
Demucs(Meta AI → 現在は作者が個人メンテ) — 最も有名で品質も高い。ミックスされた楽曲をボーカル、ドラム、ベース、その他のパートに分離するオープンソースツールで、v4ではHybrid Transformer技術を導入して分離精度が大幅に向上しています。
- 4ステム(vocals / drums / bass / other)が基本、6ステムモデル(guitar, pianoを追加分離)も実験的に提供
pip install demucs→demucs input.mp3で即使える- MITライセンス、CPU/GPU両対応
- WebAssembly版も存在し、ブラウザ上でクライアントサイド処理できるデモサイトもある
Spleeter(Deezer) — フランスの音楽ストリーミングサービスDeezerが開発したオープンソースの音源分離ツールで、CNNベースでボーカル・ドラム・ベース等を分離。2/4/5ステムモデルがあります。Demucsより前に普及したツールで、速度は速いですが分離品質はDemucsのv4が上回っています。
Open-Unmix — PyTorchによる音源分離のリファレンス実装。MUSDB18データセットで訓練されたモデルが提供されています。
DJ用途としての現実的な選択肢はDemucs v4の htdemucs_ft(ファインチューニング済み)モデルが現状のベスト。AudioSRと組み合わせて「分離 → 超解像」のパイプラインを組めば、古い音源やストリーミング品質の素材からでもそれなりのステムが作れる可能性があります。ただし、分離後の各ステムにはどうしてもアーティファクトが残るので、マッシュアップやリミックスの素材としては使えても、そのままクラブで鳴らすにはクオリティの見極めが必要です。
DJソフトへの波及
Ito: 最近のPCDJアプリにそういう機能ついたのはこの辺のライブラリを中で使い始めたから?
Claude: 推測は概ね正しいですが、各社の事情はもう少し複雑です。
直接OSSを使っているケース — NUO-STEMSのようなサードパーティツールは、中身にMeta Demucs v3/v4のモデルとPythonライブラリをそのまま組み込んでいることが確認されています。また、初期のVirtualDJやAlgoriddim djay ProはSpleeterベースの技術を使っていたとされています。
自社開発・独自路線のケース — 大手は必ずしもOSSをそのまま使っているわけではありません。
- Traktor Pro 4(Native Instruments): iZotopeのRX技術をベースにしたAI分離を搭載。iZotopeはNIグループなので内製技術
- Serato: 独自開発のアルゴリズムを使っていると公式に述べている。ただし外部の開発者からはDemucs v4ベースではないかという推測もある
- rekordbox: 専用のAIモデルを使用し、対応ハードウェア上で処理する方式
構図としては、SpleeterやDemucsといったOSSが「音源分離は実用レベルになった」という事実を証明し、各社が一斉にこの機能をDJソフトに載せる流れを作った、というのが正確なところです。OSSがそのまま使われているケースもあれば、それを参考にしつつ自社モデルを訓練し直しているケースもある。比較テストでは、Traktor・Serato・VirtualDJを並べて聴いたところ、技術的には別物なのに分離品質は驚くほど似通っていたそうです。
つまり「OSSライブラリをそのまま組み込んだ」というよりは、OSSが市場を作り、それに触発されて各社が独自実装も含めて競争している、という状況です。
ビートルズとMAL
Ito: ビートルズの赤盤青盤リマスター版や映画Get Backにこの辺の技術使われてるよね?
Claude: その通りです。ただし、ビートルズの場合はOSSそのものではなく、独自開発のプロプライエタリ技術が使われています。
MAL(Machine Assisted Learning) — Peter JacksonのWingNut Films(Park Road Post Production)が開発した独自のデミックス技術で、「Get Back」ドキュメンタリーで初めて使われました。名前の由来が良くて、「Machine Assisted Learning」の略であると同時に、『2001年宇宙の旅』のHALコンピュータと、Get Backに終始登場するビートルズのローディー、マル・エヴァンスへのオマージュです。
使われたプロジェクト:
- Get Back(2021): 130時間のモノラル音声から、楽器の下に埋もれていた会話を分離・復元
- Revolver リミックス(2022): 初期のステレオ録音の制約を超えた新ミックス
- Now And Then(2023): ジョン・レノンのデモカセットからピアノとボーカルをAIで分離し、純粋なボーカルトラックを抽出。その上にポール・リンゴが新録音を重ねた
- 赤盤・青盤 2023年版: ほぼ全曲がMAL技術でリミックスされ、「Love Me Do」や「She Loves You」が初めて本当のステレオに
初期ビートルズの楽曲は2トラック録音で、ボーカルと楽器がたった2チャンネルに押し込まれていたため、従来技術ではリミックスがほぼ不可能でした。MALがこれを個別パートに分離できたことで、60年前の録音を現代的なステレオミックスに再構築できた。OSSのSpleeterやDemucsと根底にある技術思想(ニューラルネットによるソース分離)は同じですが、WingNut Filmsが独自に訓練・最適化した非公開のモデルです。
2019年の転換点
Ito: DemucsやSpleeterが出始めたのはいつ?
Claude: ほぼ同時期の2019年後半に相次いで登場しています。
- Spleeter: 2019年10月29日にDeezerがGitHubで公開。初週で5,000スター以上を獲得
- Demucs: Facebook AI Researchが2019年11〜12月頃に初版を公開。その後v2(2021年4月)、v3(2021年11月、Sony MDXチャレンジ優勝)、v4(2022年11月、Hybrid Transformer導入)と進化
つまり2019年の秋に、Deezer(フランス)とFacebook AI(現Meta)がほぼ同時にOSSとして出してきた。そこからわずか2年後の2021年にPeter JacksonのGet Backが公開され、VirtualDJが翌年にリアルタイム分離を載せ、2022〜2023年にSerato・rekordbox・Traktorが続々と搭載、という流れです。
2019年のこの2つのリリースが、音源分離を「研究室の実験」から「誰でも使える実用技術」に変えた転換点でした。
Ito: もう7年も歴史あるのね。そこにアップサンプリング技術も加わって凄いことに。
スタジオミキシングの自動化
Ito: MIXをいい具合にしてくれるOSSもある? ……あ、DJミックスじゃなくて、スタジオ作業としてのマルチトラック音源のMIXのこと。
Claude: DAW的なミキシング(マルチトラックの各パートにEQ・コンプ・リバーブ等をかけて2mixに仕上げる作業)の自動化、OSSレベルでもいくつか出てきています。ただしDemucsのように「すぐ使える完成品」というよりは、研究実装が中心です。
-
automix-toolkit(Christian Steinmetz, Queen Mary Univ.)— 微分可能なミキシングコンソールを使い、マルチトラックのゲイン・EQ・コンプ・パン・リバーブのパラメータをニューラルネットが予測する。出力がミックス済み波形ではなく「人間が読めるパラメータ」なので、後から手動で微調整できるのが設計思想として良い
-
FxNorm-Automix(Sony)— プロがミックスした「ウェット」な音源を学習データとして再利用し、自動ミキシングモデルを訓練する手法。著作権の問題でドライステムの大規模データセットが手に入りにくいという課題に対し、既存の完成ミックスから逆算的に学習するアプローチ
-
Diff-MST(ISMIR 2024)— リファレンス曲のミキシングスタイルを別のマルチトラックに転写するスタイルトランスファー。「この曲のミックスをあの曲みたいにして」が可能
-
AiLive Mixer(2025)— ライブ演奏のマルチトラック入力に対してゼロレイテンシでモノゲインを自動予測する初のエンドツーエンドモデル。ライブ向けという独自の切り口
Demucsが音源分離を一気に実用化したような「決定打」はまだ出ていません。理由は明確で、ミキシングは「正解がない」問題だから。分離は「元の音に戻す」という客観的なゴールがあるけれど、ミキシングは「どう聴かせたいか」というエンジニアの主観・美学が入る。なのでスタイルトランスファー(Diff-MST)のように「参照ミックスに寄せる」というアプローチが現実的な落としどころになっている印象です。
AIの得意不得意を分ける構造
Ito: 全く別ジャンルで似たような話ってある?
Claude: 「AIが客観的なタスクは得意だけど、主観・美学が入ると決定打が出にくい」という構造は、他のジャンルにもかなりあります。
画像・映像 — 超解像・ノイズ除去(客観寄り)は成熟。Real-ESRGAN、Topaz系など実用レベルに到達。一方、カラーグレーディング(主観寄り)はまだ決定打なし。「リファレンスの色味に寄せる」スタイルトランスファーに落ち着くあたり、まさにDiff-MSTと同じ構造。
テキスト・翻訳 — 翻訳(客観寄り)はDeepL、Google翻訳がかなり実用的。文芸翻訳・コピーライティング(主観寄り)はLLMでも「村上春樹の文体で」と参照を与えれば近づくが、スタイルトランスファー止まり。
料理 — レシピの再現(客観寄り)は分量・手順の最適化にAIが得意。味付けの設計(主観寄り)は人間のシェフの領域。
建築 — 構造計算・耐震解析(客観寄り)は成熟。空間デザイン(主観寄り)は参照ベースに寄る。
どのジャンルでも同じパターンが見えます。「復元・分離・変換」のように正解が定義できるタスクはOSSで一気に民主化されるけれど、「設計・演出・表現」のように正解がないタスクは「参照に寄せる(スタイルトランスファー)」が現実的な上限になる。 そしてその先の「ゼロから美学を生む」部分は、今のところ人間にしかできない。
「隠れた評価関数」仮説
Ito: では数少ない例外的に、正解がないような分野をAIがほぼ正解を出せるようになって成功しているプロジェクトってある?業界問わずに。
Claude: すごくいい問いです。「正解がないはずなのに、AIがほぼ正解を出せてしまった」例。少し考えてみると、実はいくつか思い当たります。
これは本当に面白い問いで、答えの鍵は**「正解がない」と思われていたのに、実は隠れた正解があった**というケースに集約されます。
最大の成功例:AlphaFold(タンパク質立体構造予測) — 50年以上未解決だった問題を解いた。「タンパク質の構造は計算不可能」と言われていたが、AlphaFoldは進化的な共変異パターンと物理的・幾何学的な帰納バイアスを組み合わせ、実験的に測定した構造とほぼ同等の精度を達成。ポイントは、「正解が存在しなかった」のではなく、**「正解にたどり着く方法がなかった」**ということ。自然界には物理法則に基づく唯一の安定構造がちゃんと存在していて、AIがそこに到達する経路を見つけた。
この視点で他の分野を見直すと:
- 囲碁(AlphaGo) — 「最善手」は主観だと思われていたのに、AIが人間を超えた。実は囲碁には勝敗という明確な評価関数があり、「美学」だと思われていた打ち筋の多くが、実は計算可能だった
- 天気予報(GraphCast / GenCast) — カオス理論的に「長期予測は不可能」とされていたのに、DeepMindのGenCastが既存の数値予報モデルを上回った
- コード生成 — 「プログラミングは創造的な行為」と思われていたが、実際にはテストが通るかどうかという客観的な評価基準がある
成功パターンの共通点は、「正解がない」と人間が思い込んでいたが、実は隠れた評価関数が存在したこと。AIはその隠れた正解構造を発見し、人間が「経験と勘」でやっていたことを体系化してしまった。逆に、ミキシングやカラーグレーディングのような「本当に正解がない」領域は、今のところ決定打を出せていない。
結局、AIの成功を分けるのは「正解があるかないか」ではなく、「評価関数が定義できるかどうか」という一点に集約される。
ミキシングにも評価関数はあるはず
Ito: ミキシングやカラーグレーディングにだって、隠れた評価関数は絶対にあると思う。
Claude: 同感です。というより、それは非常に筋の良い仮説だと思います。
AlphaFoldの前に「タンパク質の構造は計算不可能」と言われていたのと同じ構図で、ミキシングやカラーグレーディングにも人間がまだ言語化・数式化できていないだけの評価関数が潜んでいる可能性は高い。
手がかりはすでにある。ミキシングなら、周波数帯域ごとのエネルギー分布、ラウドネスの時間的推移、ステレオフィールド上の各楽器の分離度、マスキングの少なさなど、定量化可能な軸がかなりある。カラーグレーディングでも、肌の色が自然に見える範囲、コントラスト比と知覚的な「深み」の関係など、実は定量化できる要素が多い。
ではなぜまだ解けていないのか。おそらく理由は3つ。
- データの問題 — AlphaFoldにはPDB(Protein Data Bank)という数十万件の実験データがあった。ミキシングには「プロがミックスした全トラック+ドライステムのペア」が大規模に公開されたデータセットがほぼ存在しない。著作権の壁が厚い
- 評価関数の多次元性 — タンパク質は「実験構造との距離」という単一指標に落とせたが、ミキシングは「ジャンルごとの美学」「時代のトレンド」「アーティストの意図」が絡む。正解が一つではなく、文脈依存の「正解の空間」がある。ただしこれは囲碁も同じで、局面ごとに最善手は変わる
- 業界のインセンティブ構造 — DeepMindはAlphaFoldに膨大なリソースを注いだけれど、音楽ミキシングの自動化に同等の投資をする動機がまだない。市場規模の問題
もしDemucs級のブレークスルーがミキシングで起きるとしたら、「一つの正解を出す」モデルではなく、「この文脈ではこの空間のどこかが正解だ」という正解の分布を推定するモデルになるのではないか。Diff-MSTの「リファレンスに寄せる」アプローチは、その入口にいる。
「もう少しで解ける問題」への絨毯爆撃
Ito: そしたら、費用対効果をちゃんと測って、正解が出てないけどもう少しで出るみたいなジャンルを探してそこに絨毯爆撃するような投資するビジネスモデルが考えられますね🤣
Claude: 笑い事ではなく、実際にかなり鋭いビジネスモデルだと思います。
実質的にやっているプレイヤーがいます。 DeepMindがまさにそれ。AlphaFold(タンパク質)→ AlphaGeometry(数学オリンピック)→ GraphCast/GenCast(天気予報)→ AlphaProteo(タンパク質設計)と、「隠れた評価関数がありそうで、データも揃いつつあるが、まだ人間の経験と勘に頼っている領域」を次々にスナイプしている。彼らのポートフォリオを並べると、まさに「もう少しで解ける問題のリスト」になっている。
この戦略をフレームワーク化すると、投資判断の軸は4つ:
- 評価関数の潜在度 — 「正解がない」と言われているが、専門家の間で暗黙の一致がどの程度あるか。一致度が高いほど、隠れた評価関数が存在する確率が高い
- データの成熟度 — 学習に使えるペアデータがどの程度存在するか。AlphaFoldにはPDBがあった
- 既存ソリューションの天井 — 現在の手法がどこまで来ているか。天井に近いほど「あと一押し」の可能性が高い
- 市場の支払い意志 — 解けたときに誰がいくら払うか
「もう少しで出そう」な領域の候補としては、材料科学(新素材の物性予測)、回路設計(チップのレイアウト最適化)、創薬の分子設計、農業の収量最適化あたりがスコアの高い象限に入りそう。
そして面白いのは、この「絨毯爆撃投資」モデル自体がメタ的にAI向きの問題だということ。どのドメインが「もう少しで解ける」かを評価する関数こそ、まさに定義可能なはず。ファンドのGPが経験と勘でやっていることをAIが体系化する。再帰的ですね。
Ito: 面白い!じゃあ僕はその会社の株を買っておきます( ・`ω・´)
Claude: 実質DeepMind(= Alphabet/Google)の株を買う、という話ですね。
ただ一点だけ冷静に言うと、DeepMindの研究成果がAlphabetの株価にどれだけ織り込まれているかは別問題です。市場はその「もう少しで解ける問題ポートフォリオ」の価値を正確にはプライシングできていない可能性がある。それが割安と見るか、収益化リスクと見るかで判断が分かれます。
同じ「絨毯爆撃」戦略を取れるプレイヤーは他にもいて、Meta(FAIR、Demucsもここ出身)、Microsoft(OpenAIとの提携+独自研究)、あとは意外とSonyが音楽・映像領域のAI研究を地道にやっている(FxNorm-Automix、DJtransGANもSony R&D)。ドメイン特化で勝負するなら、大手より先にニッチな評価関数を押さえた小さいチームが勝つ可能性もあります。
いずれにせよ、「どのAI企業の株を買うか」ではなく**「どの問題が次に解けるかを見極める目を持つ」**という今日の議論の枠組み自体が、投資判断としては一番価値がありますね。
…なお、これは投資助言ではありませんので念のため。
この記事はAIとの対話ログを整形して公開したものです。
canonical: https://valmis.tech/ilog/2026-04-09-audiosr-and-hidden-evaluation-functions/