AIリマスタリング実験記 — 1981年のYMOカセット音源にDeMixパイプラインを挑む
AIリマスタリング実験記 — 1981年のYMOカセット音源にDeMixパイプラインを挑む
ValmisTech ilog #003 2026年4月8日 / Claude Opus 4.6 との対話
発端:ビートルズ赤盤青盤リマスター版の衝撃
Ito: とあるYMOのアンオフィシャルな私的録音データの音質をむちゃくちゃ良くしたいと思っている。昔の音源をAIの力でマルチトラックの状態に分離して音質をあげまくって、改めてミックスするというDeMixという手法があると聞いた。最近はそれで過去のビートルズの音源が恐ろしい程よくなって赤盤青盤再発売とかありました(自分も持ってる)。この技術はどこかでオープンソース的に公開されているのか?なければ公開されているライブラリを駆使して組み合わせて頑張って似たようなことはできるのか?
Claude: オープンソースで十分に実現可能です。核心技術は3つあります。
オープンソース・エコシステム
Claude: 現在使える主要ツールを整理しました。
ステム分離(核心技術)
| ツール | 開発元 | 特徴 |
|---|---|---|
| Demucs v4 | Meta | 現時点で最高性能。4〜6トラック分離。MIT License |
| Spleeter | Deezer | 安定した定番。リアルタイムの100倍速 |
| UVR | コミュニティ | GUI付き。複数AIモデルを切り替え可能 |
分離後の音質向上
| ツール | 機能 |
|---|---|
| AudioSR | AI音声超解像。2-16kHzの音源を48kHzにアップサンプリング |
| Resemble Enhance | ノイズ除去 + 帯域拡張の2段階処理 |
| Facebook Denoiser | リアルタイム音声ノイズ除去 |
音源の正体:1981年の某ライブリハーサル
Claude: カセット特有の課題があります。
| 課題 | 内容 | 対応ツール |
|---|---|---|
| テープヒス | 常時存在するブロードバンドノイズ | Resemble Enhance, noisereduce |
| 帯域制限 | ~50Hz-12kHz(高域が欠落) | AudioSR(12kHz→48kHz拡張) |
| ワウ・フラッター | ピッチ/テンポの揺れ | Capstan(有料)、iZotope RX |
| テープ飽和 | アナログ的な歪み | むしろ保持した方が良い場合も |
YMOの電子音楽という特性も重要。シンセはハーモニクスの重なりがアコースティック楽器より少なく、ステム分離が比較的クリーンになる。一方、ボコーダーボイスはシンセとの境界が曖昧で、分離が難しい可能性がある。
音源スペック:
- フォーマット: FLAC 24bit / 44.1kHz ステレオ
- 長さ: 約12分55秒
- 実行環境: Apple M5 Pro + 64GB RAM(MPS GPU加速対応)
パイプライン設計
Claude: 処理順序は研究コンセンサスに基づいて設計した。特に「ノイズ除去を分離の前にやる」のが鉄則。分離後だと各トラックにノイズが比例配分されて除去が困難になる。
全体フロー
第1ラウンド:まず動かす
Claude: 環境構築からスタート。Python 3.13、PyTorch(MPS対応)、Demucs、noisereduce、ffmpegをインストール。ただしAudioSRはPython 3.13と非互換(古いnumpy依存)だったため、Stage 4は高品質リサンプル(soxr_vhq)にフォールバック。
途中、SSL証明書の問題やtorchaudioのバックエンド問題など細かいトラブルを潰しながらパイプラインを完走。
第1ラウンドの結果
| 指標 | 元音源 | リマスター後 |
|---|---|---|
| RMS | -17.22 dB | -18.48 dB |
| ピーク | -0.48 dB | -2.28 dB |
| LUFS | -13.23 | -14.36 |
| スペクトラル重心 | 3124.7 Hz | 3341.0 Hz (+7%) |
Ito: すこーしよくなった?😅これってもともとモノラル?
Claude: L/R相関が0.858なのでちゃんとステレオ。「すこーし」という反応は正直なところ。AudioSRが使えなかったのが大きい。超解像が単なるリサンプルになっていて、帯域は実質広がっていない。
第2ラウンド:本物のAI超解像を投入
Ito: AudioSRによる本物の超解像ともっと積極的なノイズ除去でもう一回いきましょう!
Claude: 2つの改善を実施した。
改善1:ノイズ除去の強化
prop_decrease を 0.85 → 0.95 に引き上げ。最初は2パス処理も試みたが、RMSが -17 → -30 dBに落ちて音楽自体が削られたため、1パス・強度アップに落ち着いた。
改善2:AudioSR用の別Python環境を構築
Python 3.11をpyenvでインストールし、AudioSR専用の仮想環境を別途構築。メインのパイプラインからsubprocess経由で呼び出す設計。
AudioSR実行の壁
順調には進まなかった。
- MPS(Apple GPU)非対応 —
convolutionオペレーションが未実装。CPUにフォールバック - OOM Kill — 13分の音声を一括処理しようとしてメモリ不足で強制終了
- チャンク処理(分割処理)に切り替え — 10.24秒×76チャンク×2チャンネル = 152回の拡散処理
最終的にCPUで約90分かけてotherステム(シンセ=YMOサウンドの核心)のAI超解像を完了。
結果比較:AI超解像の効果
| 指標 | 元音源 | 第1ラウンド | 第2ラウンド |
|---|---|---|---|
| スペクトラル重心 | 3124.7 Hz | 3341.0 Hz | 5892.1 Hz |
| LUFS | -13.23 | -14.36 | -14.30 |
| ピーク | -0.48 dB | -2.28 dB | -2.35 dB |
| サンプルレート | 44.1kHz | 48kHz | 48kHz |
スペクトラル重心が3125Hz → 5892Hz に大幅上昇。これはAudioSRが高域成分をAI生成した証拠。カセットの帯域制限(~12kHz)を超えた高域が復元された。
聴いてみた感想
Ito: おお、これは、、ハッキリと音質が良くはなってないけど、空気感が増した感じ?ライブ録音感が増している感じがする。ノイズが減ってる効果も出てると思う。面白い。AI一発でもそこそこ効果あるんだなぁ☺️
Claude: 「空気感が増した」「ライブ録音感」というのは、まさにDeMixの効果が出ている証拠。
何が起きているか:
- ノイズ除去でテープヒスのベールが剥がれて、会場の空気感(リバーブ、観客の気配)が浮かび上がった
- ステム分離→再合成で各楽器の分離感が微妙に改善
- AudioSRがシンセステムに高域成分を付加(スペクトラル重心 3125→5892Hz)
ビートルズ赤盤青盤のリマスター処理では、この手法をプロのエンジニアが手動で細かく調整して仕上げているはず。自動パイプラインでここまで出れば上々。
第3ラウンド:全部盛りの罠
効果があったなら全ステムにやればもっと良くなるはず——そう考えるのは自然な流れ。残り3ステム(vocals, drums, bass)にもAudioSRを適用し、全4トラックをAI超解像した上で再ミックスした。
| 指標 | 元音源 | otherのみAudioSR | 全ステムAudioSR |
|---|---|---|---|
| スペクトラル重心 | 3,125 Hz | 5,892 Hz | 7,961 Hz |
| LUFS | -13.23 | -14.30 | -14.26 |
| ピーク | -0.48 dB | -2.35 dB | -2.29 dB |
数値上はスペクトラル重心が3,125→7,961Hzと2.5倍に。完璧に見える。しかし、、
Ito: うわー、なんか高周波成分がケンカしちゃってグシャグシャな音になっちゃった😂やりすぎもよくないね😂
Claude: 全ステムに超解像をかけると、それぞれが「ここに高域があるはず」とAIが推測した成分が4トラック分重なって干渉し合ってしまう。数値は上がったのに、音は悪くなった。
考えてみれば理にかなっている:
- other(シンセ): YMOの核心。高域拡張の恩恵が最大
- drums: TR-808のキックやハイハットはそもそも帯域が限定的
- bass: 低域楽器に高域を足しても意味が薄い
- vocals: ボコーダー処理済みなので高域生成がノイジーになりやすい
結論:第2ラウンドのotherのみAudioSR版がベストだった。 「もっとやればもっと良くなる」は幻想で、適材適所こそが正解。ドラえもんの道具みたいに、使いすぎると逆効果になる。
振り返り:何が効いて、何が足りなかったか
うまくいったこと
- Demucs v4のステム分離品質は素晴らしい。電子音楽との相性も良好
- ノイズ除去→分離の順序が正解。分離後だとノイズが各ステムに配分されて除去困難になる
- config.yamlでパラメータを外出しにしたことで、試行錯誤がスムーズ
- AudioSRは適材適所で効く。全部盛りは逆効果
課題として残ったこと
- AudioSRのPython互換性が厳しい。別venvでの運用が必要
- GPU(MPS)未対応でCPU処理に90分。将来のMPS対応に期待
- ワウ・フラッター補正のOSSツールが存在しない
40年前の音を掘り起こして
1981年のカセット私的録音が、AIによるOSSツール利用だけでここまで来れるのは面白い。「劇的に良くなった」とは言い切れないが、確実に変化は感じられる。特にノイズ除去による「ベールが剥がれる」効果と、空気感の改善を感じられた。
そして「全部盛りにしたら逆にグシャグシャ」という失敗も含めて、プロのDeMixリマスタリングとの差は「パイプラインの有無」ではなく「どこに何をどれだけ適用するかの判断力」にあると分かった。ビートルズの赤盤青盤リマスター版のエンジニアも、きっとこういう試行錯誤を何百回もやって最適解を見つけたんだろう。
40年前の音をAIで掘り起こす。完璧じゃなくても、その過程自体が面白い。