ValmisTech ilog #003 / / claude-opus-4-6

AIリマスタリング実験記 — 1981年のYMOカセット音源にDeMixパイプラインを挑む

AIリマスタリング実験記 — 1981年のYMOカセット音源にDeMixパイプラインを挑む

ValmisTech ilog #003 2026年4月8日 / Claude Opus 4.6 との対話


発端:ビートルズ赤盤青盤リマスター版の衝撃

Ito: とあるYMOのアンオフィシャルな私的録音データの音質をむちゃくちゃ良くしたいと思っている。昔の音源をAIの力でマルチトラックの状態に分離して音質をあげまくって、改めてミックスするというDeMixという手法があると聞いた。最近はそれで過去のビートルズの音源が恐ろしい程よくなって赤盤青盤再発売とかありました(自分も持ってる)。この技術はどこかでオープンソース的に公開されているのか?なければ公開されているライブラリを駆使して組み合わせて頑張って似たようなことはできるのか?

Claude: オープンソースで十分に実現可能です。核心技術は3つあります。


オープンソース・エコシステム

Claude: 現在使える主要ツールを整理しました。

ステム分離(核心技術)

ツール開発元特徴
Demucs v4Meta現時点で最高性能。4〜6トラック分離。MIT License
SpleeterDeezer安定した定番。リアルタイムの100倍速
UVRコミュニティGUI付き。複数AIモデルを切り替え可能

分離後の音質向上

ツール機能
AudioSRAI音声超解像。2-16kHzの音源を48kHzにアップサンプリング
Resemble Enhanceノイズ除去 + 帯域拡張の2段階処理
Facebook Denoiserリアルタイム音声ノイズ除去

音源の正体:1981年の某ライブリハーサル

Claude: カセット特有の課題があります。

課題内容対応ツール
テープヒス常時存在するブロードバンドノイズResemble Enhance, noisereduce
帯域制限~50Hz-12kHz(高域が欠落)AudioSR(12kHz→48kHz拡張)
ワウ・フラッターピッチ/テンポの揺れCapstan(有料)、iZotope RX
テープ飽和アナログ的な歪みむしろ保持した方が良い場合も

YMOの電子音楽という特性も重要。シンセはハーモニクスの重なりがアコースティック楽器より少なく、ステム分離が比較的クリーンになる。一方、ボコーダーボイスはシンセとの境界が曖昧で、分離が難しい可能性がある。

音源スペック:


パイプライン設計

Claude: 処理順序は研究コンセンサスに基づいて設計した。特に「ノイズ除去を分離の前にやる」のが鉄則。分離後だと各トラックにノイズが比例配分されて除去が困難になる。

全体フロー

AIリマスタリング パイプライン全体フロー: Stage1 ノイズ除去 → Stage2 ステム分離(Demucs) → Stage3 EQ強化 → Stage4 AI超解像(AudioSR) → Stage5 マスタリング

第1ラウンド:まず動かす

Claude: 環境構築からスタート。Python 3.13、PyTorch(MPS対応)、Demucs、noisereduce、ffmpegをインストール。ただしAudioSRはPython 3.13と非互換(古いnumpy依存)だったため、Stage 4は高品質リサンプル(soxr_vhq)にフォールバック。

途中、SSL証明書の問題やtorchaudioのバックエンド問題など細かいトラブルを潰しながらパイプラインを完走。

第1ラウンドの結果

指標元音源リマスター後
RMS-17.22 dB-18.48 dB
ピーク-0.48 dB-2.28 dB
LUFS-13.23-14.36
スペクトラル重心3124.7 Hz3341.0 Hz (+7%)

Ito: すこーしよくなった?😅これってもともとモノラル?

Claude: L/R相関が0.858なのでちゃんとステレオ。「すこーし」という反応は正直なところ。AudioSRが使えなかったのが大きい。超解像が単なるリサンプルになっていて、帯域は実質広がっていない。


第2ラウンド:本物のAI超解像を投入

Ito: AudioSRによる本物の超解像ともっと積極的なノイズ除去でもう一回いきましょう!

Claude: 2つの改善を実施した。

改善1:ノイズ除去の強化

prop_decrease を 0.85 → 0.95 に引き上げ。最初は2パス処理も試みたが、RMSが -17 → -30 dBに落ちて音楽自体が削られたため、1パス・強度アップに落ち着いた。

改善2:AudioSR用の別Python環境を構築

Python環境構成図: メイン環境(Python 3.13)からsubprocessでAudioSR専用venv(Python 3.11)を呼び出す

Python 3.11をpyenvでインストールし、AudioSR専用の仮想環境を別途構築。メインのパイプラインからsubprocess経由で呼び出す設計。

AudioSR実行の壁

順調には進まなかった。

  1. MPS(Apple GPU)非対応 — convolutionオペレーションが未実装。CPUにフォールバック
  2. OOM Kill — 13分の音声を一括処理しようとしてメモリ不足で強制終了
  3. チャンク処理(分割処理)に切り替え — 10.24秒×76チャンク×2チャンネル = 152回の拡散処理

最終的にCPUで約90分かけてotherステム(シンセ=YMOサウンドの核心)のAI超解像を完了。


結果比較:AI超解像の効果

指標元音源第1ラウンド第2ラウンド
スペクトラル重心3124.7 Hz3341.0 Hz5892.1 Hz
LUFS-13.23-14.36-14.30
ピーク-0.48 dB-2.28 dB-2.35 dB
サンプルレート44.1kHz48kHz48kHz

スペクトラル重心が3125Hz → 5892Hz に大幅上昇。これはAudioSRが高域成分をAI生成した証拠。カセットの帯域制限(~12kHz)を超えた高域が復元された。

スペクトラル重心の比較グラフ: 元音源3125Hz → 第1ラウンド3341Hz → 第2ラウンド5892Hz(+88%)

聴いてみた感想

Ito: おお、これは、、ハッキリと音質が良くはなってないけど、空気感が増した感じ?ライブ録音感が増している感じがする。ノイズが減ってる効果も出てると思う。面白い。AI一発でもそこそこ効果あるんだなぁ☺️

Claude: 「空気感が増した」「ライブ録音感」というのは、まさにDeMixの効果が出ている証拠。

何が起きているか:

ビートルズ赤盤青盤のリマスター処理では、この手法をプロのエンジニアが手動で細かく調整して仕上げているはず。自動パイプラインでここまで出れば上々。


第3ラウンド:全部盛りの罠

効果があったなら全ステムにやればもっと良くなるはず——そう考えるのは自然な流れ。残り3ステム(vocals, drums, bass)にもAudioSRを適用し、全4トラックをAI超解像した上で再ミックスした。

指標元音源otherのみAudioSR全ステムAudioSR
スペクトラル重心3,125 Hz5,892 Hz7,961 Hz
LUFS-13.23-14.30-14.26
ピーク-0.48 dB-2.35 dB-2.29 dB

数値上はスペクトラル重心が3,125→7,961Hzと2.5倍に。完璧に見える。しかし、、

Ito: うわー、なんか高周波成分がケンカしちゃってグシャグシャな音になっちゃった😂やりすぎもよくないね😂

Claude: 全ステムに超解像をかけると、それぞれが「ここに高域があるはず」とAIが推測した成分が4トラック分重なって干渉し合ってしまう。数値は上がったのに、音は悪くなった。

考えてみれば理にかなっている:

結論:第2ラウンドのotherのみAudioSR版がベストだった。 「もっとやればもっと良くなる」は幻想で、適材適所こそが正解。ドラえもんの道具みたいに、使いすぎると逆効果になる。


振り返り:何が効いて、何が足りなかったか

うまくいったこと

課題として残ったこと


40年前の音を掘り起こして

1981年のカセット私的録音が、AIによるOSSツール利用だけでここまで来れるのは面白い。「劇的に良くなった」とは言い切れないが、確実に変化は感じられる。特にノイズ除去による「ベールが剥がれる」効果と、空気感の改善を感じられた。

そして「全部盛りにしたら逆にグシャグシャ」という失敗も含めて、プロのDeMixリマスタリングとの差は「パイプラインの有無」ではなく「どこに何をどれだけ適用するかの判断力」にあると分かった。ビートルズの赤盤青盤リマスター版のエンジニアも、きっとこういう試行錯誤を何百回もやって最適解を見つけたんだろう。

40年前の音をAIで掘り起こす。完璧じゃなくても、その過程自体が面白い。