ドレミAI実験室PITCH / LEARNING LAB実験結果を読み込み中

PLAY. LISTEN. COMPARE.

音色が変わっても、ドはド?

鍵盤を鳴らして、自作AIとSwiftF0の聴こえ方を比べよう。

13KEYS / 12CLASSES

自作CNN

50,828 PARAMETERS
鍵盤を鳴らしてください

棒グラフは12音の分類確率。自作モデルの値で、正解の保証ではありません。

SwiftF0

PRETRAINED

学習済みの音高推定モデル。
同じ1秒の音を、そのまま聴かせます。

鍵盤を鳴らしてください
推定周波数— Hz
平均信頼度

信頼度はCNNの分類確率とは異なる指標です。有効な推定が不足すると「判定不能」になります。

再生音声だけを判定します。押した鍵盤の情報はAIへ送りません。

HOW IT LEARNED

学習が止まるまでを、見る。

結果を読み込み中
加工なし学習loss周回評価loss固定検証loss

36 TRAINING RUNS / 3 SEEDS

何が、どれだけ効いた?

研修レポートを保存 ↓

3回の平均 ± 標準偏差。途中の比較は固定検証、最終採点はモデル選択に使わないテスト音源で行います。

方式 / 工夫最良epoch停止epoch停滞 / 上限固定検証最終テスト基本との差学習時間

Webシンセでの最終採点

実験の読み方・データとモデルについて

学習用NSynthの中を楽器単位で約8:2に分割。固定検証・最終テストは学習に使わない楽器の公式分割です。検証とテストの音源は別ですが、楽器50種類は共通です。

Cでは以前覚えた音が周回評価に含まれます。早期終了には共通の固定検証lossを使い、0.0001以上の改善が8周続けてなければ停止します。最大60周です。

SwiftF0の事前学習データとの重複は完全には確認できません。ここでの成績は、この実験条件での比較です。画面のCNNは代表seed 17、表は3 seedの集計です。

NSynth / Google・CC BY 4.0 · SwiftF0 / Lars Nieradzik・MIT