自作CNN
50,828 PARAMETERS—鍵盤を鳴らしてください
棒グラフは12音の分類確率。自作モデルの値で、正解の保証ではありません。
PLAY. LISTEN. COMPARE.
鍵盤を鳴らして、自作AIとSwiftF0の聴こえ方を比べよう。
棒グラフは12音の分類確率。自作モデルの値で、正解の保証ではありません。
学習済みの音高推定モデル。
同じ1秒の音を、そのまま聴かせます。
信頼度はCNNの分類確率とは異なる指標です。有効な推定が不足すると「判定不能」になります。
HOW IT LEARNED
36 TRAINING RUNS / 3 SEEDS
3回の平均 ± 標準偏差。途中の比較は固定検証、最終採点はモデル選択に使わないテスト音源で行います。
| 方式 / 工夫 | 最良epoch | 停止epoch | 停滞 / 上限 | 固定検証 | 最終テスト | 基本との差 | 学習時間 |
|---|
学習用NSynthの中を楽器単位で約8:2に分割。固定検証・最終テストは学習に使わない楽器の公式分割です。検証とテストの音源は別ですが、楽器50種類は共通です。
Cでは以前覚えた音が周回評価に含まれます。早期終了には共通の固定検証lossを使い、0.0001以上の改善が8周続けてなければ停止します。最大60周です。
SwiftF0の事前学習データとの重複は完全には確認できません。ここでの成績は、この実験条件での比較です。画面のCNNは代表seed 17、表は3 seedの集計です。