Новости

Нейросеть распознала джазовых пианистов по «почерку». Точность достигла 94 процентов

Британские исследователи научили алгоритмы машинного обучения распознавать джазовых пианистов по их уникальному стилю игры. Наилучший результат показала сверточная нейросеть. Она определяла исполнителя ранее не встречавшейся записи с точностью более 94 процента. Кроме того, исследователи разработали модель, которая отдельно анализирует мелодию, гармонию, ритм и динамику произведения, что дает возможность оценить вклад этих компонентов в индивидуальный стиль музыкантов. Статья опубликована в журнале Nature Machine Intelligence. Исследователи сделали веб-приложение, в котором можно послушать характерные особенности игры каждого из 20 пианистов.

У каждого художника, писателя или композитора есть набор приемов, по которым его работу можно узнать. В живописи, например, это выбор сюжета, цветовая палитра и манера наложения мазков, а в литературе — привычные автору синтаксические конструкции, излюбленные слова и повествовательные приемы. В музыкальной сфере в роли «почерка» выступают гармонические последовательности, ритмические структуры и мелодические обороты. Вместе такие приметы образуют отпечаток, по которому специалисты могут определить автора или исполнителя произведения. Вот только вручную такие исследования идут медленно, а часть особых примет — например, микроскопические отклонения в ритме — и вовсе могут ускользать от человека.

Исследователи под руководством Питера Харрисона (Peter Harrison) из Кембриджского университета решили применить методы машинного обучения для обнаружения творческих отпечатков в джазе. В качестве исходных данных они использовали набор из 84 часов записей выступлений 20 исполнителей, включая Билла Эванса, Оскара Питерсона, Телониуса Монка и Кита Джарретта. В набор данных входили как сольные записи, так и выступления в составе трио. Исходные аудиофайлы в наборе данных конвертированы в формат MIDI — по сути, в нотную запись, где для каждой ноты сохраняется информация о высоте, громкости, моменте начала и окончания. Такой формат сохраняет мелодические, гармонические, ритмические и динамические особенности исполнения, но при этом убирает из обучающей выборки неважные данные, которые могут повлиять на результат — вроде условий звукозаписи или звучания рояля конкретной модели.

Для извлечения информации о творческом «почерке» пианистов исследователи применили два подхода. В первом для поиска характерных мелодических фрагментов и аккордов использовались классические алгоритмы машинного обучения — случайный лес, метод опорных векторов и логистическая регрессия. Из каждой записи выделяли короткие мелодические обороты и созвучия, а потом сравнивали, кто из пианистов пользуется ими чаще. Общие для всех музыкантов обороты не учитывались. Второй подход основан на сверточных нейронных сетях. Модели обучали на 30-секундных фрагментах, представленных в виде двумерного аналога перфорированного рулона для механического пианино. На нем по одной оси откладывалось время, а по другой — высота ноты. Чтобы избежать переобучения, авторы меняли высоту нот, время их начала, длительность, громкость и положение 30-секундных фрагментов внутри записи. Вычисления выполнялись на одной видеокарте NVIDIA A100.

Из классических методов лучше всего показала себя логистическая регрессия — с ее помощью удалось определить исполнителя в 77 процентах случаев. Хотя итоговая точность сравнительно низкая, метод позволил увидеть, какие именно приемы используют конкретные музыканты. Например, в игре Билла Эванса алгоритм выделил нисходящие арпеджио септаккордов, которые этот музыкант использовал чаще других — в записях такая последовательность встречается 128 раз, тогда как у других пианистов существенно реже. У Оскара Питерсона модель отметила прием опевания целевых нот, при котором музыкант подходит к нужной ноте через соседние с ней более высокие и низкие звуки. Оба наблюдения совпадают с тем, что пишут о стиле этих пианистов эксперты в области исследования музыки.

Среди нейросетевых моделей лучшей оказалась сверточная нейросеть ResNet с 50 слоями. Для каждого 30-секундного фрагмента она оценивала вероятность того, что его сыграл каждый из 20 пианистов, после чего результаты одной записи усреднялись. Такая модель правильно угадывала исполнителя в ранее не встречавшихся ей записях в 94,4 процента случаев. Для отдельных фрагментов точность составляла 80,5 процента. Однако оказалось, что работа такой нейросети плохо интерпретируется — сложно понять, какие именно приемы в игре пианиста становятся решающими при принятии решения о его личности. Поэтому исследователи разработали более интепретируемую архитектуру. Они выделили из исходных данных четыре представления, отвечающих за мелодию, гармонию, ритм и динамику исполнения. Каждое из них обрабатывала отдельная подсеть, после чего полученные признаки объединялись.

Лучшая версия такой модели достигла точности 91,3 процента. Отключая по очереди подсети и наблюдая за падением точности, исследователи оценили вклад разных составляющих исполнения. Выяснилось, что только по одной гармонии — сочетанию одновременно звучащих нот — удается распознать пианиста в 74 процентах случаев. Наибольшую дополнительную информацию дает ритм, а наименьшую — динамика. В будущем разработчики алгоритма планируют расширить набор анализируемых инструментов и применить подход к изучению творчества других исполнителей.

Нейросети можно использовать для того, воссоздать звук по беззвучному видео игры на фортепиано. Американские разработчики представили такой алгоритм в 2020 году.

Источник

Нажмите, чтобы оценить статью
[Итого: 0 Среднее значение: 0]

Похожие статьи

Добавить комментарий

Ваш адрес email не будет опубликован.

Кнопка «Наверх»