Apollo Restore заполнит пробелы в древнегреческих папирусах
Исследователи представили новую генеративную модель Apollo Restore, разработанную для работы с текстами на древнегреческом языке. Она эффективно заполняет пробелы в папирусах, даже когда отсутствуют данные о количестве утраченных символов. О своей работе ученые сообщают в препринте статьи, опубликованной на arXiv.org. Об этом сообщает N + 1.
По всему миру в библиотеках и музеях хранится множество эпиграфических памятников и папирусов, относящихся к эпохе Античности. В Средиземноморье и на Ближнем Востоке исследователи обнаружили более миллиона папирусов, тексты которых в основном написаны на древнегреческом языке в период с 300 года до нашей эры до 700 года нашей эры. Большинство из них сохранились в виде фрагментов с различными пробелами.
Заполнение пробелов в папирусах — это сложная задача, требующая значительного времени от специалистов. Поэтому неудивительно, что за полтора века научных исследований лингвисты опубликовали лишь около восьми процентов сохранившихся папирусов, оставляя около миллиона документов непрочитанными.
В последние годы на помощь ученым пришли большие языковые модели. Хоуп Макговерн и её коллеги из компании Mistral AI, Австрийской академии наук и Северо-Восточного университета в Бостоне представили новый инструмент — модель Apollo Restore, созданную для работы с древнегреческими текстами, включая папирусы. В отличие от эпиграфических памятников, где можно предсказать количество пропущенных символов по длине пробела, такой подход не работает для папирусов.
Модель Apollo Restore обучена на текстах, состоящих из примерно 600 миллионов слов на греческом языке, начиная с эпохи Античности и заканчивая 1900 годом нашей эры. Более двух третей материалов относятся к периоду до 1453 года, до падения Константинополя. В процессе обучения использовались как документы и литературные тексты, так и эпиграфические памятники, представленные примерно 156 тысячами надписей. Исследователи исходили из принципа, что модель должна заполнять пробелы без указания количества пропущенных символов, опираясь на текст до и после — принцип Fill-in-the-Middle.
Тестирование модели показало её заметное преимущество по сравнению с другими разработками, включая модели Ithaca и Cullhed. Apollo Restore достигает точности 80,6 процента при заполнении пробелов в документах, 54,6 процента — в литературных текстах и 61 процента — в эпиграфических памятниках, если длина пробела составляет от одного до десяти символов. Это в 1,4–2,6 раза лучше, чем у других моделей. При пробелах длиной до 20 символов преимущество Apollo Restore возрастает до 1,6–3,5 раза.
Для проверки модели исследователи привлекли 20 специалистов в области филологии, эпиграфики и папирологии, которые оценивали результаты, полученные с помощью различных языковых моделей, а также исправления, предложенные Apollo Restore для ранее опубликованных текстов. В ходе тестов эксперты в одном из шести случаев предпочли вариант прочтения от языковой модели, а не общепринятый опубликованный вариант.
В прошлом году специалисты из Google DeepMind представили другую генеративную модель — Aeneas, предназначенную для работы с латинскими эпиграфическими памятниками. Она должна стать полезным инструментом для лингвистов и историков, работающих с древними надписями.


