Коррекция словарной базы модуля морфологического анализа «РДМА_ИПИИ»
Состав работы
|
|
|
|
Необходимые программы
Работа представляет собой zip архив с файлами (распаковать онлайн), которые открываются в программах:
- Microsoft Word
Описание
Обработку естественно-языковых текстов (ЕЯТ) относят к области искусственного интеллекта. Технологии обработки ЕЯТ нашли своё применение в системах машинного перевода, поисковых системах в сети Интернет, роботах-автоответчиках [1] и т.д.
Одним из первых этапов обработки ЕЯТ является морфологический анализ слов, содержащихся в тексте. В настоящее время средства морфологического анализа русскоязычных текстов являются достаточно развитыми – результаты их оценки представлены в [2], [3].
К настоящему времени ИПИИ разработаны модуль декларативного морфологического анализа слов русского языка «РДМА_ИПИИ» [4] и модуль морфологического анализа без словаря [5]. РДМА_ИПИИ в явном виде хранит парадигмы слов -около 3 млн словоформ, синтезированных по словарю А. А. Зализняка [6].
Оценка применения упомянутых модулей в рамках форума «Оценка методов автоматического анализа текста: морфологические парсеры русского языка» показала, что словарная база РДМА_ИПИИ содержит ряд ошибок, часть из которых связана с неверным заданием морфологической информации (МИ) словоформ – набора грамматических характеристик, присущих словоформе. Источником этих ошибок могли служить поэтапное расширение набора грамматических характеристик, используемых в модуле, а также многочисленные процедуры пополнения и корректировки , ной базы, в ходе совершенствования её наполнения.
Наличие ошибок в словарной базе РДМА_ИПИИ влечет за собой некорректные таты морфологического анализа. Так как словарная база РДМА_ИПИИ явля-источником для наполнения базы данных модуля морфологического анализа без ооваря, ошибки в ней впоследствии распространятся и на результаты бессловарного логического анализа.
В связи с этим актуальной является разработка методик проверки словарных наличие некорректных МИ и методики корректировки словарной'базы.
Объект исследования – словарная база модуля морфологического анализа. Предмет исследования – корректность морфологической информации.
Цель работы – коррекция словарной базы модуля морфологического анализа РДМА_ИПИИ. Для достижения цели поставлены и решены следующие задачи:
- генерация правил выявления некорректных значений МИ на основе теоретических данных и классификация видов ошибок;
- разработка рекомендаций по коррекции словарной базы.
Правила выявления некорректных значений МИ
Для анализа словарной базы на наличие некорректных значений МИ выберем из неё все значения МИ без повторений. В результате количество различных значений МИ составило 1359.
На основе теоретических данных [7], [8] был сформирован набор из 96 правил. Эти правила можно представить в виде двух таблиц. Табл. 1 отражает перечень обязательных и недопустимых грамматических категорий для частей речи. В этой таблице грамматическая категория, обязательная для некоторой части речи, отмечена цифрой «1» на пересечении соответствующего столбца и строки, а недопустимая грамматическая категория для некоторой части речи – цифрой «О».
Одним из первых этапов обработки ЕЯТ является морфологический анализ слов, содержащихся в тексте. В настоящее время средства морфологического анализа русскоязычных текстов являются достаточно развитыми – результаты их оценки представлены в [2], [3].
К настоящему времени ИПИИ разработаны модуль декларативного морфологического анализа слов русского языка «РДМА_ИПИИ» [4] и модуль морфологического анализа без словаря [5]. РДМА_ИПИИ в явном виде хранит парадигмы слов -около 3 млн словоформ, синтезированных по словарю А. А. Зализняка [6].
Оценка применения упомянутых модулей в рамках форума «Оценка методов автоматического анализа текста: морфологические парсеры русского языка» показала, что словарная база РДМА_ИПИИ содержит ряд ошибок, часть из которых связана с неверным заданием морфологической информации (МИ) словоформ – набора грамматических характеристик, присущих словоформе. Источником этих ошибок могли служить поэтапное расширение набора грамматических характеристик, используемых в модуле, а также многочисленные процедуры пополнения и корректировки , ной базы, в ходе совершенствования её наполнения.
Наличие ошибок в словарной базе РДМА_ИПИИ влечет за собой некорректные таты морфологического анализа. Так как словарная база РДМА_ИПИИ явля-источником для наполнения базы данных модуля морфологического анализа без ооваря, ошибки в ней впоследствии распространятся и на результаты бессловарного логического анализа.
В связи с этим актуальной является разработка методик проверки словарных наличие некорректных МИ и методики корректировки словарной'базы.
Объект исследования – словарная база модуля морфологического анализа. Предмет исследования – корректность морфологической информации.
Цель работы – коррекция словарной базы модуля морфологического анализа РДМА_ИПИИ. Для достижения цели поставлены и решены следующие задачи:
- генерация правил выявления некорректных значений МИ на основе теоретических данных и классификация видов ошибок;
- разработка рекомендаций по коррекции словарной базы.
Правила выявления некорректных значений МИ
Для анализа словарной базы на наличие некорректных значений МИ выберем из неё все значения МИ без повторений. В результате количество различных значений МИ составило 1359.
На основе теоретических данных [7], [8] был сформирован набор из 96 правил. Эти правила можно представить в виде двух таблиц. Табл. 1 отражает перечень обязательных и недопустимых грамматических категорий для частей речи. В этой таблице грамматическая категория, обязательная для некоторой части речи, отмечена цифрой «1» на пересечении соответствующего столбца и строки, а недопустимая грамматическая категория для некоторой части речи – цифрой «О».
Другие работы
Тесты по лекциям
max23
: 10 марта 2016
Лекция 1. Предмет и значение логики. Логика и язык.
Лекция 2. Основные логические законы.
Лекция 3. Логическое понятие. Виды понятий, отношения между понятиями.
Лекция 4. Логическое определение.
Лекция 5. Деление и классификация понятий.
Лекция 6. Ограничение и обобщение понятий.
Лекция 7. Суждение.
Лекция 8. Объединенная классификация суждений.
Лекция 9. Дедуктивные умозаключения.
Лекция 10. Индуктивные умозаключения.
Лекция 11. Аналогия и гипотеза.
Лекция 12. Логические основы теории аргумента
100 руб.
Радиопередающие устройства систем радиосвязи и радиодоступа. Курсовая работа. Вар. №2
TAUQOT
: 10 июня 2016
Содержание.
Введение…………………………………………………………………………..2
1. Задание на курсовой проект…………………………………………..………4
2. Составление структурной схемы передатчика………………………………4
3. Расчет генератора в режиме усиления модулированных колебаний …...…6
3.1. Расчет лампового усилителя амплитудно-модулированных колебаний……………………………………………………………...……7
3.2. Расчет максимального режима генератора…………………………..7
4. Расчет УМК на полевых транзисторах с изолированным затвором……….8
4.1. Расчет третьего пр
500 руб.
Молот пневматический ковочный модель МВ-412 общий вид
coolns
: 31 декабря 2022
Молот пневматический ковочный модель МВ-412
НАЗНАЧЕНИЕ И ОБЛАСТЬ ПРИМЕНЕНИЯ МОЛОТА
Молот пневматический ковочный модель МВ-412 предназначен для разнообразных работ, выполняемых методом свободной ковки на плоских и фасонных бойках, как-то: протяжка, осадка, прошивка отверстий, горячая рубка материала, кузнечная сварка, гибка, кручение и штамповка в подкладных открытых штампах.
Молот пневматический ковочный не рекомендуется применять для штамповки в закрытых штампах, так как жесткие и эксцентрич
500 руб.
Доходная база бюджета Тюмени и Тюменской области
evelin
: 25 октября 2013
Содержание
Введение
Бюджет города Тюмени на 2009 год и на плановый период 2010 и 2011 годов
Формирование и использование бюджета Тюменской области
Сравнение проблем, связанных с формированием доходных частей бюджетов различных уровней
Заключение
Список литературы
Введение
Глубинные преобразования в политической, экономической и социальной сферах пореформенной России поставили новые проблемы перед органами власти.
Старая экономическая система с привычными ценностями и подходами к решению проблем
5 руб.