Войти

Лингвистический процессор от «ОПК» научит компьютер анализировать тексты любой сложности

2520
1
+4
Логотип Объединенной приборостроительной корпорации
Логотип Объединенной приборостроительной корпорации.
Источник изображения: Объединенная приборостроительная корпорация

«Объединенная приборостроительная корпорация», входящая в Госкорпорацию Ростех, и российская компания «АвикомпСервисез» анонсировали выход на рынок совместного проекта - лингвистического процессора Ontosminer, который является основой для построения сложных систем текстового мониторинга и интеллектуального анализа данных. Программный продукт, базирующийся на последних разработках в области машинного обучения и технологиях BigData, позволяет компьютеру «чувствовать» морфологию, синтаксис языка, «понимать» семантику отдельных слов и текста в целом. В качестве эксперимента с сегодняшнего дня тестовая версия программы открыта для вузов и научно-исследовательских учреждений в бесплатном режиме.


«Это еще одна ступень на пути к созданию искусственного интеллекта. Мы научили машину понимать и анализировать письменную речь, извлекать из нее необходимые факты и смыслы, - говорит директор департамента инновационного развития «Объединенной приборостроительной корпорации» Александр Калинин. - Сегодня общеизвестно: 85 процентов информации содержится не в базах данных, а в текстах, и задача дня – научиться эту информацию находить. Над созданием подобных систем активно работают крупнейшие зарубежные компании, такие, как Google и Facebook. В России это, без преувеличения, первая собственная разработка такого уровня».

Сфера возможного применения лингвистического процессора очень широка. Среди задач, которые он способен решать – поиск необходимых сведений, мониторинг СМИ, анализ больших массивов данных, систематизация документооборота и информации (статистической, научно-технической, правовой, медицинской и т.д.).


В отличие от традиционных поисковых систем в качестве запроса здесь выступает не отдельное слово, а целый документ (отрывок текста, статья и т.д.), после загрузки которого система выдает все, что есть на заданную тему в информационном пространстве. В ходе выполнения задачи Ontosminer ориентирован именно на смысл текстов, а не механически ищет ключевые слова, что значительно повышает результативность и качество отработки запроса. По итогам анализа всего массива информации комплекс способен автоматически сформулировать краткое резюме, где изложена суть события, ситуации или проблемы.


Лингвистические процессоры являются центральным компонентом и наиболее охраняемым know-how систем интеллектуального анализа. Ранее их создание требовало усилий больших команд лингвистов, которые вручную составляли правила разбора документов, создавали словари и сложные схемы семантических связей между словами, затем это все переводилось на язык машин. Как отмечают разработчики, Ontosminer выводит возможности текстового анализа на новый уровень. Система построена на принципах машинного обучения, когда помощь лингвистов больше не требуется - компьютер, обрабатывая большое количество текстов, «учит» себя сам понимать их смысл. В настоящий момент в «голове» у лингвистического процессора - десятки миллионов документов. В перспективе этот показатель будет увеличен до нескольких сотен миллионов, что сделает его возможности еще более впечатляющими.


Одним из участников проекта выступает Высшая школа экономики. Ученые вуза – математики и лингвисты – принимали непосредственное участие в создании нового программного продукта.


«Когда мы говорим о возможностях искусственного интеллекта, то подразумеваем, что компьютер учится сам генерировать программы обработки «больших данных» в соответствии с задачей, которую формулирует человек, – рассказывает проректор ВШЭ Андрей Жулин. – Например, мы даем задание машине обработать миллионы страниц текста, проанализировать их и запомнить все семантические связи между словами, а затем просим выделить какие-то факты, давая ей примеры необходимых результатов, и дальше она выполняет работу самостоятельно. Если раньше традиционное программирование таких аналитических функций требовало серьезных человеческих, временных и, соответственно, финансовых ресурсов, то теперь мы получаем возможность извлекать информацию дешево, быстро и качественно. Учитывая, что многие современные бизнесы построены на использовании информации, различных данных, в том числе больших данных, перспективы этого продукта - огромные. Кроме того, технология позволяет решать и большой спектр исследовательских, образовательных задач. С его помощью можно быстро и качественно обрабатывать текстовую информацию, получать объективные результаты и измерения в области лингвистики, истории, права, других наук. Например, проводить лексический анализ литературных произведений, анализировать большие массивы нормативно-правовых актов итд».


«В этой технологии заложены большие возможности, – говорит Александр Калинин. – Семантический анализ текста – это то, например, на чем можно выстраивать интеграцию разноформатных информационных баз данных. Проблема очень актуальна, но необходимого прогресса в этой области пока не достиг никто. Кроме того, в этой технологии скрыто будущее робототехники, ведь она может быть применена для анализа изображений и звука, т.е. машина получит возможность «видеть» и «слышать». Причем создать соответствующие продукты будет проще, чем разработать лингвистический процессор, поскольку язык обладает огромной вариативностью: одно и то же слово может менять значение в зависимости от контекста, в речи могут встречаться ошибки. Машина уже сейчас способна понимать все эти нюансы».


С сегодняшнего дня в качестве эксперимента «ОПК» и «АвикомпСервисез» открыли доступ к тестовой версии Ontosminer для российских студентов, научных сотрудников и исследовательских коллективов. Разработчики системы уверены, что такой шаг позволит сделать дальнейший прорыв в области отечественных платформ анализа BigData (больших данных).

Права на данный материал принадлежат
Материал передан ВПК.name правообладателем
  • В новости упоминаются
Похожие новости
23.08.2017
Глава "Воентелекома": технология блокчейн может появиться в армии России
06.10.2015
"День инноваций" Минобороны РФ впервые пройдет в международном формате
29.05.2015
«ОПК» объединила более 30 российских вузов и компаний для работ над искусственным интеллектом
13.05.2015
«ОПК» создает роботизированную платформу, которая заменит человека в боевых действиях и спасательных операциях
24.03.2015
Технологии будущего и вооружения России
17.12.2014
Андрей Ризнык: "Без российских комплексов связи и управления "Мистраль" - это плохо плавающая коробка"
1 комментарий
№1
16.04.2015 08:22
Цитата, q
Царь – мужчина + женщина = царевна
Принцесса – женщина + мужчина = Принц
Принцесса – тетя + дядя = Принц
Париж – Франция + Германия = Берлин
Вильнюс – Литва + Эстония = Таллин
танк – гусеницы + колеса = тягач, бронеавтомобиль

БМП – гусеницы + колеса = БТР, БРДМ
Лермонтов – поэма + симфония = Рахманинов
Моцарт – симфония + холст = Врубель
Дасаев – футбол + хоккей = Третьяк

Сталин – СССР + Германия = Гитлер
Сталин – война + космос = Хрущев
Виски – Шотландия + Франция = Шампанское
Виски – Шотландия + Япония = Сакэ
лето – телега + сани = зима
трезвого – уме + языке = нетрезвого

Да, с таким ИИ никакой пятой колонны не нужно :(
0
Сообщить
Хотите оставить комментарий? Зарегистрируйтесь и/или Войдите и общайтесь!
ПОДПИСКА НА НОВОСТИ
Ежедневная рассылка новостей ВПК на электронный почтовый ящик
  • Разделы новостей
  • Обсуждаемое
    Обновить
  • 02.05 20:46
  • 6
Индийская дальнобойная противолодочная ракета SMART
  • 02.05 20:43
  • 119
Израиль усиливает меры безопасности в связи с опасениями ударов со стороны Ирана
  • 02.05 20:33
  • 27
Командующий ВВС США в Европе о роли авиации в боевых действиях на Украине
  • 02.05 20:26
  • 51
Россия использует пропаганду как средство войны против Запада - британский генерал
  • 02.05 20:11
  • 30
Глава Военного комитета НАТО заявил о необходимости проведения дополнительной мобилизации на Украине
  • 02.05 19:58
  • 4
Ракеты ATACMS: характеристики и дальность, чем сбивают
  • 02.05 19:51
  • 1252
Корпорация "Иркут" до конца 2018 года поставит ВКС РФ более 30 истребителей Су-30СМ
  • 02.05 19:50
  • 27
Bombardier CSeries стал Airbus A220
  • 02.05 17:29
  • 1136
Без кнута и пряника. Россия лишила Америку привычных рычагов влияния
  • 02.05 13:15
  • 1
Шойгу представили новые средства борьбы с беспилотниками ВСУ
  • 02.05 12:43
  • 2
Запад разочаровал Грузию. Она решила постепенно сближаться с Россией
  • 02.05 11:59
  • 6
МС-21 готовится к первому полету
  • 02.05 09:47
  • 15
Гендиректор ОАК Слюсарь: испытания SSJ New с российскими двигателями начнутся осенью - Интервью ТАСС
  • 02.05 09:19
  • 8
В США показали испытания беспилотной подлодки на видео
  • 01.05 17:28
  • 93
В США оценили российские Су-34 с УМПК