Інстытут беларускае мовы запусціў незалежны «Корпус беларускіх тэкстаў», які збірае лексіку, якая не трапляе ў афіцыйныя базы праз цэнзуру

Праект створаны для фіксацыі і вывучэння сучаснай мовы, у тым ліку літаратуры і медыя, якія ствараюцца за мяжой і ва ўмовах цэнзуры не ўключаюцца ў дзяржаўныя рэестры, піша «Наша Ніва».

Sviatlana Liasovič
Святлана Лясовіч, старшыня Інстытута беларускае мовы і распрацоўніца праекта «Корпус беларускіх тэкстаў». Фота: фэйсбук Святланы Лясовіч

Інстытут беларускае мовы (ІБМ) прэзентаваў анлайн-платформу «Корпус беларускіх тэкстаў», якая рэалізуецца пад кіраўніцтвам старшыні арганізацыі Святланы Лясовіч — кандыдаткі філалагічных навук, якая да 2023 года загадвала кафедрай славянскай філалогіі Полацкага дзяржаўнага ўніверсітэта, але была звольненая па палітычных матывах.

На гэты момант для даследчыкаў, выкладчыкаў і рэдактараў адкрыты доступ да двух субкорпусаў — «Рэгіяналізм» і «Культура». Таксама ў распрацоўцы знаходзіцца вусны корпус дыялагічных тэкстаў, які фарміруецца на аснове беларускамоўных падкастаў.

Skrynšot
Прыклад пошуку спалучэнняў слоў у пэўнай форме па субкорпусе «Культура». Скрыншот сайта

Стварэнне незалежнай базы даных прадыктавана тым, што многія сучасныя тэксты, створаныя па-за межамі краіны, не трапляюць у афіцыйны Беларускі N-корпус. Новы інструмент дазваляе лінгвістам рабіць сінхронныя зрэзы мовы: адсочваць змены ў значэннях слоў, асаблівасці ўжывання і з’яўленне новай лексікі ў розных сферах жыцця.

Найбуйнейшы з даступных субкорпусаў — «Культура» — змяшчае ўжо больш за мільён слоў. Ён складаецца прыкладна на 80% з пісьмовых і на 20% з вусных тэкстаў розных стыляў і жанраў. Матэрыял быў сабраны на працягу дзесяці месяцаў у межах еўрапейскай праграмы EU4Belarus — SALT II.

Sviatlana Liasovič
Святлана Лясовіч распавядае для студэнтаў беларускай філалогіі польскіх універсітэтаў пра стварэнне субкорпусу «Культура». Фота: фэйсбук Святланы Лясовіч

Як адзначае Святлана Лясовіч, асноўная мэта гэтага субкорпуса — паказаць функцыянаванне мовы ў першай чвэрці XXI стагоддзя і стварыць грунт для будучых актуальных слоўнікаў, у тым ліку тэрміналагічных.

Тэхнічную падтрымку праекта на валанцёрскай аснове ажыццяўляў Іван Бахцін. Ён стварыў рэдактар для анатавання тэкстаў (стварэння іх кароткага апісання), які базуецца на існуючай «Граматычнай базе беларускай мовы». Тэксты ў корпусе ўжо часткова анатаваныя, аднак стваральнікі падкрэсліваюць, што разметка яшчэ патрабуе далейшай вычыткі і ўдасканалення.

Скарыстацца лінгвістычнай базай можна праз сайт праекта. Для зручнасці працы са спецыфічным пошукавым інтэрфейсам даследчыкі падрыхтавалі падрабязную інструкцыю, даступную ў раздзеле Corpus Info. Інстытут беларускае мовы працягвае напаўняць базу і запрашае далучацца да працы валанцёраў, звязацца можна праз пошту instytutbelmovy@gmail.com.