O nas

Jesteśmy zespołem badawczym założonym w 1997 roku

PELCRA (Polish and English Language Corpora for Research and Applications) jest zespołem badawczym działającym w Instytucie Anglistyki Uniwersytetu Łódzkiego, założonym w 1997 roku. Nasze główne zainteresowania i działania obejmują językoznawstwo korpusowe i komputerowe, przetwarzanie języka naturalnego, pozyskiwanie oraz ekstrakcję informacji. Od 1997 roku nasze zasoby korpusowe i narzędzia dla danych korpusowych w języku angielskim i polskim są z powodzeniem stosowane w badaniach akademickich i technologicznych, a także w dziedzinach takich jak nauczanie języka, translatoryka, leksykografia i przetwarzanie języka. Listę korpusów, wyszukiwarek, narzędzi do przetwarzania języka i słowników elektronicznych opracowanych przez różnych członków naszej grupy można znaleźć tutaj.

Dowiedź się więcej
Cecha produktu 1
Korpus SpokesBiz składa się z 8 odrębnych podkorpusów, w skład których wchodzą: zbiór podcastów internetowych, wywiady biograficzne, prezentacje studentów na tematy akademickie i popularne, dyskusje tematyczne, spontaniczne rozmowy, i wiele więcej.
Cecha produktu 2
W powstaniu korpusu wzięło udział łącznie 590 mówców z różnych regionów Polski, o różnym wykształceniu (od wykształcenia podstawowego do stopnia doktora) i w różnym wieku. Wszystkie te czynniki wpływają na duże zróżnicowanie i reprezentatywność korpusu.
Cecha produktu 3
Dane korpusowe zostały automatycznie przetranskrybowane i wyrównane czasowo, a następnie ręcznie skorygowane. Transkrypcje są opatrzone interpunkcją przy użyciu wytycznych sporządzonych do przestankowania w korpusie DiaBiz.
Cecha produktu 1
Dane korpusowe zebrano w okresie od maja 2021 r. do kwietnia 2022 r. Interakcje telefoniczne między 5 agentami z doświadczeniem zawodowym w call center a 191 uczestnikami wcielającymi się w rolę klientów zostały nagrane za pośrednictwem platformy Genesys PureCloud.
Cecha produktu 2
DiaBiz może służyć jako zbiór danych szkoleniowych i ewaluacyjnych dla różnorodnych zastosowań, takich jak rozpoznawanie mowy i formatowanie transkrypcji, diaryzacja mówców, analiza konwersacyjna, modelowanie systemów dialogowych i wiele innych.
Cecha produktu 3
Transkrypcje są również opatrzone interpunkcją w celu zwiększenia ich przejrzystości. Zostały one najpierw poddane automatycznej interpunkcji, a następnie ręcznie poprawione, w związku z czym konieczne było opracowanie wytycznych dla interpunkcji, które uwzględniają cechy języka mówionego.

Partnerzy

Współpracujemy z najlepszymi

Zapraszamy do współpracy zarówno instytucje akademickie, jak i partnerów biznesowych. Serdecznie zachęcamy Państwa do kontaktu.

Zobacz wszystkich