AI & ML interests

Speech recognition, ASR evaluation, Polish language, benchmark datasets

Recent Activity

Organization Card

Warsztaty z ewaluacji systemów rozpoznawania mowy — UAM WMI

W skrócie. Domenowe zbiory testowe do ewaluacji polskiego ASR, budowane przez zespoły studenckie Wydziału Matematyki i Informatyki UAM. Pełne zbiory pozostają held-out (prywatne, dostęp na prośbę), żeby nie trafiły do danych treningowych modeli jako gotowy zbiór testowy; publicznie udostępniamy zbiory na wolnych licencjach, próbki ilustrujące każdą domenę oraz wyniki zespołów. Kontakt: @michaljunczyk, micjun@amu.edu.pl.

In brief. Domain-specific Polish ASR evaluation sets built by student teams at the Faculty of Mathematics and Computer Science, Adam Mickiewicz University in Poznań. Full sets are kept held-out (private, access on request) so they do not enter model training data as a ready-made test set; openly licensed sets, a public sample per domain and the teams' results are published here. Contact: @michaljunczyk, micjun@amu.edu.pl.

Organizacja gromadzi zbiory testowe do ewaluacji systemów rozpoznawania mowy (ASR) dla języka polskiego, budowane przez zespoły studenckie w ramach przedmiotu „Warsztaty z ewaluacji systemów rozpoznawania mowy" na Wydziale Matematyki i Informatyki Uniwersytetu im. Adama Mickiewicza w Poznaniu. Prowadzący przedmiot i opiekun organizacji: Michał Junczyk (@michaljunczyk).

Zbiory mają charakter domenowy (m.in. medycyna, parlament, sport, kulinaria, wystąpienia publiczne) i uzupełniają publiczne benchmarki polskiego ASR o dane spoza ich zakresu tematycznego.

Zawartość i zasady dostępu

Trzy poziomy dostępu:

  1. Zbiory zespołów — held-out (prywatne). Pełne zbiory dostarczone przez zespoły. Nie trafiają do danych treningowych modeli jako gotowe pary nagranie–transkrypcja, dzięki czemu zachowują wartość jako niezależny test (granice tej ochrony — poniżej); materiały o licencjach ograniczających redystrybucję (np. CC BY-NC-ND) są wykorzystywane wyłącznie badawczo. Dostęp na prośbę.
  2. Zbiory zespołów — otwarte (publiczne). Zbiory, które zespoły opublikowały otwarcie na wolnych licencjach (CC BY 4.0). Kopie w organizacji są publiczne.
  3. Próbki i wyniki (publiczne). Dla każdego zbioru held-out osobne repozytorium …-probka: 10 segmentów ilustrujących domenę (audio tam, gdzie pozwala licencja źródła; w przeciwnym razie transkrypcja z odnośnikiem i znacznikiem czasu) oraz tabele wyników zespołu na pełnym zbiorze. Dzięki temu publikowane metryki dają się interpretować bez dostępu do pełnych danych. Próbki nie służą do ewaluacji — raz opublikowane, z definicji przestają być held-out.

Układ i nazewnictwo:

Element Konwencja Przykład
Kolekcja — zbiory zespołów (poziomy 1–2) {rok} — zbiory zespołów, jedna na edycję 2026 — zbiory zespołów
Kolekcja — próbki i wyniki (poziom 3) {rok} — próbki i wyniki, jedna na edycję 2026 — próbki i wyniki
Repozytorium próbki {rok}-{tryb}-g{NN}-{domena}-probka 2026-zwesui-g01-tedx-probka
Repozytorium zbioru {rok}-{tryb}-g{NN}-{domena} 2026-zwesui-g01-tedx
Tryb studiów w nazwie dwesui — stacjonarny, zwesui — niestacjonarny 2026-dwesui-g01-neurologia
Numer zespołu g{NN} — dwucyfrowy, w obrębie roku i trybu g01, g02, …

Każda kopia w organizacji ma kartę z atrybucją do zespołu, licencją i odnośnikiem do oryginału. Kolejne edycje przedmiotu dodają nowe domeny — celem jest wieloletni, filtrowalny korpus ewaluacyjny.

Plan na koniec 2026 r.: włączenie zbiorów organizacji do benchmarku BIGOS V3 oraz Polish ASR Leaderboard V2 (zob. „Materiały powiązane").

Granice ochrony held-out. Status prywatny chroni zbiór przed publicznym przeciekiem i przed celowym dostrajaniem modeli. Nie chroni przed dostawcą, którego system oceniano przez publiczne API: dane testowe trafiają wówczas na jego serwery, a to, czy nie zostaną użyte w treningu, zależy od jego polityki, nie od nas (Sculley i in., Position: AI Competitions Provide the Gold Standard for Empirical Rigor in GenAI Evaluation, ICML 2025, §5.1). Zbiory edycji 2026 przeszły przez API komercyjnych systemów ASR, które zespoły porównywały — jest to znane ograniczenie. Pełną ochronę daje wyłącznie ewaluacja offline: model uruchomiony na własnej infrastrukturze, bez wystawiania zbioru testowego do zasobów z dostępem do internetu.

Uwaga o właściwym użyciu. Te zbiory służą do badania systemów rozpoznawania mowy i nie są miarą zdolności studentów, którzy je zbudowali. Powstały w ramach zajęć, w warunkach kursu i pod presją terminów — wyniki systemów ASR na danym zbiorze nie mówią nic o kompetencjach jego autorów. Prosimy nie używać ich do oceny osób ani do porównywania zespołów.

Kontakt

Dostęp do zbiorów held-out, współpraca badawcza, pytania: @michaljunczyk na Hugging Face lub e-mail: micjun@amu.edu.pl.

Metodologia

W ciągu semestru każdy zespół przechodzi pełny cykl ewaluacji ASR:

  • Zbiór testowy. Własna domena; nagrania rzeczywiste i syntetyczne (co najmniej 50 + 50 na osobę), co najmniej dwóch mówców; każda transkrypcja referencyjna ma pole verified_by, a próg zaliczenia wymaga, aby co najmniej 15% wierszy każdej osoby sprawdził inny członek zespołu (weryfikacja krzyżowa); protokół normalizacji tekstu z testami jednostkowymi, stosowany jednakowo do referencji i hipotez.
  • Ewaluacja. Co najmniej trzy systemy ASR z co najmniej dwóch rodzin architektur; WER, CER, RTF oraz metryka semantyczna (BERTScore z modelem polskim, LLM-as-judge lub metryka oparta na encjach); przedziały ufności bootstrap, dodatkowo testy istotności.
  • Analiza. Co najmniej dwa scenariusze (np. według mówcy, płci, subdomeny), tabela Quality Gap względem progu wdrażalności, rachunek TCO/ROI i rekomendacja wdrożeniowa.
  • Recenzja. Plan korpusu i dokument projektowy przechodzą recenzję krzyżową innego zespołu oraz akceptację prowadzącego; wyniki są bronione publicznie na Demo Day.

Ramy metodologiczne

Literatura obowiązkowa przedmiotu:

Materiały branżowe analizowane na zajęciach i w pracy własnej zespołów:

Literatura uzupełniająca (dopisana po edycji 2026):

Edycje

2026 — 9 zespołów, 9 domen

Tryb stacjonarny: neurologia, kulinarna, dokumentacja medyczna (dwa zespoły). Tryb niestacjonarny: wystąpienia TEDx, sport, Sejm RP, botanika, rozmowy o IT/AI. Kolekcja: 2026 — zbiory zespołów.

Zbiory opublikowane przez zespoły na własnych kontach (oryginały):

Zbiory sport i Sejm RP są dostępne wyłącznie w organizacji (held-out).

W czterech zbiorach (neurologia, kulinarna, sport, Sejm RP) część syntetyczna nie jest opublikowana: zespoły wygenerowały ją silnikiem, którego licencja nie pozwala na redystrybucję nagrań, i wykorzystały wyłącznie we własnej ewaluacji — wyniki na niej znajdują się w raportach zespołów. Opublikowane zbiory tych zespołów zawierają wyłącznie mowę naturalną.

Dla każdego z sześciu zbiorów held-out (dokumentacja medyczna, TEDx, sport, Sejm RP, botanika, rozmowy o IT/AI) opublikowana jest próbka …-probka z 10 segmentami i wynikami zespołu — kolekcja: 2026 — próbki i wyniki.

2025 — 3 zespoły

Dwa zbiory włączone do organizacji (kolekcja: 2025 — zbiory zespołów):

Sylabusy

Materiały powiązane

models 0

None public yet