-
uam-wmi-asr-eval-labs/2026-dwesui-g03-medyczna-probka
Viewer • Updated • 10 • 28 -
uam-wmi-asr-eval-labs/2026-zwesui-g01-tedx-probka
Viewer • Updated • 10 • 26 -
uam-wmi-asr-eval-labs/2026-zwesui-g02-sport-probka
Viewer • Updated • 10 • 28 -
uam-wmi-asr-eval-labs/2026-zwesui-g03-sejm-probka
Viewer • Updated • 10 • 24
AI & ML interests
Speech recognition, ASR evaluation, Polish language, benchmark datasets
Recent Activity
Warsztaty z ewaluacji systemów rozpoznawania mowy — UAM WMI
W skrócie. Domenowe zbiory testowe do ewaluacji polskiego ASR, budowane przez zespoły studenckie Wydziału Matematyki i Informatyki UAM. Pełne zbiory pozostają held-out (prywatne, dostęp na prośbę), żeby nie trafiły do danych treningowych modeli jako gotowy zbiór testowy; publicznie udostępniamy zbiory na wolnych licencjach, próbki ilustrujące każdą domenę oraz wyniki zespołów. Kontakt: @michaljunczyk, micjun@amu.edu.pl.
In brief. Domain-specific Polish ASR evaluation sets built by student teams at the Faculty of Mathematics and Computer Science, Adam Mickiewicz University in Poznań. Full sets are kept held-out (private, access on request) so they do not enter model training data as a ready-made test set; openly licensed sets, a public sample per domain and the teams' results are published here. Contact: @michaljunczyk, micjun@amu.edu.pl.
Organizacja gromadzi zbiory testowe do ewaluacji systemów rozpoznawania mowy (ASR) dla języka polskiego, budowane przez zespoły studenckie w ramach przedmiotu „Warsztaty z ewaluacji systemów rozpoznawania mowy" na Wydziale Matematyki i Informatyki Uniwersytetu im. Adama Mickiewicza w Poznaniu. Prowadzący przedmiot i opiekun organizacji: Michał Junczyk (@michaljunczyk).
Zbiory mają charakter domenowy (m.in. medycyna, parlament, sport, kulinaria, wystąpienia publiczne) i uzupełniają publiczne benchmarki polskiego ASR o dane spoza ich zakresu tematycznego.
Zawartość i zasady dostępu
Trzy poziomy dostępu:
- Zbiory zespołów — held-out (prywatne). Pełne zbiory dostarczone przez zespoły. Nie trafiają do danych treningowych modeli jako gotowe pary nagranie–transkrypcja, dzięki czemu zachowują wartość jako niezależny test (granice tej ochrony — poniżej); materiały o licencjach ograniczających redystrybucję (np. CC BY-NC-ND) są wykorzystywane wyłącznie badawczo. Dostęp na prośbę.
- Zbiory zespołów — otwarte (publiczne). Zbiory, które zespoły opublikowały otwarcie na wolnych licencjach (CC BY 4.0). Kopie w organizacji są publiczne.
- Próbki i wyniki (publiczne). Dla każdego zbioru held-out osobne repozytorium
…-probka: 10 segmentów ilustrujących domenę (audio tam, gdzie pozwala licencja źródła; w przeciwnym razie transkrypcja z odnośnikiem i znacznikiem czasu) oraz tabele wyników zespołu na pełnym zbiorze. Dzięki temu publikowane metryki dają się interpretować bez dostępu do pełnych danych. Próbki nie służą do ewaluacji — raz opublikowane, z definicji przestają być held-out.
Układ i nazewnictwo:
| Element | Konwencja | Przykład |
|---|---|---|
| Kolekcja — zbiory zespołów (poziomy 1–2) | {rok} — zbiory zespołów, jedna na edycję |
2026 — zbiory zespołów |
| Kolekcja — próbki i wyniki (poziom 3) | {rok} — próbki i wyniki, jedna na edycję |
2026 — próbki i wyniki |
| Repozytorium próbki | {rok}-{tryb}-g{NN}-{domena}-probka |
2026-zwesui-g01-tedx-probka |
| Repozytorium zbioru | {rok}-{tryb}-g{NN}-{domena} |
2026-zwesui-g01-tedx |
| Tryb studiów w nazwie | dwesui — stacjonarny, zwesui — niestacjonarny |
2026-dwesui-g01-neurologia |
| Numer zespołu | g{NN} — dwucyfrowy, w obrębie roku i trybu |
g01, g02, … |
Każda kopia w organizacji ma kartę z atrybucją do zespołu, licencją i odnośnikiem do oryginału. Kolejne edycje przedmiotu dodają nowe domeny — celem jest wieloletni, filtrowalny korpus ewaluacyjny.
Plan na koniec 2026 r.: włączenie zbiorów organizacji do benchmarku BIGOS V3 oraz Polish ASR Leaderboard V2 (zob. „Materiały powiązane").
Granice ochrony held-out. Status prywatny chroni zbiór przed publicznym przeciekiem i przed celowym dostrajaniem modeli. Nie chroni przed dostawcą, którego system oceniano przez publiczne API: dane testowe trafiają wówczas na jego serwery, a to, czy nie zostaną użyte w treningu, zależy od jego polityki, nie od nas (Sculley i in., Position: AI Competitions Provide the Gold Standard for Empirical Rigor in GenAI Evaluation, ICML 2025, §5.1). Zbiory edycji 2026 przeszły przez API komercyjnych systemów ASR, które zespoły porównywały — jest to znane ograniczenie. Pełną ochronę daje wyłącznie ewaluacja offline: model uruchomiony na własnej infrastrukturze, bez wystawiania zbioru testowego do zasobów z dostępem do internetu.
Uwaga o właściwym użyciu. Te zbiory służą do badania systemów rozpoznawania mowy i nie są miarą zdolności studentów, którzy je zbudowali. Powstały w ramach zajęć, w warunkach kursu i pod presją terminów — wyniki systemów ASR na danym zbiorze nie mówią nic o kompetencjach jego autorów. Prosimy nie używać ich do oceny osób ani do porównywania zespołów.
Kontakt
Dostęp do zbiorów held-out, współpraca badawcza, pytania: @michaljunczyk na Hugging Face lub e-mail: micjun@amu.edu.pl.
Metodologia
W ciągu semestru każdy zespół przechodzi pełny cykl ewaluacji ASR:
- Zbiór testowy. Własna domena; nagrania rzeczywiste i syntetyczne (co najmniej 50 + 50
na osobę), co najmniej dwóch mówców; każda transkrypcja referencyjna ma pole
verified_by, a próg zaliczenia wymaga, aby co najmniej 15% wierszy każdej osoby sprawdził inny członek zespołu (weryfikacja krzyżowa); protokół normalizacji tekstu z testami jednostkowymi, stosowany jednakowo do referencji i hipotez. - Ewaluacja. Co najmniej trzy systemy ASR z co najmniej dwóch rodzin architektur; WER, CER, RTF oraz metryka semantyczna (BERTScore z modelem polskim, LLM-as-judge lub metryka oparta na encjach); przedziały ufności bootstrap, dodatkowo testy istotności.
- Analiza. Co najmniej dwa scenariusze (np. według mówcy, płci, subdomeny), tabela Quality Gap względem progu wdrażalności, rachunek TCO/ROI i rekomendacja wdrożeniowa.
- Recenzja. Plan korpusu i dokument projektowy przechodzą recenzję krzyżową innego zespołu oraz akceptację prowadzącego; wyniki są bronione publicznie na Demo Day.
Ramy metodologiczne
Literatura obowiązkowa przedmiotu:
- Aksënova i in., How Might We Create Better Benchmarks for Speech Recognition? (ACL 2021) — z czego składa się dobry benchmark ASR.
- Szymański i in., WER we are and WER we think we are (Findings of EMNLP 2020) — rozjazd między benchmarkiem a mową realną, polski punkt widzenia.
- Liao i in., Are We Learning Yet? (NeurIPS 2021) — trafność wewnętrzna i zewnętrzna ewaluacji.
- Junczyk, BIGOS V2 Benchmark for Polish ASR (NeurIPS 2024, Datasets & Benchmarks) — taksonomia korpusów i protokół pomiaru, punkt odniesienia dla projektów.
- Zhang i in., BERTScore (ICLR 2020) — metryki semantyczne zamiast samego WER.
Materiały branżowe analizowane na zajęciach i w pracy własnej zespołów:
- Seria AssemblyAI (2025) o krytyce WER i doborze metryk: Word Error Rate is Broken, How to Evaluate Speech Recognition Models, New WER Benchmark, Top Open Source STT Options, Speechmatics Alternatives — stąd wymóg „co najmniej jedna metryka poza WER" (Semantic WER, Missed Entity Rate, LLM-as-judge).
- Speechmatics, How To Choose The Best Speech-to-Text Engine — kryteria wyboru dostawcy w ujęciu wdrożeniowym; podstawa analizy TCO/ROI.
- Koo i in., KEBAP: Korean Error Explainable Benchmark Dataset for ASR and Post-processing (EMNLP 2023) — taksonomia błędów ASR, wykorzystana w analizie błędów.
- Hugging Face Audio Course, rozdz. 1, 2 i 5 — pipeline audio i metryki w praktyce.
- Smith, The Scientist and Engineer's Guide to Digital Signal Processing — wybrane rozdziały jako podstawa zajęć o przetwarzaniu sygnału audio.
Literatura uzupełniająca (dopisana po edycji 2026):
- Gevers i in., In Benchmarks We Trust … Or Not? (EMNLP 2025) — cztery typy trafności benchmarków, listy kontrolne dla tworzących i używających benchmarki, postulat małych zbiorów testowych dla realnych zastosowań — konstrukcja zbiorów w tej organizacji odpowiada temu postulatowi.
- Sculley i in., Position: AI Competitions Provide the Gold Standard for Empirical Rigor in GenAI Evaluation (ICML 2025, Position Paper Track) — przeciek zbiorów testowych, granice held-out przy ewaluacji przez API, ewaluacja offline.
Edycje
2026 — 9 zespołów, 9 domen
Tryb stacjonarny: neurologia, kulinarna, dokumentacja medyczna (dwa zespoły). Tryb niestacjonarny: wystąpienia TEDx, sport, Sejm RP, botanika, rozmowy o IT/AI. Kolekcja: 2026 — zbiory zespołów.
Zbiory opublikowane przez zespoły na własnych kontach (oryginały):
- neurologia — otwarty, CC BY 4.0
- kulinarna — otwarty, CC BY 4.0
- dokumentacja medyczna — CC BY 4.0, dostęp po prośbie
- dokumentacja medyczna II — otwarty, CC BY 4.0
- wystąpienia TEDx — otwarty, CC BY-NC-ND 4.0
- botanika — dostęp po zalogowaniu
- rozmowy o IT/AI — CC BY-NC 4.0, dostęp po prośbie
Zbiory sport i Sejm RP są dostępne wyłącznie w organizacji (held-out).
W czterech zbiorach (neurologia, kulinarna, sport, Sejm RP) część syntetyczna nie jest opublikowana: zespoły wygenerowały ją silnikiem, którego licencja nie pozwala na redystrybucję nagrań, i wykorzystały wyłącznie we własnej ewaluacji — wyniki na niej znajdują się w raportach zespołów. Opublikowane zbiory tych zespołów zawierają wyłącznie mowę naturalną.
Dla każdego z sześciu zbiorów held-out (dokumentacja medyczna, TEDx, sport, Sejm RP, botanika,
rozmowy o IT/AI) opublikowana jest próbka …-probka z 10 segmentami i wynikami zespołu —
kolekcja: 2026 — próbki i wyniki.
2025 — 3 zespoły
Dwa zbiory włączone do organizacji (kolekcja: 2025 — zbiory zespołów):
2025-zwesui-g02-medyczna— 200 zdań z terminologią medyczną wygenerowanych przez cztery modele językowe i zsyntetyzowanych głosami ElevenLabs; oryginał:yanvoi/med_male_female_r2.2025-zwesui-g03-debata-prezydencka— debata prezydencka TVP z 12 maja 2025 (13 kandydatów, 195 wypowiedzi), mowa spontaniczna; kopia w formacie BIGOS:amu-cai/polish_presidential_debate-2025.
Sylabusy
Materiały powiązane
- Polish ASR Leaderboard — 25 systemów ASR na ponad 4000 nagraniach.
- BIGOS V2 — benchmark 24 polskich korpusów mowy (NeurIPS 2024, Datasets & Benchmarks Track).
- michaljunczyk.pl — strona prowadzącego.
-
uam-wmi-asr-eval-labs/2026-dwesui-g03-medyczna-probka
Viewer • Updated • 10 • 28 -
uam-wmi-asr-eval-labs/2026-zwesui-g01-tedx-probka
Viewer • Updated • 10 • 26 -
uam-wmi-asr-eval-labs/2026-zwesui-g02-sport-probka
Viewer • Updated • 10 • 28 -
uam-wmi-asr-eval-labs/2026-zwesui-g03-sejm-probka
Viewer • Updated • 10 • 24