Multimodální modely (WP9)
Pracovní balíček WP9 se zaměřuje na výzkum a vývoj pokročilých multimodálních modelů s důrazem na vícejazyčnost. Výzkum pokrývá zpracování textu, řeči a vizuálního vstupu. Klíčovou součástí práce je kompletní datový řetězec zahrnující získávání, čištění, strukturování a anotování velkých datových sad a tvorby metadat pro všechny podporované modality a ostatní WP.
Hlavním cílem WP9 je vytvoření robustních základních modelů, které budou sloužit jako společná technologická základna pro ostatní pracovní balíčky projektu, a které najdou přímé uplatnění v praxi díky úzké spolupráci s průmyslovými partnery na jedné straně a institucemi státní správy na straně druhé.
Jaký problém WP řeší a proč je to důležité?
01
Generické globální AI modely nepodporují na dostatečné úrovni český jazyk
02
Stávající AI modely selhávají v úzce specializovaných (doménových) oblastech s odbornou terminologií
03
Běžné modely nelze bezpečně nasadit na privátní a citlivá data bez rizika jejich úniku
04
Stávající systémy nedokáží plynule kombinovat a současně vyhodnocovat text, řeč a vizuální vstup
05
Kvalitní, vyčištěná a strukturovaná trénovací data s odpovídajícími metadaty jsou kriticky nedostatková
06
Veřejná správa i průmysl naráží na bariéry při nasazování pokročilých multimodálních AI řešení do reálného provozu
Příklady využití / aplikační oblasti a přínosy
Mluvený jazyk a zpracování audia
- Pokročilé zpracování audia a dialogů
- Analýza stavu operátora a detekce hlasových podvrhů
Veřejná správa
- Asistovaná tvorba srozumitelných právních textů
- Datové inženýrství pro automatizaci správy dat
Počítačové vidění
- Vysoká spolehlivost v nestandardních podmínkách
- Detailní klasifikace podle jazykového zadání
Kognitivní výzkum
- Sledování lidského vnímání pomocí Eye-tracking
- Vyšší věrohodnost a přirozenost AI
Firemní procesy
- Automatizace rutinní administrativy pomocí AI
- Provozní úspora a ochrana soukromí
Klíčové osoby

Zapojené instituce










Použité technologie a postupy
- Zpracování a syntéza řeči
- Sada modelů pro zpracování řeči orientované na mluvčího
- Robustní vizuálně-jazykový model (typ R, software, #83)
- Kompaktní systém pro hlasovou biometrii
- Služba pro pokročilé vyhledávání datových sad v DCAT-AP kompatibilním datovém katalogu
- Hierarchický visual-language model pro fine-grained třídy (typ R, software, #84)
Dosažené a plánované výsledky
2027
Robustní vizuálně-jazykový model
R – software
Kompaktní systém pro hlasovou biometrii
R – software
Dialogový systém s rozpoznáváním emocí
R – software
Hierarchický visual-language model pro fine-grained třídy
R – software
Pipeline pro automatizaci obchodních dokumentů
R – software
Asistent pro generování sémantických metadat pro datové zdroje veřejné správy – METAR
R – software
2028
Sada modelů pro zpracování řeči orientované na mluvčího (SPEAKER)
R – software
Psaní orientované na klienta – PONK v. 1.0+
Gfunk – funkční vzorek
Služba pro vyhledávání datových zdrojů v datových katalozích – FINDIT
R – software
Vysoce kvalitní a efektivní TTS pro reálné aplikace
R – software
2029
Produkční služba pro extrakci entit a klasifikaci dokumentů
R – software
2031
Adaptivni, samoučící, dialogový systém s rozpoznáváním emocí
R – software
Adaptivni, samoučící, dialogový systém s rozpoznáváním emocí
R – software
Multimodální model využívající identitu zdroje
R – software
Psaní orientované na klienta – PONK v. 2.0+
R – software
Modul pro pokročilou fonetickou normalizaci textu
R – software
Produkční služba pro argumentaci a compliance
R – software
Rozšíření open-source software Národního katalogu dat o integrované nástroje METAR a FINDIT
R – software