Źródła
Opanuj rzemiosło
Poradniki krok po kroku o promptach, stylach i tym, jak wycisnąć maksimum z generowania obrazów AI.
Czytaj poradnikiPogadaj o tym z
Wybierz towarzysza i poznaj jego zdanie na temat tej historii

Elias tłumaczy badania stojące za nagłówkami prostym językiem.
Poradniki krok po kroku o promptach, stylach i tym, jak wycisnąć maksimum z generowania obrazów AI.
Czytaj poradnikiWybierz towarzysza i poznaj jego zdanie na temat tej historii
Technology Innovation Institute (TII) opublikował Falcon ASR — rodzinę modeli automatycznego rozpoznawania mowy (ASR) o otwartych wagach — oprogramowania przekształcającego mówiony dźwięk w tekst — obsługujących zarówno język arabski, jak i angielski, z dedykowanym wariantem dostrojonym pod dialekt emiracki.
TII, instytut badawczy z Abu Dhabi stojący za oryginalną serią dużych modeli językowych Falcon, rozszerza swoją strategię otwartych modeli na obszar mowy. Falcon ASR to nie pojedynczy model, lecz rodzina — oddzielne punkty kontrolne dla języka arabskiego, emirackiego arabskiego i angielskiego — z których każdy jest trenowany w celu minimalizacji wskaźnika błędów słów w swoich odpowiednich domenach językowych.
ASR to technologia bazowa, która zamienia wypowiedziane zdanie w ciąg słów możliwy do przetworzenia przez system downstream. Dla twórców sztuki AI praktycznym zastosowaniem jest promptowanie głosowe: wypowiedz opis, transkrybuj go dokładnie, a następnie podaj bezpośrednio do generatora obrazów. Jakość tej transkrypcji bezpośrednio wpływa na jakość promptu — niższy WER oznacza mniej zniekształconych słów kluczowych i mniej ręcznych poprawek.

Wyniki benchmarków Falcon ASR porównujące wskaźniki błędów słów dla języka arabskiego i angielskiego z konkurencyjnymi modelami.
Obraz: Hugging Face Blog
Arabski jest szczególnie trudnym celem dla rozpoznawania mowy. Pisany standard (Modern Standard Arabic) znacznie odbiega od mówionych dialektów, a większość komercyjnych systemów ASR jest trenowana głównie na danych angielskich, pozostawiając język arabski — a zwłaszcza regionalne dialekty — niedostatecznie obsłużonym. Emiracki arabski, z jego fonetyką Zatoki Perskiej i przełączaniem kodów z angielskim, jeszcze bardziej potęguje to wyzwanie.
Zgodnie z wpisem na blogu Hugging Face, model Falcon ASR specyficzny dla dialektu emirackiego celuje dokładnie w tę lukę, raportując konkurencyjne wskaźniki błędów znaków na zestawach testowych dialektu emirackiego, gdzie modele arabskie ogólnego przeznaczenia mają trudności. Wskaźnik błędów znaków (CER) to bardziej szczegółowa wersja WER, która liczy błędy poszczególnych znaków zamiast pomyłek całych słów — bardziej informatywna dla języków morfologicznie bogatych, jak arabski, gdzie pojedyncze słowo może nieść znaczenie, które angielski rozkłada na kilka wyrazów.

Wskaźniki błędów słów i znaków dla modelu dialektu emirackiego Falcon ASR na zestawach testowych specyficznych dla dialektu.
Obraz: Hugging Face Blog
Publikacja otwartych wag to szczegół, który ma największe znaczenie dla praktycznego zastosowania. W przeciwieństwie do API ASR działających wyłącznie w chmurze — które pobierają opłaty za minutę audio i mogą ograniczać żądania przy dużym wolumenie — otwarte wagi pozwalają twórcom uruchamiać wnioskowanie lokalnie, dostrajać model na słownictwie specyficznym dla domeny (np. słowniku stylów artystycznych lub nazw postaci) i integrować model z niestandardowymi potokami bez kosztów za wywołanie.
Dla twórców eksperymentujących już z lokalnym wnioskowaniem, ta publikacja dołącza do innych niedawnych wydań otwartych wag przesuwających możliwości AI z chmury na lokalne urządzenia — trend widoczny również w wydaniach skupionych na urządzeniach brzegowych, takich jak otwarte modele d1 od Liquid AI.
Bezpośrednim kreatywnym zastosowaniem jest promptowanie głosowe: opisz obraz na głos, pozwól Falcon ASR dokładnie go transkrybować po arabsku lub angielsku, a następnie przekaż wynik bezpośrednio do generatora. Twórcy pracujący dwujęzycznie lub obsługujący arabskojęzyczną publiczność mają teraz lokalnie uruchamialną warstwę transkrypcji, która nie wymaga przesyłania audio przez zewnętrzne API. Ci, którzy budują postacie towarzyszące AI z interfejsami głosowymi — gdzie dokładne rozpoznawanie dialektu kształtuje całą interakcję — mają równie bezpośrednie zastosowanie.

Porównania wskaźników błędów słów i znaków w arabskich zestawach testowych dla Falcon ASR.
Obraz: Hugging Face Blog
Warto zwrócić uwagę na możliwości dostrajania. Ponieważ wagi są otwarte, twórca budujący niszowe narzędzie do promptowania głosowego dla, powiedzmy, koncepcyjnej sztuki architektonicznej, mógłby dostroić Falcon ASR na małym zbiorze danych ze słownictwem domenowym i uzyskać znacząco lepszą dokładność transkrypcji dla tego konkretnego przypadku użycia — czego żadne komercyjne API nie oferuje w porównywalnym punkcie cenowym, czyli zerowym.
TII nie opublikowało jeszcze szczegółowej karty modelu określającej wymagania obliczeniowe dla wnioskowania, więc dokładne minimalne wymagania sprzętowe do lokalnego uruchamiania Falcon ASR pozostają do potwierdzenia przez społeczność. To otwarte pytanie, które warto obserwować, gdy pierwsi użytkownicy zaczną dzielić się benchmarkami. Twórcy zainteresowani budowaniem przepływów pracy zintegrowanych z głosem mogą zapoznać się z przewodnikami Charmloop jako praktycznym punktem wyjścia do łączenia narzędzi AI w potoki generowania.