nietypowe urządzenia elektroniczne

Tutaj mozesz poruszać tematy ogólne powiązane z elektroniką, np. dyskusje na temat podzespołów, układów, zasad ich działania. Czyli można pisać o wszystkim czego nie da się przyporządkować do innych działów.
ODPOWIEDZ
kynioses
-
Posty: 1
Rejestracja: 26 sty 2005, 12:36

nietypowe urządzenia elektroniczne

Post autor: kynioses » 26 sty 2005, 12:42

Będe bardzo wdzięczny za wszelakiego rodzaju informację-namiary na urządzenie-urządzenia pozwalające na przetważanie słów mówionych na pliki w formacie Word lub Office.
Pozdrawiam wszystkich!

ZenObi
-
Posty: 7
Rejestracja: 20 sty 2005, 19:47
Lokalizacja: Lublin

Post autor: ZenObi » 28 sty 2005, 2:26

Podejrzewam, że NASA albo US Army mają takie urządzenia, ale są co najmniej tajne ;) Sprawa opiera się nie na budowie urządzeń, ale na algorytmach rozpoznawania mowy. Te, póki co, są w powijakach, i nieprędko "zejdą pod strzechy". Da się znaleźć programy, które w ograniczonym stopniu robią to, o co Ci chodzi, lecz "ograniczonym" jest tu słowem najważniejszym. Pomyśl też o tych wszystkich maszynistkach, stenotypistkach, sekretarkach itp., których istnienie nie miałoby racji bytu, gdyby programy lub urządzenia tego typu były ogólnie dostępne:)

Awatar użytkownika
gogo4
-
Posty: 99
Rejestracja: 12 kwie 2003, 9:06
Lokalizacja: Okolice Bielska Białej
Kontakt:

Post autor: gogo4 » 13 lut 2005, 19:27

Szczerze mówiąc nie wiem, czy w ogóle istnieją takie urządzenia. Wyróżnienie w wymówionym wyrazie dźwięków odpowiadających za daną literę wydaje mi się być niemożliwe na czasy obecne. Z tego co wiem nie istnieją urządzenia, które wymawiały by zapisany tekst (w formacie tekstowym) w sposób poprawny stylistycznie. Liczba 966 w wymowie ludzkiej brzmi: dziewięćset sześćdziesiąt sześć, a wymawiana przez np komputer brzmi dziewięć sześć sześć. Istnieją urządzenie reagujące na dźwięk, ale one porównują odbierane dźwięki z tymi zapisanymi w pamięci (w postaci cyfrowej) a nie rozumieją tych dżwięków. Jeżeli dane urządzenie reaguje na wymówienie słowa otwórz, to najprawdopodobniej nie zareaguje na słowo owtwieraj. Można oczywiście nagrać w pamięci urządzenia każdy wyraz osobno i przyporządkować mu odpowiedni ciąg liter, który ma być zapisany w dokumencie tekstowym. Procesor (bez procesora nie stworzymy czegoś takiego) porównując odebrane dźwięki z dźwiękami nagranymi w pamięci będzie dobierał odpowiedni ciąg liter i zapisywał go w dokumencie tekstowym. Rozwiązanie to ma dwie zasadnicze wady: Potrzeba dużo pamięci na zapisanie dźwięków i przypisanie im ciągów liter. Druga wada to fakt, że urządzenie zapisze tylko te wyrazy, które są nagrane w jego pamięci. Można też literować każdy wyraz, a procesor będzie porównywał dźwięki każdej wymawianej litery z osobna i porównywał z dźwiękami zapisanymi w jego pamięci. Ten sposób na taką zaletę, że w pamięci musi być zapisane tylko tyle dźwięków ile jest liter w alfabecie i każdy wyraz zostanie zapisany. Ale czy konieczność literowania każdego wyrazu jest dobra. Założmy, że układ ten będzie tworzył protokoły z przesłuchań wtedy śędzia i przesłuchiwany musieliby literować każdy wypowiedziany wyrez i przesłuchanie przedłużyłoby się znacznie. Niemożliwe jest (moim zdaniem) jak narazie rozłożenie prawidłowo (po ludzku) wypowiadanych wyrazów na pojedyncze dźwięki odpowiadające każdej literze (lub każdemu znakowi) z osobna i na podstawie tych dźwięków zapisanie wypowiedzi w dokumencie tekstowym (zapisanie liter przypisanych do poszczególnych dźwięków, co w efekcie pozwoli zapisać cały wyraz). A to jest moim zdaniem jedyny sposób na elektroniczne zapisywanie normalnie wypowiadanych słów. Na koniec muszę stwierdzić, że temat zainteresował mnie jak żaden inny. Proszę innych o to aby podzielili się swoimi przemyśleniami i ewentualnymi doświadczeniami. Może stworzymy wspólnie coś takiego... bnyłoby bombowo!!!.

ZenObi
-
Posty: 7
Rejestracja: 20 sty 2005, 19:47
Lokalizacja: Lublin

Post autor: ZenObi » 19 lut 2005, 0:22

Kolega Gogo4 ma dużo racji, lecz chyba jezeli chodzi o literowanie, to lekko przesadza. Otóż nie jest największym problemem rozpoznanie ciągłych wyrazów - i to nie zapisanych w pamięci - a następnie rozłożenie ich na oddzielne litery. Problemem jest to, że każdy ma inną wysokość, inną intonację, inną barwę, sepleni, itd. Dlatego ciężko jest stworzyć algorytm uniwersalny. Są programy na PC, które starają się omijać problem "ucząc" się najpierw mowy użytkownika. Jeżeli chodzi o sterowanie głosem, wychodzi całkiem nieźle, ale funkcje zamiany na tekst są jeszcze bardzo prymitywne - coś jak pierwsze "podpowiadacze" wyrazów przy pisaniu SMSa :) .
Naszym problemem jest też język - nie słyszałem ani nie widziałem takiego "notatnika" po polsku. Angielski jest, ale moja wymowa daleka jest od oryginału :). Nawet jednak standard britisz inglisz nie jest odczytywany dokładnie.

Poza tym, problem kolegi Kyniosesa nie wymaga od algorytmów "rozumienia" mowy. Do zapisywania można by przyuczyć nawet psa - na "siad" zamiast siadać bierze kijek w zęby i rysuje na piachu literki słowa "siad", hehe.
Kolego Kynioses - w googlu troche rzeczy na ten temat jest po polsku, sporo po angielsku, są reklamy programów - proponuje sciągnąć wersje demo i zobaczyć czy odpowiada takie coś.

pajaczek
-
Posty: 20
Rejestracja: 23 lut 2005, 23:12

Post autor: pajaczek » 23 lut 2005, 23:41

Alez oczywiscie ze takie urzadzenia istnieja... nazywaja sie komputery (ot... odkrycie)... a dodatkowo do takiego super-unikatowego sprzetu trzeba jeszcze wsadzic rownie unikatowy soft, ktory to, po odpowiednio dlugiej konfiguracji (nauce rozpoznawania) bedzie potrafil rozpoznac mowe kilku osob, oraz kilka, kilkanascie, czy tez kilkatys slow (zaleznie jak bedziemy uparci podczas uczenia programu).

Sugeruje odpalic google i wpisac "rozpoznawanie mowy", ew mozna odpalic np. taki superportal* jak chip.pl i tam wpisac powyzsze haslo.


*) ironia zamierzona.

gego4, zen0bi:

Chcialbym zwrocic Wasza uwage na 2 istotne rzeczy:

1) Pytajacy nie stwierdzil jak liczny zasob slownictwa chce rozpoznawac (czy jak wlasciwie okreslil "przetwarzac"), czy ma byc rozroznienie jezykow, czy ma byc rozpoznawana mowa 1, 2, 5 czy 1000 osob, czy wreszcie ma to byc rozpoznawanie na bazie slownika wbudowanego, czy innej.

2) Nie ma na swiecie urzadzen, istot czy czegokolwiek innego ( i nie sadze** by gdzies we wszechswiecie kiedykolwiek byly teraz czy kiedykolwiek), ktore potrafily by rozpoznawac mowe, obraz czy cokolwiek innego "od urodzenia/powstania". Wy rowniez musieliscie sie tego nauczyc !!!


**) to czy mozna tak sadzic, czy miec pewnosc to juz rozwazanie filozoficzne. Rozwazanie nt. wszechwiedzy, czy istnienia np. inteligencji poza ziemia, ale to chyba nie ten portal.


A tak przy okazji, rozpoznawanie mowy, rozpoznawanie obrazow (chocby popularny pod strzechami OCR) to swietne pole do popisu dla SSN (Sztucznych Sieci Neuronowych), i nie mowcie ze to jest jakies super skomplikowne, algorytmy do projektowania i uczenia SSN zadan OCR sa przerabiane na laborkach z SSN.

Gość

Post autor: Gość » 24 lut 2005, 2:28

Witam wielce krytycznego kolegę Pajączka*.


Otóż, jeżeli równie wielce przenikliwy i znający się na wyszukiwarkach** kolega raczył NIE zauważyć, w swoim poprzednich postach napisałem o tym, że istnieje soft, który na zwykłym domowym komputerze potrafi w !!!"OGRANICZONYM"!!! stopniu dokonywać konwersji, czy jak kolega określił "rozpoznawać" (chociaż nie wiem, dlaczego mówimy o rozpoznawaniu, gdy chodzi tylko o zamianę) języka mówionego na pismo. Napisałem też autorowi tematu, żeby poszukał trochę w sieci.

Jeżeli chodzi o odpowiednią długość nauki przez odpowiednie programy, mam pytanie do kolegi: Czy spędziłby kolega dajmy na to 100 godzin, ucząc program swojej wymowy, tylko po to aby dyktować mu maile do znajomych? Albo 1000 godzin, aby móc dyktować artykuły do gazety? Albo 10000 godzin, aby móc dyktować wiersze???
A tak przy okazji - kilka, kilkanaście, czy nawet kilka tysięcy słów to obowiązuje przy, odpowiednio, 2, 3, 4 latach życia. Normalny człowiek zna, i umie się posłużyć, kilkudziesięcioma tysiącami słów. Człowiek inteligentny natomiast zna kilkaset tysięcy słów. Więc ile czasu muszę spędzić ucząc program, aby tłumaczył moją mowę, nawet gdy jestem smętnym imbecylem? I jeszcze jedno: słów - w znaczeniu pojęć, a nie prostej fleksji z przerzucaniem akcentu na kolejne sylaby, czego również trzeba program nauczyć.
Dlatego napisałem o US Army itd, i jeżeli kolega nie zauważył to użyłem emotikonu oznaczającego przymrużenie oka, czyli w formie żartu.


Może trochę na temat punktów:
Ad. 1)
Pytający NIE STWIERDZIŁ, jak liczny zasób słownictwa chce "rozpoznawać" - dokładnie dlatego założyłem, że chodzi mu o dość szerokie spektrum, a nie tylko proste "siad" i "do nogi":). O różnorodności języków również napisałem - co prawda tylko na przykładzie polskiego i angielskiego, ale myślałem, że to dość zrozumiałe.
"...na bazie słownika wbudowanego, czy innej..." - problem jest tego samego typu co powyżej - Kynioses NIE STWIERDZIŁ, jakiej metody oczekuje, więc piszemy o wszystkich. Problemy z metodą słownikową opisał kolega Gogo4 (a nie Gego4 - rozpoznawanie słów z liter to też problem widzę ;) ), i wyliczył wszystkie większe problemy występujące w tej metodzie.
Czytając artykuły z "superportalu" chip.pl, zaczynam się śmiać - przecież większość z nich potwierdza moje wcześniejsze tezy - dokładna konwersa mowy na pismo, lub rozpoznawanie słów jako rozkazów jest w powijakach! Coś się dzieje, nawet w dobrym kierunku, ale to stanowczo jeszcze nie to!
Końcowy wniosek z punktu pierwszego: Kynioses, określ swoje zapotrzebowania! Gogo4, walczmy dalej z ogólnym tematem :)


Ad. 2)
"kiedykolwiek byly teraz czy kiedykolwiek" ??? Nie do końca rozumiem :)
No dobrze, rozumiem, szybciej się myśli niż pisze (to znów problem konwersji tym razem myśli na tekst. To chyba jednak dość złożony problem:) ).
Poważnie rzecz ujmując, dam mały przykład do "cokolwiek innego": wzmacniacz operacyjny nie musiał się uczyć rozpoznawania poziomu napięcia na wejściach. Umiał to "od urodzenia/powstania". Zbyt słaby przykład? Elektron w paśmie walencyjnym nie musiał uczyć się odbierania energii i przechodzenia w pasmo przewodzenia (to tak dla Pana Wojtka, żeby nie wykasował naszej dyskusji jako nie dotyczącej szeroko pojętej elektroniki). Zbyt słabo? A wierzy kolega w Jehowę, Allacha, Demiurga, Buddę, własny umysł jako twórcę otaczającego świata? Jak tak, to chyba jest ktoś, kto wiedział wszystko zawsze? A jak nie, to w Wielkim Wybuchu nikt nie uczył czystej energii (bo dzisiejszych cząstek elementarnych, co kolega zapewne wie, jeszcze nie było) jak ma działać? Jak po pewnym czasie zmienić się w to, co widzimy dzisiaj? Jeżeli chodzi o związek tych przykładów z naszym problemem, to tylko kwestia parametrów: napięcia i prądu dla wzmacniacza operacyjnego, czy też powiązania między siłami (których części jeszcze nie znamy) dla Big Bangu, czy też parametrów mowy ludzkiej (której oprócz rozkładu częstotliwości, i amplitudy tak naprawdę niewiele znamy).
Kolega, widzę, ma pogląd na świat typu: wszystko jest "kart bląsz"***
i dopiero w trakcie istnienia nabiera właściwości. Nazwałbym taki pogląd ciekawostką przyrodniczą, ponieważ nawet wielcy filozofowie stwierdzili tak tylko i wyłącznie w przypadku człowieka, hehe. (j. polski, klasa IV szkoły średniej jakby co)



A tak przy okazji (nie wiedzieć czemu, znów naśladuję kolegę), OCR (znów za kolegą idąc: Optical Character Recognising) ma się do rozpoznawania mowy jak jazda rowerem do prowadzenia Jumbo Jet'a. Wielkie firmy telekomunikacyjne wydają majątek, aby ten problem rozwiązać. Wiąże się to z wszelkimi call-center, sterowaniem głosem przez szeroką rzeszę ludzi, infoliniami, i długo by jeszcze wymieniać. To naprawdę grube miliony dolarów!
Gdyby to było takie proste, zacytuję sam siebie:) : Pomyśl też o tych wszystkich maszynistkach, stenotypistkach, sekretarkach itp., których istnienie nie miałoby racji bytu, gdyby programy lub urządzenia tego typu były ogólnie dostępne:)
A jednak pracują :))

Dlatego na laboratoriach podają OCR, a nie mowę. Lecz jeżeli kolega na - powiedzmy - 12 laboratoriach w semestrze opracuje chociażby prosty notatnik dla jednej osoby, to pierwszy pochylę czoło...

Aha - SSN również są na początku swojej drogi.

*) albo P ą j a c z k a, albo P a j a c z k a, albo P ą j ą c z k a - tu moja NSN (Naturalna Sieć Neuronowa) po tym poście nie jest już pewna wyuczonych algorytmów konwersji:))

**) Złośliwość całkowicie przypadkowa, hehee

***) Konwersja dla odmiany fonetyczna :) Polski program powinien tak zapisać. Poza tym nie pamiętam jak to się pisze po francusku, a że jest 2 w nocy, nie chce mi się sprawdzać ;)

pajaczek
-
Posty: 20
Rejestracja: 23 lut 2005, 23:12

Post autor: pajaczek » 24 lut 2005, 17:18

Anonymous pisze:Witam wielce krytycznego kolegę Pajączka*.
Witam kolege anonima... dalej z tresci wynika ze to dzielo Zen0biego 8) (jak widac z moim rozpoznawaniem nie jest tak zle :P ).
Otóż, jeżeli równie wielce przenikliwy i znający się na wyszukiwarkach** kolega raczył NIE zauważyć, w swoim poprzednich postach napisałem o tym, że istnieje soft, który na zwykłym domowym komputerze potrafi w !!!"OGRANICZONYM"!!! stopniu dokonywać konwersji, czy jak kolega określił "rozpoznawać" (chociaż nie wiem, dlaczego mówimy o rozpoznawaniu, gdy chodzi tylko o zamianę) języka mówionego na pismo. Napisałem też autorowi tematu, żeby poszukał trochę w sieci.
Dales rowniez jasno znac ze uwazasz ze tylko "nasa i us army" moga taki sprzet posiadac, natiomiast takim sprzetem jest zwykly KOMPUTER. No... moze nie taki zwykly, gdyz mocno rozbudowany jesli ma interpretowac wiecej niz kilka slow w rozsadnym czasie.
Jeżeli chodzi o odpowiednią długość nauki przez odpowiednie programy, mam pytanie do kolegi: Czy spędziłby kolega dajmy na to 100 godzin, ucząc program swojej wymowy, tylko po to aby dyktować mu maile do znajomych? Albo 1000 godzin, aby móc dyktować artykuły do gazety? Albo 10000 godzin, aby móc dyktować wiersze???
A tak przy okazji - kilka, kilkanaście, czy nawet kilka tysięcy słów to obowiązuje przy, odpowiednio, 2, 3, 4 latach życia. Normalny człowiek zna, i umie się posłużyć, kilkudziesięcioma tysiącami słów. Człowiek inteligentny natomiast zna kilkaset tysięcy słów. Więc ile czasu muszę spędzić ucząc program, aby tłumaczył moją mowę, nawet gdy jestem smętnym imbecylem? I jeszcze jedno: słów - w znaczeniu pojęć, a nie prostej fleksji z przerzucaniem akcentu na kolejne sylaby, czego również trzeba program nauczyć.
Jesli chodzio dlugosc nauki: to wszystko zalezy od zastosowania, jesli np. mam nauczyc ten program rozpoznawania mowy u osoby uposledzonej ruchowo, ktora ma problemy z wklepaniem prostego tekstu z klawiatury, to pewnie warto poswiecic i 100 godzin. Jesli wykozystam program do podyktowania 1000 maili miesiecznie przez najblizsze 10 lat, to pewnie warto. I jeszcze jedno, jesli programy te oparte byly by np. o mechanizmy SSN to nie trzeba ich uczyc kazdego dyktowanego wyrazu, po pewnym czasie siec zacznie rozpoznawac i wyrazy ktorych sie nie uczyla.
Jesli idzie o zasob slownictwa. No coz... byc moze jest to niewlasciwa forma cytowania (gdyz nie moge sobie przypomniec ktorego z polskich profesorow cytuje), ale w ciagu ostatnich kilku dni byl w TV program, podczas ktorego mozna bylo uslyszec, ze przecietny polak posluguje sie na codzien ok 7-8 tys. slow, przecietny anglik podobnie (inne jezyki tez w tych granicach, nigdze chyba - z wymienionych - nie przekroczono 10 tys). Wspomniano rowniez ze w jezyku polskim rozroznia sie obecnie ok. pol miliona slow, niepodejrzewam wiec zeby czy to "smetny imbecyl" czy "czlowiek intligentny" (o ile nie zajmuje sie jezykoznawstwem) potrzebowal znajomosci kilkuset tys slow (kilkaset tys to bedzie powyzej 300 tys... ?? - znasz tyle - jako osoba inteligentna). Pozatym program mial miec (wg. zalozen) za zadanie rozpoznanie i transalcje dzwiek->tekst. Nie musi tych slow rozumiec i interpretowac ich znaczenia. A wiec nie jak wyzej wspomnialem nie trzeba uczyc wszystkich, niektorych nauczy sie przez analogie sama SSN.
Dlatego napisałem o US Army itd, i jeżeli kolega nie zauważył to użyłem emotikonu oznaczającego przymrużenie oka, czyli w formie żartu.
Zauwazylem... Odebralem to jako zart choc o troche innym znaczeniu.
Może trochę na temat punktów:
Ad. 1)
Pytający NIE STWIERDZIŁ, jak liczny zasób słownictwa chce "rozpoznawać" - dokładnie dlatego założyłem, że chodzi mu o dość szerokie spektrum, a nie tylko proste "siad" i "do nogi":). O różnorodności języków również napisałem - co prawda tylko na przykładzie polskiego i angielskiego, ale myślałem, że to dość zrozumiałe.
"...na bazie słownika wbudowanego, czy innej..." - problem jest tego samego typu co powyżej - Kynioses NIE STWIERDZIŁ, jakiej metody oczekuje, więc piszemy o wszystkich. Problemy z metodą słownikową opisał kolega Gogo4 (a nie Gego4 - rozpoznawanie słów z liter to też problem widzę ;) ), i wyliczył wszystkie większe problemy występujące w tej metodzie.
Czytając artykuły z "superportalu" chip.pl, zaczynam się śmiać - przecież większość z nich potwierdza moje wcześniejsze tezy - dokładna konwersa mowy na pismo, lub rozpoznawanie słów jako rozkazów jest w powijakach! Coś się dzieje, nawet w dobrym kierunku, ale to stanowczo jeszcze nie to!
Końcowy wniosek z punktu pierwszego: Kynioses, określ swoje zapotrzebowania! Gogo4, walczmy dalej z ogólnym tematem :)
Ok. To w punktach:
Bezpieczniej bylo by przyjac przecietne spektrum, nie szerokie, bo idac tym torem to najlepiej byloby stworzyc program, ktory niedosc ze potrafilby rozpoznawac mowe, konwertowac ja na postac tekstowa, ale rowniez rozpoznawac jezyk (najlepiej sposrod wszystkich istniejacych), oraz gware czy slang, w jekim jest to wypowiedziane i odrazu tlumaczyc na dowolny inny jezyk, sposrod wszystkich znanych. Ograniczmy sie do rozpoznawania rozpoznawania, bez interpretacji znaczeniowej, jednego jezyka z zasobem slownictwa nie przekraczajacym mowy potocznej. Takie programy istnieja, sa pisane wcale nie przez usarmy (choc pewnie i dla nich tez), ale rowniez i przez programistow zapalencow z wcale nie milionowym budzetem (niektorym do rozpoczecia prac i napisania przyzwoitej wersji wystarczyly bydzety w tys $).
Metoda, poniewaz Kynioses nie stwierdzil, to bezpieczniej byloby przyjac najprostsze czy najbardziej rozpowszechnione metody, o wszystkich to i tak sie nie zdola napisac :P

Kolega Gogo4 - oczywiscie, dobrze myslalem, zle napisalem, zwykla literowka, co przy ilosci literowek w notkach poprzedzajacych moja nie powinno nikogo ani dziwic ani bulwersowac, no moze poza Gogo4 ktorego za przekrecenie nicka - zupelnie przypadkowe - przepraszam. A juz napewno nie powinno byc przedmiotem ironii, bo to moze sie zemscic.

Dokladne... a coz znaczy dokladne. Nawet te wspomniane przez przedmowce maszynistki, stenotypostki czy sekretarki z wieloletnim doswiadczeniem tez nie sa nieomylne. Od tego sa programy slownikowe do zapuszczenia PO zapisaniu w posataci tekstu. A tak przy okazji jestes w stanie rozpoznac pisownie pojedynczego wyrazu bez interpretacji kontekstu ?? jesli tak to rozpoznaj mi prosze czy jest wypowiedziane "moze" czy "morze" (ot przyklad). - dybra koniec watku -

pajaczek
-
Posty: 20
Rejestracja: 23 lut 2005, 23:12

Post autor: pajaczek » 24 lut 2005, 17:19

Ad. 2)
"kiedykolwiek byly teraz czy kiedykolwiek" ??? Nie do końca rozumiem :)
No dobrze, rozumiem, szybciej się myśli niż pisze (to znów problem konwersji tym razem myśli na tekst. To chyba jednak dość złożony problem:) ).
Niezupelnie, tym razem jest to wynik edycji tekstu :P Ok. moj blad, ale powtarzam po raz ktorys, nie bawmy sie w szukanie literowek czy powtorzej wyrazow, innych bledow skladniowych, bo zaraz ten temat faktycznie bedzie sie nadawal do skasowania wylacznie (ze wzgledu na zlosliwosci).
Poważnie rzecz ujmując, dam mały przykład do "cokolwiek innego": wzmacniacz operacyjny nie musiał się uczyć rozpoznawania poziomu napięcia na wejściach. Umiał to "od urodzenia/powstania". Zbyt słaby przykład? Elektron w paśmie walencyjnym nie musiał uczyć się odbierania energii i przechodzenia w pasmo przewodzenia (to tak dla Pana Wojtka, żeby nie wykasował naszej dyskusji jako nie dotyczącej szeroko pojętej elektroniki).
Zbyt slabo. Wzmacniacz operacyjny zostal nauczony takiego zachowania podczas jego projektowania, programowanie nie zawsze polega na pisaniu programu, istnieje cos takiego jak programowanie sprzetowe (tu niestety nie podejme dyskusji, tematyka nie jest mi bliska). Niezbyt trafne przyklady :P
Zbyt słabo? A wierzy kolega w Jehowę, Allacha, Demiurga, Buddę, własny umysł jako twórcę otaczającego świata? Jak tak, to chyba jest ktoś, kto wiedział wszystko zawsze? A jak nie, to w Wielkim Wybuchu nikt nie uczył czystej energii (bo dzisiejszych cząstek elementarnych, co kolega zapewne wie, jeszcze nie było) jak ma działać? Jak po pewnym czasie zmienić się w to, co widzimy dzisiaj? Jeżeli chodzi o związek tych przykładów z naszym problemem, to tylko kwestia parametrów: napięcia i prądu dla wzmacniacza operacyjnego, czy też powiązania między siłami (których części jeszcze nie znamy) dla Big Bangu, czy też parametrów mowy ludzkiej (której oprócz rozkładu częstotliwości, i amplitudy tak naprawdę niewiele znamy).
Nie... nie wierze w zadna z powyzszych ... napisze istnien, zeby nikogo nie obrazic. A slyszel kolega o ewolucji ?? czastek nikt nie musial uczyc... albo sie przystosowaly, albo ginely - to odnosnie czasow pozniejszych niz Big Bang. Czysta energie, jak sugerowalem juz wczesniej, zostawmy w spokoju, gdyz jest to dysputa bardziej filozoficzna (czy w niektorych fragmentach religioznawcza) niz dotyczaca pierwotnego tematu.
Kolega, widzę, ma pogląd na świat typu: wszystko jest "kart bląsz"*** i dopiero w trakcie istnienia nabiera właściwości. Nazwałbym taki pogląd ciekawostką przyrodniczą, ponieważ nawet wielcy filozofowie stwierdzili tak tylko i wyłącznie w przypadku człowieka, hehe. (j. polski, klasa IV szkoły średniej jakby co)
Kolega ma bledny poglad na moj poglad. Reszty nie bede komentowal (patrz koncowe argumenty z poprzedniego akapitu.
A tak przy okazji (nie wiedzieć czemu, znów naśladuję kolegę), OCR (znów za kolegą idąc: Optical Character Recognising) ma się do rozpoznawania mowy jak jazda rowerem do prowadzenia Jumbo Jet'a. Wielkie firmy telekomunikacyjne wydają majątek, aby ten problem rozwiązać. Wiąże się to z wszelkimi call-center, sterowaniem głosem przez szeroką rzeszę ludzi, infoliniami, i długo by jeszcze wymieniać. To naprawdę grube miliony dolarów!
Gdyby to było takie proste, zacytuję sam siebie:) : Pomyśl też o tych wszystkich maszynistkach, stenotypistkach, sekretarkach itp., których istnienie nie miałoby racji bytu, gdyby programy lub urządzenia tego typu były ogólnie dostępne:)
A jednak pracują :))
Ale jednak cos wspolnego ma, pozatym nie przesadzalbym z ta przepascia - jest mniejsza niz pomiedzy jazda na rowerze i pilotowanim jumbo jeta - choc jak to mowia, i jednego i drugiego mozna nawet maple nauczyc.
Wielkie firmy wydaja majatek, ale rownolegle powstaja niekomercyjne srodowiska, przewaznie spelniajace swoje zadania w mniejszym stopniu, jednak... no coz.... z czegos trzeba tez zyc. Co do reszty, patrz poprzednie fragmenty notki.
Dlatego na laboratoriach podają OCR, a nie mowę. Lecz jeżeli kolega na - powiedzmy - 12 laboratoriach w semestrze opracuje chociażby prosty notatnik dla jednej osoby, to pierwszy pochylę czoło...

Aha - SSN również są na początku swojej drogi.
Na laboratoriach daja ocr poniewaz cale laboratoria trwaja, a przynajmniej w moim przypadku trwaly 15 tyg *2h kazde - zaliczenia - ew. ktore moga "poleciec", a do przerobienia jest cos wiecej niz tylko OCR, jest tez kompresja, sa rozne metody uczenia sieci, sieci samouczace sie, i wiele innych. W moim przypadku problematyka OCR zajmowala o ile pamietam 4h lekcyjne, a mimo to udalo nam sie zaprojektowac siec i nauczyc ja rozpoznawania prostych znakow. No coz, nie ukrywam ze nie bez pomocy, ze znaki byly proste, oraz ze wymaga to pewnej wczesniej nabytej wiedzy (a przynajmniej jest ona przydatna).
*) albo P ą j a c z k a, albo P a j a c z k a, albo P ą j ą c z k a - tu moja NSN (Naturalna Sieć Neuronowa) po tym poście nie jest już pewna wyuczonych algorytmów konwersji:))

**) Złośliwość całkowicie przypadkowa, hehee
No coz... ja to jednak traktuje jako zlosliwosc calkiem zamierzona.

Ps. ciekawe czy to forum przyjmie tak dluga notke... przy kolejnych odpowiedziach trza bedzie pomyslec na podzialem na drobniejsze (o ile bedzie ciag dalszy).

Pps. A jednak nie przyjelo :twisted:

Wojtek
Moderator
Posty: 2606
Rejestracja: 04 sie 2002, 19:00
Lokalizacja: --
Kontakt:

Post autor: Wojtek » 24 lut 2005, 19:05

Panowie bardzo proszę ograniczcie się do odpowiedzi na zadane pytanie, a ewentualną wymianę poglądów proponuję kontunuować np. przez email gdyż z tego wszystkiego wiele dla wywołującego temat nie wynika. W przeciwnym przypadku będę zmuszony zamknąć lub skasować temat :)

ZenObi__

Post autor: ZenObi__ » 24 lut 2005, 21:10

Rzeczywiście - mam problem z zalogowaniem się?? Podaję prawidłowe dane, a zalogować mnie nie chce :( Musze w tym poscie wpisac inną nazwę uzytkownika :?

Ogólnie rzeczywiście byłem zamierzenie złośliwy, lecz było to spowodowane dość złośliwym atakiem kolegi. Lecz, jako że jest jeden do jednego, uważam rzecz za rozstrzygniętą :).

Panie Wojtku - temat nie będzie się rozwijał, jeżeli kolega Kynioses nie stwierdzi, do jakich zastosowań potrzebne mu będą te urządzenia. Dlatego raz jeszcze wzywam kolegę Kyniosesa - odezwij się chociaż raz :)

Aby faktycznie wrócić do tematu, może parę cytatów z prac i artykułów:

"Jednak nawet przy zachowaniu optymalnych warunków technika ciągłego rozpoznawania mowy ma średnią skuteczność 95 procent. Taki wynik odpowiada mniej więcej 90 błędom na każdej stronie A4, a więc - na razie - zdecydowanie wyklucza możliwość wykorzystania tej techniki do celów profesjonalnych."

Szczerze mówiąc, to i tak więcej niż się spodziewałem :o Myślałem, że jest nieco gorzej, tym bardziej, że mowa jest o mówieniu ciągłym, a nie tzw. dyskretnym (czyli oddzielaniu słów)

"Ostatecznie okno czasowe zostaje określone przez najważniejsze cechy sygnału w postaci zbioru od dziesięciu do dwudziestu parametrów opisujących niezmienniki języka mówionego niezależne od konkretnej osoby."
Moj opis parametrów był nieco uproszczony ;) Ale sofistyka to jednak coś fajnego.

Właśnie wpadłem na pomysł - kto zna mniej więcej algorytmy działania Skypa?Przecież to idealne zastosowanie dla algorytmów rozpoznawania mowy.
Najpierw nauka głosu (nawet w trakcie rozmowy z kimś).Zamiast kompresji rozpoznanie głosu w locie, i podmiana tych samych dźwięków. Np gdy chcę powiedzieć "mama ma małą maskotkę", da się wyodrębnić te same fonemy i wysłać brzmienie pierwszego, a o reszcie tylko informację o intonacji. Program po drugiej stronie dokona syntezy i otrzymamy nasz pseudo-głos, niewiele różniący się od oryginału, a transmisji sporo mniej. Co ja mówię - przy długiej rozmowie DUUUZO mniej! A im dłuższa rozmowa, tym większy zysk.
Proszę o wypowiedzi na ten temat, czy jest to juz gdzies zaimplementowane, np. właśnie w Skypie? Czytając o rozpoznaniu mowy nigdzie nie znalazłem nic na ten temat. Proszę również o komentarze, tym razem może bez ironii i złośliwości :D

ODPOWIEDZ