keskiviikko 6. toukokuuta 2020

Tekoäly tunnistaa kuvia osa 2: Google Photos ja Apple

Google Photos ja Applen Kuvat -palvelu tunnistavat kuvien sisältöä, joten kuvien haku onnistuu vaikka ei olisi nimennyt kuviaan eikä kirjoittanut niihin metatietoja. Kuvantunnistus on tullut palveluihin kuin varkain, eivätkä kaikki ole edes huomanneet koko hienoa ominaisuutta.

Googlen palvelussa on vain hakukenttä, johon haettava termi kirjoitetaan. Olin ladannut Googlen ja Applen palveluihin kasan vanhoja valokuvia ja ihmettelin, kun Google löysi kuvia ällistyttävän tehokkaasti. Vasta sitten huomasin, että haku kohdistuu automaattisesti myös avainsanoihin, tiedostonimiin ja jpeg-tiedostojen sisään kirjoitettuihin otsikoihin, joten testin koirakuvat piti tyhjentää ensin metadatasta ja lähettää sen jälkeen uudelleen.

Google tunnisti ongelmitta kaikki helpot koirakuvat.
Näyttävät koirilta ja ovatkin.
Testisarjan muokatut kuvat tuottivat tällaisen tuloksen:
Nämä kaikki näyttävät koirilta.
Googlen tekoäly tunnisti neliömäiset palapelit, mutta ei käännettyjä paloja, pelkkää kirsua tai silmää eikä kuvaa, missä silmät oli peitetty kirsun lisäksi. Myös kohinalla ja tahallisella epäterävyydellä muokatut koirakuvat tunnistuivat oikein.

Googlen sanavarastossa on myös termi koiranpentu, joka tuotti välillä yllättäviä tuloksia. Koira tulkittiin pennuksi koosta riippumatta, kunhan sen asento oli leikkisä (vrt. viimeinen kuva):

Koiranpentu on oma hakusanansa.
Ilmeisesti kuvantunnistus toimii pilvessä taustalla, koska tunnistus alkoi toimia jopa vuorokausien viiveellä ja edellytti myös selaimen ikkunan sulkemista. Tuloksena oli paljon muitakin havaintoja, mutta niistä ehkä toisessa kirjoituksessa.

Applen vastaava toiminto on testaamisen kannalta helpompi, koska iPhonen Kuvat-sovellus erottelee tulokset kriteerin mukaan: sijaintitiedot, tiedostonimet, kuviin itse lisätyt avainsanat sekä tekoälyn antama luokitus (kategorita) erottuvat tuloksista helposti. Kuvat antaa myös listan tunnistamistaan samantyyppisistä kategorioista, mistä voi olla hyötyä haun määrittelyssä.

Yllättäen haku antoi erilaisia tuloksia Mac Air -läppärillä ja iPhone 11 Pro -puhelimella. Windowsin selaimella iCloudin Kuvat antaa selata kuvia, mutta siinä ei ole hakutoimintoa lainkaan. Erillinen Windows iCloud-sovellus saattaisi näin tehdä, sitä en kokeillut.

Macissä hakukenttään kirjoitettu kissa näyttää joukon automaattisen luokittelun kategorioita:

Kissa-aiheisia kategorioita.
Jostain syystä monet kategoriat ovat suomen taivutusmuodoissa ("Kissaeläimen"), mikä kertoo jonkinlaisesta konekäännöksestä.

Kuvassa alkaa varmaan kiinnostaa, mikä on se yksi kissa, joka ei kuulu Kissaeläimen kategoriaan. Se paljastuu vertailemalla hakutuloksia keskenään. Ensin Kissa:
Kissa-haun tulokset.
Ja sitten Kissaeläimen:
Yksi kuva enemmän.
Kahdesta lähes identtisestä kissakuvasta vain toinen on luokiteltu kissaksi, molemmat kissaeläimiksi. Tutkimattomia ovat tekoälyn tiet.

Koira-haku antaa tällaisen tuloksen:
Macin koira-hakusana.
Tuloksia on vähemmän kuin Googlen listassa. Ensimmäinen kuva näyttää koiralta, mutta on itse asiassa vuohi. Palapelikuvia algoritmi ei tunnista lainkaan.

iPhonessa haku antaa erilaisia tuloksia. Teksti "indeksoidaan" näkyi sinnikäästi kuvien alareunassa, joten ilmeisesti hakutoiminto analysoi kuvat paikallisesti eikä pilvessä. Sellainen ratkaisu tuntuu oudolta.

Kissaeläin-haku antaa tällaisia tuloksia:

Kissaeläimet iPhonessa.
Myös koira-haun tulokset ovat erilaiset kuin Mac Air -koneessa.

Koiratulosten alku.
Listan lopusta löytyvät tutut testikuvat, myös 4x4 ruudukko (mutta ei isompia).

Koiratulosten loppu.
Tekoälyhaku toimii niin hyvin, että siitä on aidosti hyötyä. Joskus tulokset suorastaan yllättävät. Kannattaa kokeilla, millaisia tuloksia omasta kuva-arkistosta löytyy!

Seuraavassa kirjoituksessa kokeilussa parempi analysoija.

tiistai 5. toukokuuta 2020

Tekoäly tunnistaa kuvia osa 1: Microsoft Office

Miten ihmeessä tekoäly osaa tunnistaa valokuvien sisältöä? Mistä tekoäly voi tietää, että valokuvassa on koira, kissa, talo tai auto?

Ei se varsinaisesti tiedäkään. Näyttämällä tekoälyn algoritmille miljoonia kuvia ja kertomalla, mitä niissä on, saadaan eri hahmoista luotua matemaattinen malli, johon tekoäly sitten vertaa annettua kuvaa ja tekee valistuneita arvauksia. Parhaimmillaan tulokset ovat hämmästyttäviä, pahimmillaan huvittavia.

Tunnistus perustuu etukäteen määriteltyihin avainsanoihin. Algoritmi ei osaa itse kuvailla, mitä se näkee, vaan se poimii valmiista luokituksista parhaiten vastaavat.

Microsoft Office -pakettiin on kaikessa hiljaisuudessa tullut tekoälyominaisuuksia. Esimerkiksi Powerpoint kirjoittaa kuvaan vaihtoehtokuvauksen, joka sisältää kuvasta tunnistettuja elementtejä. Kadulla vastaan tulleesta koirasta ottamaani kuvaan Powerpoint lisäsi seuraavia määritteitä (tämän blogikirjoituksen kuvissa avainsanat on selvyyden vuoksi upotettu kuvan päälle):
"Koira, sisä, katsominen, eläin"
Koira, katsominen ja eläin menevät aivan oikein, mutta kuva on otettu talvella ulkona. Taustan valkoinen ei ole seinä vaan lunta.

Aina tunnistus ei mene putkeen. Virheet kertovat tekoälyn käyttämästä logiikasta. Esimerkiksi Helsingin Sanomien uutiskuva parin viikon takaa tuottaa yllättävän tuloksen:
"Nainen, pöytä, ruoka, pata"
Kuvassa on ilmeisesti öljysäiliöitä, jotka tekoäly on tulkinnut pöydällä oleviksi padoiksi. Sen vielä ymmärtää, mutta mistä tekoäly on keksinyt, että kuvassa olisi nainen? Ilmeisesti tekoäly on koulutettu kuvilla, joissa nainen laittaa ruokaa. Koneoppimisen tuloksena nainen yhdistetään patoihin ja pöytään, mikä on kuvaava esimerkki tekoälyn vääristymisestä yksipuolisen aineiston perusteella.

Mutta palataan niihin koirakuviin, sillä tämä on kiinnostava aihe, jossa riittää loputtomasti kokeiltavaa. Mistä tekoäly tunnistaa koiran? Muokkasin peruskuvasta erilaisia versioita ja kokeilin Officen tulkintaa niistä.

Pelkät silmät riittävät.
Kuonosta koira tunnetaan.
Puoli päätä riittää.
Samoin pelkkä kirsu.
Jos kuvassa on useita koiria, tekoäly tunnistaa sen vain koirana eikä Office osaa kertoa, että kuvassa on kolme koiraa:

Edelleen koira. 
Lisätään toinen eläin:
"Kissa, eläin, koira, katsominen"
Tunnistus onnistuu, vaikka kuvaan lisätään 80 % kohinaa, joskin nyt koira näyttää istuvan.
"Koira, istuminen, katsominen, ruskea"
Sitten muutama kiinnostava versio.
Koiran eri osat muodostavat yhdessä koiran.
Algoritmin kannalta on sama, näyttääkö koira elävältä vai onko siinä ainoastaan koiran eri osat. Sen mielestä kuva on identtinen lähtökuvan kanssa, vaikka ihminen näkee heti mikä on pielessä.

Kun kuvaa sotketaan ja väännetään lisää, algoritmi alkaa antaa kiinnostavia tuloksia:

"Koira, katsominen, sisä, pistäminen"
Kirsun peittäminen saa algoritmin näkemään pistämistä - onpa outoa. Mutta kun silmätkin peitetään, tekoälyn mielestä kuvassa onkin kissa.

"Kissa, sisä, istuminen, katsominen"
Silmät ja kirsu ovat siis oleellisia koiran tunnistamiselle. Mutta mistä algoritmi tunnistaa katsomisen, jos silmiä ei edes ole?

"Ruoka"
Paloina käännetyssä kuvassa on tekoälyn mielestä ruokaa. Kiinnostava tulkinta.

"Erilainen, ruoka"
Toinen kääntö saa kuvan näyttämään erilaiselta ja ruualta.

"Koira, katsominen, valokuva, eläin"
4x4 ruudukosta tunnistaa yhä koiran. Jostain syystä algoritmi näkee myös valokuvan.

"Sisä, katsominen, valkoinen, lehmä"
Yhä pienemmät palat saavat algoritmin näkemään valkoisen lehmän. Kieltämättä koiran turkki tuo pieninä paloina mieleen lehmän.

"Sisä, katsominen, valokuva, lehmä"
Vielä yksi esimerkki:

"Objekti, sisä, erilainen, mies"
Mistä ihmeestä algoritmi keksii tähän kuvaan miehen??

Muut testiaineiston koirakuvat Officen tekoäly tunnisti ongelmitta, mutta yhteen tuli väärä eläin:
Tämä pikkukoira näyttää tekoälyn mielestä karhulta.
Kuvantunnistusta käytetään myös Googlen ja Applen valokuvapalveluissa. Niistä lisää seuraavassa kirjoituksessa.

maanantai 4. toukokuuta 2020

Canon-kamerasta webcam videoneuvotteluihin (Webcam Utility -ohjelma)

Canon on tunnetusti hidasliikkeinen ja jähmeä organisaatio. R5-kameraa on odotettu kieli pitkällä jo kuukausia, eikä R-malliin ole vieläkään tullut softapäivityksenä focus stacking -ominaisuutta, joka oli valmiina halvemmassa RP-mallissa.

Mutta joskus Canon yllättää iloisesti: se julkisti juuri ilmaisen EOS Webcam Utility -ohjelman, joka muuttaa kameran webcamiksi esimerkiksi videoneuvotteluja varten. Aiemmin tämä on vaatinut erillistä kaappauskorttia (kuten Elgato 4K, joka on koronaviruksen vuoksi loppuunmyyty koko Euroopassa). Nyt pelkkä softa riittää.

Utility-ohjelma on vasta beta, mutta näytti lyhyessä kokeilussa toimivan moitteettomasti Zoom-videoneuvottelun kanssa. Kameraksi kelpaavat uudet järkkärimallit, kuten 1 DX Mark II ja III, R ja RP, 5Dm4 sekä M6, M50, M200 ja muutama Powershot-malli. Harmi, ettei vanha 5Dm3 ole tuettujen listalla. Täydellinen lista löytyy sivulta https://www.usa.canon.com/internet/portal/us/home/support/self-help-center/eos-webcam-utility/.

Canon ei olisi Canon, ellei tässäkin olisi outoja ratkaisuja. Ohjelma on tarkoitettu vain jenkeille ("This Software is for use in the U.S. and will not be supported outside that area"), mutta yllä oleva linkki näyttää kuitenkin toimivan (kunhan huomaa ensin klikata oman kameran tyyppiä). Ja beta-versio toimii vain Windows 10:llä, mikä on jo aiheuttanut ymmärrettävästi närää Mac-käyttäjien joukossa. Eiköhän molemmat puutteet korjata jatkossa.

EOS Webcam Utility ja Zoom.
Yksi mainio piirre on latauksen koko: vain 1,5 megatavua. Nykyään kaikki softat tai päivitykset tuntuvat olevan kymmenien megatavujen paketteja, joten pieni ja näppärä apuohjelma on enemmän kuin tervetullut.

Käyttöä varten tarvitaan jalusta ja ulkoinen virtalähde, jotta akku ei lopu kesken. Sitten vain kamerasta automaattinen virrankatkaisu pois päältä ja silmätarkennus käyttöön, jotta fokus säilyy puhujan liikkuessa.

Nykyversio siirtää vain kuvan, joten ääntä varten tarvitaan erillinen mikrofoni. Näillä eväillä saa kuitenkin videoneuvotteluihin erinomaisen kuvan- ja äänenlaadun, joka saa osallistujan loistamaan halpojen webcamien ja pätkivien Bluetooth-mikrofonien rinnalla. Tosin kaistaakin kuluu.

keskiviikko 29. huhtikuuta 2020

Microsoft Tekstin korjaustoiminnot (Microsoft Editor) huvittaa oikoluvullaan

Jokin aika sitten Microsoft julkaisi oikolukuohjelman, joka toimii Chrome- ja Edge-selainten laajennuksena. Suomeksi nimenä on Microsoftin Tekstin korjaustoiminnot. Viime viikonloppuna ohjelma ylitti ainakin somessa uutiskynnyksen, kun muutama twiittaaja kiinnitti huomiota sen web-sivun tekstisisältöön:
"Kieli opin ja kirjoitus virheet..."
Kuvausteksti on vähintäänkin koominen. Ennen Microsoft oli tunnollinen ja esimerkillinen kääntäessään palveluitaan hyvälaatuiselle suomelle (toisin kuin esimerkiksi Apple, jonka käyttöjärjestelmän kieliasu pistää vieläkin silmään), mutta viime aikoina sen verkkoteksteissä on näkynyt surkeaa konekäännöstä. Tähän kohuun Microsoft ilmeisesti reagoi, sillä nyt linkin takaa aukeava teksti on moitteetonta suomea.

Tekstin korjaustoiminnot on kaiketi tarkoitettu toimimaan Wordin web-version kanssa, mutta se toimii myös tavallisena selainlaajennuksena monien nettipalvelujen kanssa. Ei kuitenkaan kaikissa (esim. Google Docs ei toimi). Chrome-selaimessa on oma oikolukuominaisuus, mutta se ei tue suomea.

Tekstin korjaustoiminnot asentuu helposti Googlen Chrome-kaupan kautta osoitteesta https://chrome.google.com/webstore/detail/microsoft-editor/gpaiobkfhnonedkhhfjpmhdalgeoebfa. Käyttö vaatii ilmaisen Microsoft-tilin, laajempien ominaisuuksien käyttöön tarvitaan maksullinen Microsoft 365 -tilaus.

Asetukset tehdään web-sivulta:
Toiminta-asetukset
Synonyymit ei ole oletuksena päällä, mutta kokeilua varten rastitin ruudun. En myöskään estänyt lähettämästä automaattisesti tietoja, vaikka nykyisellään ohjelma saattaakin lähettää Microsoftille luottamuksellisia tekstipätkiäni.

Ainakin Twitterissä tarkistuksesta on aidosti hyötyä, vaikkei se kovin tarkka olekaan. Yhdyssanavirheet menevät läpi heittämällä, mutta osan väärin kirjoitetuista sanoista tarkastus sentään tunnistaa. "Kirjotuksen" menee läpi, mutta niin se menee Wordissäkin, kantasanana on ilmeisesti "kirjoa".

Selkeät kirjoitusvirheet on helppo tunnistaa.
Pilkkuvirheiden oikaisusta voi olla aidosti hyötyä:

Pilkku ennen että-sanaa.
Samoin tarkistus huomasi tahallisesti blogitekstin otsikkoon kirjoitetut kaksi välilyöntiä:

Kaksi välilyöntiä.
Valitettavasti tekstin tarkistus ei näytä toimivan esimerkiksi tätä blogitekstiä kirjoitettaessa, mistä siitä olisi eniten hyötyä. 

maanantai 27. huhtikuuta 2020

Älyjääkaappi raportoi käytöstään

Ostin vuoden 2018 alussa Boschin älyjääkaapin. Älykkääksi sen tekee mobiilisovellus, jonka kautta voi säätää jääkaapin ja pakastimen lämpötilaa, saada hälytykset liian pitkään auki olevasta ovesta sekä mahdollisuus katsoa kahdella kameralla mitä jääkaapissa on. Viimeksi mainittu on näppärä ominaisuus ruokakaupassa. Usein on vaikea muistaa, montako maitotölkkiä kaapissa olikaan. Toisaalta pelkistä kamerakuvista on vaikea nähdä koko sisältöä eikä se tietenkään kerro, onko maidon viimeinen käyttöpäivä mennyt jo umpeen.

Bosch käyttää HomeConnect-tekniikkaa, joka ei ole erityisen avoin. Siihen kuitenkin löytyy IFTTT-rajapinta, jonka kautta jääkaappi pystyy liittymään muihin sovelluksiin. Kirjoitin aiheesta aiemmin.

Koronaviruksen aiheuttaman eristäytymisen vuoksi tuli mieleen katsoa, millaista dataa jääkaappi on vuosien mittaan tuottanut. Rajapinta on toiminut luotettavasti ja kirjannut Google Docsin laskentamalliin lähes 20 000 riviä. Niiden analysointi ei tosin ollut ihan helppoa. Seuraavassa muutama idea, joita voi soveltaa muissakin tehtävissä.

Ensimmäinen työ on saada data Exceliin, sillä Google Docs ei sovellu isojen datamäärien pyörittelyyn. IFTTT oli tuottanut toistakymmentä HomeConnectFridgeLog(n) tiedostoa, missä n oli järjestysnumero. Tiedostot piti ladata omalle levylle, avata Exceliin ja kopioida manuaalisesti peräkkäin samalle laskentamallin sivulle. Otin mukaan vain datan vuoden 2019 alusta, jolloin analysoitavaksi jäi 13 632 riviä dataa.

Tästä analyysi alkaa.
IFTTT kirjoittaa avaukset omassa muodossaan, mikä ei ole suoraan Google Docsin eikä Excelin käyttämä päiväysformaatti. Se vaati melkoisen määrän manuaalista käsittelyä ja joukon tarkkaan suunniteltuja etsi-korvaa-toimintoja ennen kuin päivämäärä sekä tuntiarvo oli saatu poimittua omiin sarakkeisiinsa.

Jos merkkijonon pituus olisi ollut vakio, olisi voinut helposti poimia päivän numeron ja kellonajan. Vaihteleva pituus pakotti kikkailuihin. Tehtävää helpotti se, että pilkku, at ja kaksoispiste olivat kaikki erilaisia erottimia. Samat erottimet eri paikoissa olisivat mutkistaneet prosessia merkittävästi.

Tein ensin etsi-korvaa kuukausien nimille ja vaihdoin ne numeroiksi (January -> 01). Päivän poimiminen osoittautui vaikeimmaksi, se piti tehdä useassa osassa. Perässä oleva pilkku helpotti korvausta ( 1, -> 01,), mutta tällöin piti huomioida myös numeron edessä oleva välilyönti. Ensimmäisellä yrityksellä 31, vaihtui muotoon 301, mikä ei tietenkään ollut tarkoitus.

Kun päivämäärä oli vakiomuotoinen, vuoden poimiminen omaan sarakkeeseen oli helppoa ja koska siinä oli vain kaksi arvoa, ne olisi voinut täyttää ilman funktioitakin.

Kellonaika oli yllättävän visainen ongelma, sillä AM/PM-muunnos ei ollut ihan mekaaninen. Periaatteessa PM tarkoittaa kellonaika +12 h, mutta ensimmäinen tunti puolenpäivän (klo 12:00) jälkeen ei olekaan 0 PM vaan 12 AM.

Lopulta data oli kuitenkin halutussa järjestyksessä Excelissä.

Sarakkeet oikeilla paikoillaan
kkvv-sarake oli tarpeen x-akselin arvoja varten. Näistä olikin sitten jo helppo laatia Pivot-taulukko ja laskea eri kuukausien avausmäärät yhteen.

Jossain tapauksissa on helpompaa siirtää data csv-muodossa ensin Wordiin ja tehdä perusmuokkaus siellä esimerkiksi erotinmerkkejä muuttamalla. Vasta sen jälkeen data palautetaan Exceliin joko tiedostona tai leikepöydän kautta.

Jääkaapin oven avaukset kuukausittain.
Maaliskuun 2020 aiheuttama piikki näkyy selvästi. Sen kohdalla 1160 avausta ovat 31 prosenttia suuremmat kuin maaliskuun 2019 avaukset (885 kertaa). Todellinen nousu on vielä suurempi, sillä etätyöpakko alkoi vasta kuun puolivälissä.

Kun data oli kerran olemassa, sitä oli helppo pyöritellä. Toinen grafiikka näyttää avaukset kellonajan (tunti) mukaan:

Jääkaapin oven avaukset tunneittain.
Ei ole mitenkään yllättävää, että kuvaajan muoto täsmää esimerkiksi mobiilidatan hitauteen, joskin huippu osuu pari tuntia aikaisemmaksi.

Tämän jälkeen olisi helppo laskea korrelaatio kuukausittain jääkaapin avauksen ja painon (Withings-älyvaaka) tai askelten (Fitbit-askelmittari) kanssa. Korrelaatio olisi epäilemättä vahva. Tulos voisi kuitenkin olla sen verran masentava, että jääköön analyysi tähän.

Jääkaapin dataesimerkki on muistutus siitä, miten dataa syntyy nykyään kaikkialla, ja millaisia yllättäviäkin laskelmia sen perusteella voidaan tehdä.

sunnuntai 29. maaliskuuta 2020

4G-mobiilidata kovilla etätyön vuoksi

Olen testannut 4G-datasiirron nopeutta useita kertoja, viimeksi lokakuussa 2019 (Elisa, DNA). Miten mahtavat verkot kestää nyt, kun ihmiset ovat kotona etätöissä?

Elisan 4G-yhteyden nopeus on melkoista sikkuraa:

Elisan 4G-nopeus ke 25 - pe 28.3.2020
Punertava käyrä sahaa satunnaisesti edestakaisin päiväsaikaan, kun se viime lokakuussa oli päivisin huomattavasti tasaisempi. Tämä kertoo päiväkäytön lisääntyneen tuntuvasti.

Torstaipäivän käyrä klo 6 - 24 lähempää katsottuna:

Torstai 26.3.2020
Ensimmäisen kerran alasuunta kyykkää klo 7.52 (30,1 Mbit/s), toisen kerran 9.22 (13,5 Mbit/s). Seuraavat minimit ovat 10.37, 12.22, 14.22 ja 16.52. Illalla nopeus romahtaa tuttuun tapaan ja on alimmillaan 22.22 (3,42 Mbit/s). Liittymän nimellisnopeus on 50 Mbit/s, joten iltakuormituksen aikaan saadaan vain 1/15 maksimista. Se riittää nipin napin tv-kuvan katseluun yhdellä laitteella.

Perjantai-iltana punainen käyrä mataa alhaalla 20.52-23.07. Ilmeisesti sen jälkeen ihmiset sulkevat koneensa ja menevät nukkumaan.

Mittausväli kaikissa kuvissa on 15 minuuttia: 07, 22, 37 ja 52. Näin uutisen, jonka mukaan yhteydet kyykkäisivät päivällä aina tasatunnein, kun palaverit alkavat. Omasta mittauksestani tällaista johtopäätöstä ei voi tehdä, nopeuden keskiarvot vaihtuivat vain vähän (alin 22 yli tasan 31,9 Mbit/s, ylin 7 minuuttia yli tasan 37,7 Mbit/s).

Keskinopeus tunneittain.
Kuvasta kuitenkin näkyy, että kello 10-11 latausnopeus on muita alhaisempi, samoin 14-15 on pieni pudotus. Ainakin aamupäivän kuoppa kertoo etäpalavereista.

Mitä tästä kaikesta voi päätellä? Verkot ovat kovilla myös päivisin, mutta operaattorit ovat silti hoitaneet työnsä hyvin. Kuormitus on etätöiden aivan erilaista kuin viime lokakuussa, mutta bitti kuitenkin kulkee. Videoneuvotteluissa voi kuitenkin esiintyä satunnaista pätkimistä, jota ei voi välttää ajoittamalla palavereita tiettyyn aikaan. Kaikki on kiinni sattumasta.

Siksi ainoa turvallinen ja varma valinta etätyöhön on kiinteä kuituyhteys.

torstai 26. maaliskuuta 2020

Live Transcribe muuntaa sanelun lennossa tekstiksi

Googlen Live Transcribe on näppärä ohjelma, joka muuntaa sanelun lennossa tekstiksi. Se tukee yli 70 kieltä, myös suomea. Ohjelma on tarkoitettu heikosta kuulosta kärsiville, koska sen avulla pystyy seuraamaan ihmisten keskustelua. Mutta se sopii paljon muuhunkin.

Parasta ohjelmassa on sen käytön helppous. Ei tarvitse kuin käynnistää, ja ohjelma on valmis. Sanelua ei tarvitse sammuttaa eikä käynnistää, se tekee kaiken automaattisesti. Ohjelma tunnistaa myös mikrofoniin käyvän tuulen sekä yskän.

Valmiina kuunteluun.
Kun puhe alkaa, ohjelma muuttaa sen tekstiksi automaattisesti:

Sanelua Hesarin uutisesta.
Teksti säilyy ohjelmassa kolme vuorokautta. Sitä ei tarvitse erikseen tallentaa, mutta kiinnostavat kohdat voi kopioida leikepöydän kautta toiseen sovellukseen.

Oletusarvona on valkoinen teksti mustalla pohjalla, mutta sen voi kääntää. Fonttikokoa voi säätää, kuvassa on pienin (!) vaihtoehto. Koska ohjelma on tarkoitettu apuvälineeksi, tekstin on oltava riittävän isoa.

Kieliä voi valita kaksi, jolloin se litteroi esimerkiksi suomea ja englantia sekaisin (tai ruotsia). Oletusarvona on vain yksi kieli, suomi.

Testasin ohjelmaa toistamalla hallituksen tiedotustilaisuudesta Sanna Marinin ja Ohisalon puhetta. Molemmat puhuvat selkeästi ja sanojen välillä on jopa epäluonnollisen pitkiä välejä. Tulokset olivat sekä hämmästyttävän hyviä että yllättävän huonoja.

Ministeri puhuu, ohjelma tekstittää.
Tekstimuunnos on mielenkiintoinen, sillä teksti "elää" taaksepäin, kun tulkki analysoi asiayhteyttä ja käy vaihtamassa vanhoja sanoja uusiin.

Ministerien puhe tallentui ymmärrettävästi, mutta lauseiden ja sanojen vaihtokohdat ovat yhä ongelmallisia.

Tekoäly ei oikeasti ole älyä. Ilmeisesti Google yrittää koko ajan löytää jo aiemmin käännetyistä teksteistä sopivia vastineita, mikä tuottaa yllätyksiä. Yksi sellainen näkyy kuvassa:

"Oliko se sitten tämä?"
Jostain ohjelma keksii lisätä väliin "Oliko se sitten tämä?" -kysymyksen, vaikka mitään sen kaltaistakaan ei esiintynyt puheessa.

Paikoin tekstitys menee täysin oikein. Esimerkiksi peruspalveluministeri Kiuru kirjoitetaan isolla alkukirjaimella, ei lintulajina.

Ministeri Kiuru isolla K:lla.
Toisaalta iso alkukirjain tulee myös väärään kohtaan:

"Ei siis Anna eduskunnalle"
Tässä tilanteessa anna ei ole naisen nimi vaan verbi.

Yksi ongelma on siinä, että valmistellussakin puheessa ihmiset takeltevat ja sotkevat sanoja, haastatteluista puhumattakaan. Korva osaa ohittaa ne ja korjata virheet ilman, että kiinnitämme edes huomiota koko asiaan, mutta ohjelma ottaa kaiken kirjaimellisesti ja tulkinta menee helposti sekaisin.

Kaiken kaikkiaan Live Transcribe on näppärä apu esimerkiksi omia saneluita varten. Siitä on apua myös kun halutaan esimerkiksi tekstiä kirjan sivulta sähköiseen muotoon: luetaan teksti ääneen ja korjataan ne muutamat virheet, joita tunnistus tekee. Useimmille nopeampi ja helpompi tapa kuin koko tekstin kirjoittaminen näppäimistöltä, jos skanneria ja OCR-ohjelmaa ei ole saatavilla.

Live Transcribe toimii vain Androidissa. iPhone-versiota ei ole. Ehkä jokin toinen sovellus täyttäisi tarpeen? Samsungilla ja muilla puhelinvalmistajilla on omia saneluohjelmia, mutta ne eivät yleensä tue suomen kieltä.