1tgD67B

More documents

Recommendations

Info

sanan osana muodostavat kummallisia kokonaisuuksia, jotka voivat olla merkki kirjoitusvirheestä. Lisäksi algoritmissa määritellään, että yhdysmerkki osien välissä pienentää kompleksisuuspistemäärää, koska yhdysmerkki on lyöntivirheenä harvinainen. Koska sekä avainarvon että kompleksisuuden laskeminen perustuu sanan yhdysosien tutkimiseen, on ne käytännöllistä toteuttaa yhdessä funktiossa (listaus 3). Kaikkiin Voikon tunnistamiin sanoihin ei liity yhtään sanastotietokantaan tallennettua tietuetta (mm. pronominit), joten algoritmissa on varauduttu palauttamaan oletusarvona avaimeksi tyhjä merkkijono ja kompleksisuudeksi nolla. Listauksen 3 funktio on sellaisenaan riittävä vain sanoille, joille Voikko tuottaa täsmälleen yhden morfologisen analyysin. Aiemmin kuitenkin nähtiin, että sanoilla voi olla useita analyysituloksia. Toisaalta kaikille sanoille (mm. väärin kirjoitetut sanat) ei analyysejä synny lainkaan. Listauksessa 4 esitellään funktio, jonka avulla nämäkin tapaukset saadaan käsiteltyä. Näiden apufunktioiden varaan voidaan laatia aliohjelma, joka tulostaa annetusta tekstikappaleesta epäilyttävät sanat. Esimerkkikoodi on nähtävissä listauksessa 5. Sanat erotetaan juoksevasta tekstistä Voikon tokens-metodilla. Säätämällä kompleksisuuden enimmäisarvoa (tässä 2,7) tai muokkaamalla itse kompleksisuusfunktiota (listaus 3) voidaan vaikuttaa siihen, mitkä sanat tulkitaan epäilyttäviksi. Jotta koodi olisi helpommin käytettävissä, kootaan funktiot samaan Pythontiedostoon, joka voidaan suorittaa käyttöjärjestelmän komentotulkista. Ohjelman runko on listauksessa 6. Kopioi sen sisään funktiot, jotka määriteltiin listauksissa 3–5. def printSuspiciousWords(voikko, textParagraph): minScoreForSuspiciousWord = 2.7 wordToKey = {} keyToScore = {} allTokens = voikko.tokens(textParagraph) words = [t.tokenText for t in allTokens if t.tokenType == Token.WORD] correctWords = [w for w in words if voikko.spell(w)] for word in correctWords: if word not in wordToKey: analysis = voikko.analyze(word) (key, score) = keyAndScore(analysis) wordToKey[word] = key if key in keyToScore: keyToScore[key] = 0 else: keyToScore[key] = score for word in correctWords: if keyToScore[wordToKey[word]] >= minScoreForSuspiciousWord: print word.encode("UTF-8") Listaus 5. Funktio, joka tulostaa epäilyttävät eli mahdollisesti väärin kirjoitetut sanat. #!/usr/bin/env python # -*- coding: utf-8 -*- import fileinput, re from libvoikko import Voikko, Token # Kopioi tähän kohtaan listauksissa 3, 4 ja 5 # määritellyt funktiot. voikko = Voikko(u"fi-x-morphoid") for line in fileinput.input(): printSuspiciousWords(voikko, unicode(line, "UTF-8")) voikko.terminate() Listaus 6. Pääohjelman runko, josta puuttuu listausten 3–5 koodi. Valmis esimerkki Nyt on kasassa esimerkkiohjelma, jolla saa tulostettua tekstissä olevat epäilyttävät sanat. Esimerkkiohjelman voi ladata myös Skrollin nettisivulta osoitteesta http://skrolli.fi/2014.2/. Ohjelma poimii tekstistä sellaiset sanat, jotka ovat kieliopillisesti oikein mutta sen verran erikoisia, että kyseessä saattaa olla kirjoitusvirhe. Tekstistä löytyvät esimerkiksi kirjoitusvirheet maksuase (kun tarkoitettiin maksutase) ja lumiura (kun tarkoitettiin lumiaura). Ohjelma on kuitenkin vain yksinkertainen esimerkki. Sitä kokeilemalla huomaa, että monet sen merkitsemistä sanoista ovat aivan tavallisia suomen kielen sanoja. Algoritmia voisi melko helposti parantaa ottamalla huomioon myös sanan osien tarkemman luokittelun. Esimerkiksi lyhenteet esiintyvät yhdyssanoissa yhdysmerkillä erotettuna, joten ne eivät käytännössä aiheuta hankalasti havaittavia kirjoitusvirheitä. Esimerkkialgoritmi ei huomioi sanojen luokittelua mitenkään, vaan kompleksisuuspisteytys kasvaa helposti suureksi, jos sanassa on mukana yhden tai kahden kirjaimen lyhenteitä. Jätämme tämänkaltaisen jatkokehittelyn haasteeksi lehden lukijoille. Vaihtoehtoisia algoritmeja voi lähettää Voikon kehittäjille, jos ne osoittautuvat toimiviksi. Voikko – suomalaisten NIH? Teksti: Teemu Likonen Avoimen lähdekoodin yhteisöissä on useamman kerran jouduttu selittämään ulkomaalaisille, miksi suomen kieli tarvitsee oman oikolukujärjestelmänsä. Miksi ette käytä Ispelliä? Onko teillä suomalaisilla NIH eli ”not invented here” -oireyhtymä, jonka vuoksi muiden tekemä valmis koodi kelpaa? Ei. Meillä on vain tällainen vähän erilainen kieli… Perinteisesti Unix-tyyppisissä käyttöjärjestelmissä oikoluku perustuu Ispell-järjestelmään, jonka juuret yltävät 1970-luvun alkuun. Ispelliin kuuluu kielioppi, jonka avulla sanasto ja sananmuodostus kuvataan. Unixin periaatteen mukaisesti siihen kuuluu myös komentotyökalu, joka toimii oikoluvun rajapintana muille ohjelmille. Ja Ispellille todellakin on tehty suomen kielen sanasto. Samoin on tehty Aspellille ja Myspellille, jotka ovat eräällä tavalla Ispellin seuraajia. Miksi emme käytä niitä? Laadun vuoksi. Käyttökelpoinen suomen kielen oikoluku vaatii hyvin taipuisan morfologisen järjestelmän, jotta suomen rikas taivutus ja sananmuodostus voidaan riittävän tarkasti määritellä. Ispell ja muut vastaavat ovat liian rajoittuneita. Tavallaan Voikko oli pakko tehdä, koska missään muualla ei kielestämme olla kiinnostuneita. Suurin kunnia ohjelmoinnista ja sanastotyöstä kuuluu Harri Pitkäselle ja Hannu Väisäselle. Suomen kielen oikoluvun kannalta Voikko on ollut valmis jo pitkään, mutta sen tekniikalle on löytynyt muutakin käyttöä. Esimerkiksi pohjoissaamen kielelle on kehitteillä Voikko-sanasto. Kansalliskirjasto käyttää Voikkoa hakujärjestelmissään. Sen ansiosta palvelun käyttäjä voi kirjoittaa hakusanat perusmuodossa ja hakujärjestelmä löytää silti taivutettuja muotoja. Avoimessa lähdekoodissa on etunsa, kun suomen kieliteknologian pyörää ei enää tarvitse jokaisen keksiä uudelleen. 10 2014.2
Kirjaesittely Pelialan historiaa tutkitaan joukkorahoituksella Kolme kirjaa avaa pelintekemisen todellisuutta. Teksti: Jukka O. Kauppinen Pelien tekeminenhän on helppoa. Naputtelee vain. Kohta on hitti käsissä ja eläkerahat pankkitilillä. Todellisuus on kuitenkin karumpaa, eikä kirjallisuudessa ole juuri avattu pelialan todellista historiaa, joka on värikästä, hauskaa ja joskus raadollistakin. Joukkorahoituskampanjat ovat kuitenkin avanneet oven pelihistorioitsijoille aiheen syvällisempää tutkimusta varten. Sinivalkoinen pelikirja, Matkailua pelialalla ja Ocean The History ansaitsevat paikkansa pelihistoriasta kiinnostuneen kirjahyllyssä. on tehty taidolla ja kunnioittaen, eikä alan pimeämpääkään puolta ole pehmennelty. Unelma pelistä eli työttömyyskorvauksilla ja joskus koko tiimi eli toimistolla. Tai kellarissa. Unelma vei kuitenkin eteenpäin. Lopulta unelma kasvoi aikuiseksi. Sinivalkoinen pelikirja kertoo tämän tarinan niin pelien kuin niiden tekijöidenkin kautta. Peliartikkelit, haastattelut ja eri aikakausien teemoja purkavat artikkelit rakentavat unelman tavoittelusta kasvukertomuksen, johon perehtymistä voin hartaasti suositella. Jotain tällaista olen itsekin miettinyt vuosia. Nyt minun ei enää tarvitse. Se on tehty. Kirjailija: Juho Kuorikoski Kustantaja: Fobos Hinta: 43 euroa Lisätietoja: http://www.fobos.fi ”Jeff Minter taitaa olla ainoa oikeasti mukava ihminen koko kirjassa”, totesi puolisoni. Pelialasarjakuva on ehdoton pari Sinivalkoiselle. Ne kertovat saman tarinan kaksi eri puolta, toinen dokumentaarisemmin, toinen sarjakuvadraaman kautta. Kirjailija: Miha Rinne Kustantaja: Lehmäoja Hinta: 35 euroa Lisätietoja: http://peliala.wordpress.com Sinivalkoinen pelikirja Suomen pelialahistorian a–ö Juho Kuorikoski on tehnyt vuosien varrella hienoa pohjatyötä Sinivalkoisen pelikirjan runkoa varten. Kirjan julkaisemiseksi järjestettiin joukkorahoituskeräys, jonka vähimmäissummaksi asetettiin 2 500 euroa. Aihe selvästi kiinnostaa, sillä minimi ylittyi komeasti: kassaan kertyi yli 15 000 euroa. Suomalaisen pelialan yli 30 vuotta kestänyt taival onkin nyt viimein käsitelty tavalla, joka kertoo, kuinka nykytilanteeseen on päästy. Arvostan Kuorikosken työssä erityisesti sitä, että heti alkuunsa kirja avaa kaupallisten suomalaispelien varhaisinta kirjoa ja muistuttaa, miten pienillä panoksilla ja pienille markkinoille ensimmäiset pelit tehtiin. Unohtamatta sitä, miten laajalti suomenkielisiä pelejä väsättiin – alustoja kun olivat sen tavanomaisen lisäksi myös VIC-20, MSX, Spectravideo ja ZX Spectum. Digitaalisen esihistorian avaaminen Matkailua pelialalla Pelialan pimeä sarkastiikka Miha Rinne on nähnyt suomalaisen pelialan synnyn – mutta onnekseen vai epäonnekseen, siinä kysymys. Rinteen viime vuonna joukkorahoitettu sarjakuva-albumi on näet mustaa huumoria pulppuava ja väkevän satiirinen näkemys pelialalla työskentelystä. Satiiri kumpuaa Rinteen omista kokemuksista, jotka eivät ole olleet aina niitä kauneimpia. Unelma pelistä oli kaunis, mutta julkisivun takana oli ihmisiä, yhtiöitä ja kokemuksia, joista on pelottavaa miettiä, mikä pohjautuu toteen, mikä mielikuvitukseen. Ocean The History Ocean oli kuin eurooppalainen kellari-EA Brittiläinen Ocean Software oli aikoinaan Euroopan suurin ohjelmistotalo. Keskellä kotimikrobuumia perustettu pelitalo oli aikansa kapinallinen, josta kasvoi legenda. Ocean operoi Britannian pelialan reunamilla Manchesterissa ja tunki pelintekijänsä tupakansavuiseen kellariin, The Dungeoniin, jossa syntyivät niin Euroopan parhaat kuin kamalimmatkin videopelit. Moni muistaa Oceanin ääripäistään: Robocop, The Great Escape, Head Over Heels ja Rambo First Blood Part II olivat supermenestyksiä. Knight Rider ja Street Hawk hirveyksiä. Kaikkeen on kuitenkin selityksensä, ja kahden brittiläisen pitkän linjan pelitoimittajan Kickstarterissa rahoittama teos avaa Oceanin historiasta saloja, joita minäkään en ole kyennyt edes kuvittelemaan. Upeasti toimitettuun kirjaan on haastateltu 40:tä Oceanin työntekijää, joiden muistelot, detaljit ja valokuvat avaavat rakastetun yhtiön tarua ainutlaatuisella tavalla. Ocean oli pelitalo, jossa sattui ja tapahtui – ja heilläkin oli unelma pelistä. Kirjailija: Chris Wilkins & Roger M. Kean Kustantaja: Revival Retro Events Hinta: 5,99 puntaa (pdf), 25 puntaa (kirja) Lisätietoja: http://www.oceanthehistory.co.uk 11
Page 1 and 2: 2014.2 SKROLLI.FI Tietokonekulttuur
Page 3 and 4: Pääkirjoitus Yhteydenotot Skrolli
Page 5 and 6: Leikkurille lähetetään HPGL-muot
Page 7 and 8: Kolumni 2010-luvun Commodore Jyrki
Page 9: kahdeksan vuotta, ja sitä voidaan
Page 13 and 14: kuivakoita. Jos aivojen murjoutumin
Page 15 and 16: esittää hyvän kompromissin, joss
Page 17 and 18: vain pyytää ohjelmointijärjestel
Page 19 and 20: hae meille (reaktorille) tOihin SAK
Page 21 and 22: Leibnizin hahmotelma binäärijärj
Page 23 and 24: Kesän paras viikonloppu on Assyill
Page 25 and 26: Amstrad CPC464 ”Sitkeä britti”
Page 27 and 28: ZX Spectrum Julkaisuvuosi 1982 Pros
Page 29 and 30: tenkaan menestynyt, sillä Sega ei
Page 31 and 32: Kolumni Seikkailutko kuolleet? Höp
Page 33 and 34: Kunnianhimoisista tavoitteista huol
Page 35 and 36: voi rakentaa lisää laskenta- ja s
Page 37 and 38: 37 15 22 7 8 13 9 2 5 1 7 8 5 6 3 T
Page 39 and 40: FC5025:een (vas.) kytketään vain
Page 41 and 42: ment kit, SDK) lataaminen ja asenta
Page 43 and 44: import QtQuick 2.0 import Sailfish.
Page 45 and 46: CoverBackground { id: root property
Page 47 and 48: Nasta MSX 1 ruskea YLÖS 2 oranssi
Page 49 and 50: TEKin JÄSENYYS - TYÖELÄMÄN TOIM
Page 51 and 52: tilannetta - eli juuri niin kuin Ne
Page 53 and 54: Konvoluutiota voidaan soveltaa sign
Page 55 and 56: Koululaisen pieni peliohjelmointiop
Page 57 and 58: Hartaita harrasteita Oraakkeli ja s
Page 59 and 60: selta. Mega-CD (Amerikassa Sega CD)
Page 61 and 62:
sarjassamme suuria keksintöjä: Ta
Page 63 and 64:
murehtia, pystyykö Haskellilla kyt
Page 65 and 66:
postCategoryR :: Text -> Handler Ht
Page 67 and 68:
viisaimman. Allianssi osoittautui v
show all

1tgD67B

You also want an ePaper? Increase the reach of your titles

Delete template?

Save as template?