Posts tonen met het label Semantisch web. Alle posts tonen
Posts tonen met het label Semantisch web. Alle posts tonen

woensdag 7 mei 2008

Twine


Eindelijk bericht van Twine. De betatestversie is in de lucht. Wat het is? Het lijkt wat op een kruising tussen een blog, linkedin en metadateringssoftware - waarbij het er nu op lijkt dat gebruik gemaakt wordt van ttp (de twine-relaties) om relevante informatie te kunnen vinden. Waardoor je dus niet meer verzuipt in tienduizenden treffers waarvan de eerste 10 sowieso al van wikipedia en allerlei blogs zijn.

Ik ben benieuwd of twine dat waar kan maken - of eigenlijk of de twine-gemeenschap dat waar gaat maken. En dat ben je ook zelf.

Interessant initiatief - eens zien wat het hidsgehalte hiervan zal zijn...

maandag 7 april 2008

Spelfouten en zoekmachines


Martin Reynaert van de Universiteit van Tilburg is bezig met een oplossing die het beruchte spellingsprobleem bij een zoekmachine kan oplossen.

Dat probleem is als volgt: een pagina waarop een trefwoord verkeerd gespeld is, wordt in de zoekmachine geïndexeerd op die spelfout. Stel, je typt per ongeluk 'ftinkdier' in plaats van 'stinkdier'. Omdat de zoekmachine werkt met letter-voor-letterherkenning komt die 'ftinkdier'-pagina nooit meer tevoorschijn als je zoekt naar 'stinkdier'. Dat probleem speelt vooral bij het elektroniseren van grote hoeveelheden papieren teksten, zoals Ewoud Sanders onlangs uitlegde in de NRC. OCR is notoir spelfoutgevoelig. Bij een correcte herkenning van 99,9% zit het programma er per 1000 tekens toch nog 1 keer naast. Kan lastig zijn.

In NRC van afgelopen zaterdag schrijft Ewoud over Martin Reynaert: die heeft een slimme oplossing ontwikkeld voor juist dat probleem. Niet door een spellingchecker los te laten op de gescande teksten, maar door foutgespelde varianten toe te voegen aan de index in de database. Zodat je resultaatlijst van 'stinkdier' toch alle mogelijke varianten oplevert.

Een vraag houdt mij toch bezig. Want op deze manier groeit het aantal gepresenteerde treffers alleen maar verder aan. Waarmee de gebruiker uiteindelijk misschien wel een nóg groter probleem heeft. Dat oplossen lijkt dé uitdaging voor Web 3.0 te worden...

donderdag 3 april 2008

Slimme zoekmachines


Al een tijdje geleden heb ik mij aangemeld als 'bètatester' voor Twine. Twine claimt helemaal Web 2.0 te zijn. Hun dienst komt op het volgende neer: zij zorgen ervoor dat je bij een zoekactie op het web alléén de voor jou relevante treffers krijgt.

Dat is het 'semantisch web', zoals dat in vaktermen heet. Komt erop neer dat je zoekmachine naar de betekenis van je zoekterm gaat kijken, en niet alleen naar de letters die achter elkaar staan. Zodat zoeken naar 'computer' ook pagina's met 'pc' en 'laptop' oplevert, omdat de zoekmachine weet dat die er ook mee te maken kunnen hebben.

Google, fantastische zoekmachine, heeft namelijk precies dát probleem: het levert treffers waarin de ingevoerde zoekterm letterlijk voorkomt. Gevolg: bij de meeste zoekwoorden tienduizenden of zelfs miljoenen treffers. Waarvan niemand er meer dan zo'n 20 bekijkt. Inderdaad, de bovenste.

Het is inmiddels wat slimmer gemaakt (zoek 'hidsgehalte' en Google vraagt: bedoelde u 'humusgehalte'?). Hm, dat klinkt nog niet erg 'semantisch'. Bij andere zoektermen werkt het al wat beter. Zoek naar 'bank' en onderaan de pagina geeft Google heel zinnige suggesties voor verwante zoekacties. Maar eigenlijk wil ik dat Google die verwarring vantevoren oplost. Als ik 'bank' intik, zou ik graag zien dat mijn zoekmachine vraagt: "Om te zitten of om geld op te zetten?"

Het semantisch web staat tegenover Web 1.0 als de HSL tegenover de stoomtrein. Ik ben benieuwd wanneer die HSL-zoekdienst er is. En of dat Twine zal zijn.