In mijn attenderingen vond ik een interessant artikel uit Information Processing & Management, van de hand van onze Belgische collega Leo Egghe, onder de veelbelovende titel "The measures precision, recall, fallout and miss as a function of the number of retrieved documents and their mutual interrelations".
Daarin ook deze grafiek:
Inderdaad, heel pervers dit plaatje.
maandag 3 maart 2008
Pervers
Gepost door
Eric
op
12:55
3
reacties
Labels: retrieval
maandag 21 mei 2007
Zoeken à la Lyonnaise
Op Nedbib verscheen gisteren een berichtje dat de Bibliothèque Municipale de Lyon, als tweede grootste bibliotheek van Frankrijk, met Google Books ging meedoen. Dat bracht me in herinnering dat die bibliotheek destijds ook al door Autonomy was genoemd als voorbeeld van een eerdere klassieke bibliotheektoepassing van hun zoeksoftware.
Op het eerste gezicht inderdaad klassieker dan waar wij Autonomy voor gingen gebruiken. Opnieuw nog eens goed naar de site van Lyon kijken, leverde in elk geval nog wel een paar constateringen op.
- Ze hebben in Lyon zowel een gewoon klassiek bibliotheeksysteem "Catalogue, recherche traditionnelle", als een op Autonomy gebaseerd zoeksysteem "Catalog+, recherche élargie" [let op het spellingsverschil !].
- Wat je met de "recherche élargie" doorzoekt blijkt toch wel iets meer/anders te zijn dan de "klassieke" catalogus. Behalve de catalogusrecords, blijken daarin ook de inhoudelijke antwoorden te zitten die informatiespecialisten voor gebruikers op allerlei onderwerpsvragen bij elkaar gezocht hebben ("le guichet du savoir", een beetje zoals de Nederlandse OB's voor Al@din doen). En bovendien nog de inhoud van een kennelijk recente dienstverlening "Points d'Actu" (Le point sur l'actualité) met nieuws en achtergrondinformatie om mensen te helpen de actualiteit beter te begrijpen. Dat die twee categorieën veel meer inhoudelijke tekst bevatten dan de - ook in Lyon nog tamelijk kale - catalogusrecords, wordt al gauw duidelijk als je ziet dat zoekvragen bovenproportioneel veel resultaten uit die twee categorieën opleveren.
- Interessant ook om hier het standaard Autonomy-interface (Retina) terug te zien. Na onze Proof of Concept met Autonomy - al weer twee jaar geleden - was die een beetje uit mijn geheugen weggezakt. Niettemin goed om ook voor ons eigen interface nog weer eens te kijken hoe in dat standaard interface
- onder "suggested terms" de suggesties voor aanvullende zoektermen worden gepresenteerd;
- in het "Advanced" interface ook meteen een Federated Search in een ander zoeksysteem (hier webzoekmachines) kan worden uitgevoerd (alleen jammer dat het Autonomy zoekresultaat dan meteen achter het scherm met Google- of Yahoo-resultaten verdwijnt);
- ook een "Boolean" interface wordt geboden, dat behalve de verwarrende Google-advanced opties (all of these words / this exact phrase / any of these words / none of these words) ook nog een groot venster biedt om een echte (native) Booleaanse zoekvraag in te tikken; dat laatste blijft toch ook voor Omega het overwegen waard;
- bij elke opgevraagde detail-presentatie ook meteen een aantal "gelijksoortige" documenten getoond wordt (al ben ik niet altijd onder de indruk van de inhoudelijke verwantschap, hoewel dat zo te zien vooral mis gaat - begrijpelijkerwijs - bij de kale catalogusrecords).
- onder "suggested terms" de suggesties voor aanvullende zoektermen worden gepresenteerd;
Enkele (voorbarige?) conclusies:
- Voordat we een echte zoekmachine op onze catalogus loslaten moet er eerst meer tekst inzitten (maar dat had ik al eerder beweerd ;-)
- Met het mengen van tekstrijke en tekstarme records moet je oppassen (ook geen echte eye-opener).
- We moeten maar snel proberen om Autonomy's "suggested terms" en "document suggestions" ook in Omega te implementeren.
- Moet Utrecht ook maar niet met Google Books gaan meedoen? We verkeren dan in goed gezelschap en we hebben meteen een heleboel meer full-text te doorzoeken tekst.
Gepost door
Eric Sieverts
op
11:41
1 reacties
woensdag 25 april 2007
De probabilistische catalogus
Door mijn eerdere opmerkingen over catalogi, naar aanleiding van de NVB-WB dag, was ik een artikel uit D-Lib magazine van begin dit jaar nog een keer wat beter gaan lezen:
The Online Library Catalog: Paradise Lost and Paradise Regained? van Karen Markey.
Met de meeste meningen en overwegingen daarin kon ik het zonder meer eens zijn. Opmerkelijk was dat de vier na te streven oplossingen voor het re-animeren van de catalogus die hierin werden opgesomd al in begin jaren '90 waren geformuleerd.
- Make subject searching in online catalogs easier using post-Boolean probabilistic searching with automatic spelling correction, term weighting, intelligent stemming, relevance feedback, and output ranking. [daar kom ik zo op terug]
- Streamline users' book selection decisions at the catalog by adding tables of contents and back-of-the-book indexes to cataloging (i.e., metadata) records [nog altijd op ons verlanglijstje]
- Reduce the many failed subject searches by expanding the online catalog with full texts—journal and newspaper articles, encyclopedias, dissertations, government documents, etc. [in Omega wel gerealiseerd; nu de catalogus nog]
- Increase finding strategies in online catalogs through the library classification [dat is natuurlijk typisch Amerikaans, waar classificaties een veel belangrijker rol zijn blijven spelen]
De elf literatuurreferenties die aan deze vier hoofdpunten uit Markey's betoog hingen, bleken inderdaad allemaal uit de periode van 1978-1991 te dateren!! Had er in die 16 (of zelfs 29) jaar dan niet wat meer kunnen gebeuren?
Interessant was verder dat onder punt 1 een lans wordt gebroken voor het vervangen van het puur Booleaanse zoeken in onze bibliotheeksystemen, door probabilistische zoektechnieken. Die benaming "post-Boolean" klinkt natuurlijk wel wat demagogisch, als het ware implicerend dat Booleaans dus maar akelig ouderwets is. Maar het is wel een duidelijke ondersteuning dat wij in Utrecht 8 jaar geleden een goede keuze hebben gemaakt, voor de na te streven wijze van zoeken in Omega en zijn voorganger. De meeste van de door Mackey genoemde technieken vormden daarvoor namelijk het belangrijkste uitgangspunt – ook al wordt die zoektechniek door sommige bibliotheekmedewerkers nog altijd met enige achterdocht bekeken.
Gepost door
Eric Sieverts
op
19:32
0
reacties
Labels: catalogus, library-2.0, retrieval
donderdag 19 april 2007
Hoe gaat het met de catalogus?
Op 5 april had de NVB-afdeling Wetenschappelijke bibliotheken een studiedag georganiseerd onder de titel: "Onderwerpsontsluiting II; vinden en verbinden". Die titel gaf al aan dat er (een jaar geleden) ook al eens een "Onderwerpsontsluiting I" was geweest. Alleen ging het deze keer eigenlijk helemaal niet zo veel meer over onderwerpsontsluiting, maar des te meer - direct of indirect - over de toekomst van de catalogus. Bij het programma van de dag zijn intussen ook de powerpointpresentaties van de sprekers te vinden. Over twee bijdragen toch ook hier iets meer:
- "Zoekmachines kunnen het wel alleen" was de uitdagende titel die Theo Huibers had gegeven aan zijn bijdrage. Enigszins demagogisch suggereerde hij de toehoorders dat handmatig ontsluiten van informatie in toenemende mate overbodig wordt, dankzij moderne technieken van information retrieval - iets waar de directeur van Autonomy het zeker mee eens is. Een slecht verstaander zou hieruit kunnen concluderen dat we helemaal kunnen ophouden met het genereren van metadata voor onze catalogi. En dus eigenlijk onze catalogi kunnen opdoeken. Voor dat laatste zijn misschien wel argumenten aan te voeren, maar dan niet vanwege deze uitdagende uitspraak. Er is namelijk helemaal niet zo'n grote tegenstelling als die uitspraak lijkt te suggereren. Voor redelijk gestructureerde catalogi blijven metadata en bepaalde vormen van autorisatie wel degelijk nodig. Maar computerprogramma’s kunnen dergelijke metadata steeds beter zelf genereren, gebruik makend van veel van dezelfde mooie technieken die er achter de schermen voor zorgen dat de zoekmachines van Huibers "het wel alleen kunnen". Die mooie technieken hebben alleen wel veel meer digitale gegevens nodig dan nu in onze catalogi zitten. Dat komt dan goed uit, want grotere hoeveelheden digitaal beschikbare tekst – inhoudsopgaven, samenvattingen en flapteksten, zo mogelijk zelfs de hele inhoud – hebben we toch al nodig om onze catalogi te laten overleven. Want daarmee worden ook de extra diensten mogelijk, of we die nu Library-2.0 of Web-2.0 noemen, waarmee we nieuwe generaties gebruikers nog enigszins voor onze catalogi hopen te interesseren. Anders kunnen we die inderdaad wel opdoeken. En dat kwam uit de bijdrage van Jeroen, later op de dag, ook goed naar voren.
- De tweede bijdrage die ik nog expliciet wil noemen, is het verhaal van Barend Mons, waarin een Wiki wordt ingezet voor terminologie- en kennisbeheer op een gespecialiseerd vakgebied. Daarbij kwamen zowel aspecten van geautomatiseerde kennisextractie als van inhoudelijke validatie van die kennis aan de orde.
Een read-only versie (PPS) van de powerpoint van Mons is in het eerder genoemde programma te vinden.
Een vrijwel identieke versie (gewone PPT) is elders ook beschikbaar.
Een hele lezing (in het Engels) over het zelfde onderwerp is ook te bekijken.
(Dit is weliswaar iets minder rechtstreeks van toepassing op de catalogus, maar wel heel interessant en eigenlijk ook nauwer met onderwerpsontsluiting verbonden dan mijn inleiding suggereerde).
Kennelijk was het een inspirerende dag, want ook op andere blogs is een heleboel over deze bijeenkomst te vinden.
- In de eerste plaats op Jeroen's net opgestarte eigen (Engelstalige) blog "Infopinio" (met voor de buitenlandse lezers vooral een samenvatting van de door hem zelf gepresenteerde gegevens).
- Verder concludeerde Inge Angevaare van de KB in haar blog: "Bibliotheek moet een paar tandjes bij zetten"
- Ook Thecla Ettema uit Delft blijkt over dit soort bijeenkomsten uitgebreid te bloggen.
- En tot slot(?) had ik me hierdoor zelf laten inspireren voor de column in het komende mei-nummer van Informatie Professional ("De catalogus kan het wel alleen" vanaf 23 april al in de voorverkoop op mijn website).
Gepost door
Eric Sieverts
op
09:23
2
reacties
Labels: catalogus, library-2.0, retrieval

