Posts tonen met het label catalogus. Alle posts tonen
Posts tonen met het label catalogus. Alle posts tonen

donderdag 21 januari 2010

Het volgende Omega-decennium (4)


foto: Deborah Fitchett[aflevering 1]
[aflevering 2]
[aflevering 3]

In eerdere posts in deze serie kwamen aan de orde:

Dit keer gaat het om functionaliteit die essentieel is (of lijkt) bij het zoeken in een catalogus, maar die van weinig nut (of zelfs onmogelijk) is bij het zoeken in collecties artikelen.

Op dit moment is er vrij veel verschil in geboden zoekfunctionaliteit tussen de huidige Omega en de Aleph-OPAC (en eigenlijk elke OPAC {!**!}). Belangrijke reden daarvoor is het verschil in de wijze van gebruik tussen catalogi en artikel-databases. In een catalogus wordt relatief vaak gezocht naar "known items", teneinde dat item te kunnen lenen of het in de kast te kunnen lokaliseren. Omdat een gebruiker niet altijd de exacte naam of voorletters van een auteur, of de exacte titel van een boek kent, bieden catalogi meestal een bladerfunctie om de alfabetische omgeving van een auteursnaam of van een boektitel te zien te krijgen, om zo uit een lijstje de juiste auteur of de gewenste titel te selecteren.

Dit is een functionaliteit die op dit moment niet in Omega zit. Het is ook een functionaliteit die daar niet makkelijk - maar vooral ook niet zinvol - is in te bouwen. De auteursnamen in een catalogus zijn - als het goed is - zorgvuldig gestandaardiseerd en zelfs gethesaureerd, zodat varianten van voorletters, voornamen en zelfs achternamen en pseudoniemen, toch (bijna) altijd aan de juiste standaard naam gekoppeld zijn. Zo is het in principe mogelijk alle publicaties van een auteur te vinden, op welke naamsvariant ook gezocht is. Bij de auteursnamen van de artikelen in Omega is dat niet het geval. De metadata in Omega zijn afkomstig van allerlei verschillende leveranciers die er voor hun auteursnamen uiteenlopende standaarden op na houden (zo ze die standaarden al hebben). Zelf die gegevens (geautomatiseerd) standaardiseren zal maar in zeer beperkte mate mogelijk zijn, evenals het koppelen van de van leveranciers ontvangen naamsvarianten. En ook de DAI, de Digital Author Identifier, is daar vooralsnog niet bruikbaar voor. Voor het overgrote merendeel van de inhoud van Omega - de full-text toegankelijke artikelen en andere publicaties - is het dus niet zinvol zo'n bladerfunctie voor auteursnamen te ontwikkelen.

Voor artikeltitels is zo'n bladerfunctie ook niet echt nuttig, omdat die manier van zoeken voor dat type materiaal nogal ongebruikelijk is. De enkele keer dat iemand een known-item-search voor een artikel(titel) doet, zal dat gedaan worden op basis van een combinatie van een paar kenmerkende titelwoorden. Die aanpak hebben onze gebruikers intussen wel geleerd van hun ervaring met webzoekmachines. Overigens is dat een techniek die voor boektitels even bruikbaar is, zodat het maar de vraag is of een titel-bladerfunctie voor cataloguszoekacties in de toekomst nodig blijft.

Behalve een beetje aan de zoekkant, vereist het fysieke materiaal vooral extra functionaliteit om de gebruiker aan gevonden materiaal te laten komen. Zo moeten gegevens getoond worden over beschikbaarheid (uitgeleend of niet, meer beschikbare exemplaren op verschillende locaties, ...) en over mogelijkheden tot reservering van gevonden items. Allemaal functionaliteit die voor de digitaal aanwezige artikelen overbodig is. En wat verder voor gebruikers nog van belang is aan een catalogus-systeem: controle op aflopen van uitleentermijnen, boetes e.d., dat is allemaal administratie die niets met zoekintegratie van doen heeft. In een meer digitale toekomst die ons te wachten staat (lees het nieuwe beleidsplan van de KB daar maar eens op na) zijn dat zaken die er al helemaal niet meer toe doen - of in elk geval heel anders moeten worden.

{!**!}   Oeps, nu zie ik net dat zelfs Worldcat al geen auteursnamenbladerfunctie meer heeft. Eigenlijk ook niet zo gek, gezien het volslagen ratjetoe aan materiaal dat ze daar langzamerhand ingepompt hebben, en waar dus ook - net als bij Omega - geen enkele namenstandaardisatie of thesaurering meer wordt toegepast. Anderzijds zou zo'n kijkje in een auteursindex aan zorgvuldige gebruikers wel de kans bieden om zelf alle varianten bij elkaar te zoeken.

[wordt vervolgd]

vrijdag 15 januari 2010

Het volgende Omega-decennium (3)


[aflevering 1]
[aflevering 2]

De eerste post in deze serie ging over nieuwe ontwikkelingen rond "geïntegreerd zoeken". De tweede ging in op algemene voor- en nadelen van verdergaande integratie, met het huidige Omega als uitgangspunt. Dit keer wat specifieker over retrievalproblemen die daarbij kunnen optreden.

Het overgrote merendeel van de artikelen in Omega bevat uitgebreide inhoudelijke metadata in de vorm van samenvattingen, die geheel doorzoekbaar zijn. Van het fysieke materiaal, zoals dat in Aleph gecatalogiseerd is, hebben we daarentegen nauwelijks inhoudelijke metadata. Behalve een vaak korte en soms ook weinigzeggende titel, zijn er hoogstens nog twee of drie tamelijk algemene trefwoorden toegekend. Dat verschil in hoeveelheid en specificiteit van de aanwezige zoekingangen voor die beide soorten materiaal, maakt dat daar op heel verschillende wijze in gezocht moet worden om een enigszins optimaal resultaat te krijgen.
Om de gespecialiseerde artikelen in Omega te vinden, zijn zoekacties op vrij specifieke zoekwoorden nodig. Maar die zullen in Aleph-materiaal vrij weinig opleveren. Zelfs boeken die wel degelijk informatie over het gezochte specialisme bevatten, zullen niet gevonden worden, omdat ze alleen vindbaar zijn op een paar titelwoorden en enkele veel algemenere trefwoorden (zo die al zijn toegekend). Die problematiek had ik in zijn algemeenheid al eens beschreven in een digitale bijdrage aan InformatieProfessional, "De mythe van de catalogus".

Om fysiek materiaal uit de catalogus te kunnen vinden, is het dus vaak nodig om op vrij algemene zoekwoorden te zoeken. Maar die zullen in Omega-materiaal juist weer weinig opleveren, omdat artikelen veel vaker specialistische deelonderwerpen behandelen dan zulke algemene onderwerpen. Wel degelijk aanwezige gespecialiseerde artikelen over onderdelen van het gevraagde onderwerp zullen daarbij voor het grootste deel gemist worden, omdat gebruikte algemene zoektermen daar niet in voorkomen, en er ook geen hiërarchische thesaurus is, waarmee zogenaamd "generiek" gezocht kan worden. Daarbij had een zoekvraag automatisch uitgebreid kunnen worden met in zo'n thesaurus beschikbare specifieke zoekwoorden.
Zoeken in de catalogus vraagt dus in de meeste gevallen een andere zoekaanpak dan zoeken in het huidige Omega. Deze zoekaanpakken zullen pas op termijn naar elkaar toegroeien, als ook van het merendeel van het in de catalogus beschreven materiaal uitgebreider gegevens digitaal beschikbaar en doorzoekbaar zijn, zoals inhoudsopgaven, samenvattingen, inleidingen en/of besprekingen. Op termijn zullen dat hopelijk ook de volledige teksten zijn, als meer E-books aan onze collectie worden toegevoegd. Daarmee kan voor dit materiaal dan ook meteen de Omega-meerwaarde van de "instant satisfaction" verwezenlijkt worden.

[wordt vervolgd]

zondag 15 maart 2009

NGC4LIB - The next generation catalog

Afgelopen week werd ik geattendeerd op het bestaan van de mailing list NGC4LIB. Dat NGC staat voor Next Generation Catalog. Ik werd meteen overladen met mailtjes, maar ik kwam er net achter dat er gelukkig ook een RSS-versie beschikbaar is. Daardoor kan ik nu ook makkelijk linken naar een enkel bericht uit de lijst.


Gisteren mengde Tim Spalding van LibraryThing zich ook ineens in de discussie. Hij ergerde zich er nogal aan dat een soort "religieus" debat werd gevoerd in de 60 mailtjes van de afgelopen dag. Hoewel ik die stortvloed verbouwereerd aan me voorbij had laten gaan, kreeg ik uit de titels de indruk dat die er vooral om ging wat gebruikers van onze interfaces begrijpen. Maar kennelijk op een nogal abstract niveau.
Tim wilde de discussie weer even wat concretiseren door die naar een "real world" voorbeeld te verplaatsen.
Dat was in zijn geval de catalogus van de Boston Public Library. Zijn kritiek op (het interface van) die catalogus bevat nuttige gedachten voor iedereen die catalogi aan gebruikers wil aanpassen.

dinsdag 30 september 2008

Zoeken op kleur


De bibliotheek van de TUD heeft recent een interessant gebruikersonderzoek gedaan. Eén van de uitkomsten was dat sommige gebruikers zich boeken beter blijken te herinneren op basis van de kleur van de kaft, dan op formele catalografische gegevens zoals een auteursnaam of een exacte titel.
Ongeveer zoals Flickr ook kleur-gerelateerde groepen kent?
Het is misschien wel een aardig idee om hiermee iets te doen op basis van de boekomslagen uit Syndetics, die toch al aan de catalogus zijn gekoppeld. Het moet toch mogelijk zijn om de computer uit deze gifjes automatisch de hoofdkleur te laten bepalen. Als je de gebruiker dan een kleurenpalet biedt om uit te kiezen, moet dat kunnen leiden tot een lijst boeken die is geordend op de "kleurafstand" tussen de boekomslag en de geprikte kleur. Of is dat te simpel gedacht?

dinsdag 1 juli 2008

Schotse catalogus

In een recente weblog gaf Lorcan Dempsey hoog op van het nieuwe Encore catalogussysteem van de bibliotheek van Glasgow University. Nou dien je als universiteit je zoeksystemen natuurlijk ook wel op orde te hebben als je internationaal erkend retrievalgoeroe Keith van Rijsbergen binnen de muren hebt. ;-)

Toch gaat dat Encore-systeem aan de zoekkant niet veel verder dan dat je Googliaans kunt zoeken (één zoekvenster waarin je wat willekeurige termen kunt intikken - maar dat kan met ons Aleph-systeem ook al) en dat er ranking wordt toegepast (maar bij weinig zoektermen lijken publicatiejaren vooral nog de doorslag te geven). Het verschil zit echter vooral in het interface, maar dat maakt dan ook alle verschil (als je begrijpt wat ik bedoel). Vooral de presentatie en de mogelijkheden die het resultaatscherm biedt zijn zeker de moeite waard eens verder te bekijken. Met verfijning via een soort parametrisch zoeken of via tags uit een tagcloud. Zo te zien worden met dat modewoord "tags" overigens gewoon de door de bibliotheek toegekende trefwoorden bedoeld.

Uit het systeem viel ook nog wel een les te leren: bij een mengsel van "kale" oude catalogusrecords met zeer "rijke" records - in Glasgow bijvoorbeeld de e-books met zeer lange doorzoekbare samenvattingen, inleidingen en inhoudsopgaven - krijg je zeer scheve zoekresultaten. Door hun onvergelijkbaar veel grotere aantal zoekingangen worden die e-books - vooral voor wat specialistischer vragen - veel vaker gevonden. In onze digitale tijd moet je dat misschien niet erg vinden, maar je moet je dan wel realiseren dat daarmee het gedrukte bezit, voor zover daar niet ook "rijke" metadata van zijn ingekocht, steeds onzichtbaarder wordt.
Tot slot nog een aardige waarneming: bij de zeer gespecialiseerde zoekvraag "osteoclast generation" (die precies één e-book opleverde) vroeg het systeem of ik niet eigenlijk "the last generation" bedoelde. The last generation of catalog systems misschien?

dinsdag 24 juni 2008

Aleph-widget


De zoekwidget voor de catalogus is er intussen ook. Vanwege de vakantie van Tonny zal het alleen nog even duren voor hij ook metterdaad op de Aleph zoekpagina zal worden aangeboden. Hier wel vast de icoontjes waarmee je de widget in je persoonlijke iGoogle of Netvibes pagina kunt installeren.

Add catalog search to iGoogle   Add catalog search to Netvibes

dinsdag 17 juni 2008

Innovatie bij de collega's

In de werkgroep "Innovatie Digitale Bibliotheek" van UKB komen altijd wel wat interessante zaken van collega-instellingen aan de orde. Hierbij een paar ook voor Utrecht smakelijke krenten uit de pap.

De bibliotheken van Delft, Tilburg en Groningen werken samen bij het opzetten van een geïntegreerd zoeksysteem dat, net als ons Omega, gebaseerd is op een centrale eigen index. Daarvoor wordt Meresco [http://meresco.org/] gebruikt. Anders dan bij Omega, komen hier ook de catalogusgegevens van de betreffende bibliotheken in. Inherent aan het integreren van een fysieke collectie, is dat men te maken heeft met de complicatie dat dan ook up-to-date beschikbaarheidsinformatie aanwezig moet zijn. Als eerste "externe" bron, begint men met de metadata van de artikelen van Elsevier.

In het kader van dit geïntegreerde zoeksysteem zijn zowel Delft als Tilburg ook bezig met de bouw van een metadata-repository. Dit gebeurt op basis van Fedora. Bij de pogingen van Tilburg om hiervoor middels SRU nieuwe en gewijzigde catalogusgegevens uit PICA op te halen, wordt helaas nog weinig medewerking ondervonden.
(Overigens zijn meer bibliotheken bezig voor hun repositories iets met Fedora te doen).

Bij de TU Delft is een aparte site voor instructiemateriaal voor informatievaardigheden ontwikkeld, onder de naam TUlib [http://www.library.tudelft.nl/tulib/]. Woordenwolken als hulpmiddel bij het zoeken, worden met behulp van Collexis gegenereerd.

maandag 21 mei 2007

Zoeken à la Lyonnaise

Op Nedbib verscheen gisteren een berichtje dat de Bibliothèque Municipale de Lyon, als tweede grootste bibliotheek van Frankrijk, met Google Books ging meedoen. Dat bracht me in herinnering dat die bibliotheek destijds ook al door Autonomy was genoemd als voorbeeld van een eerdere klassieke bibliotheektoepassing van hun zoeksoftware.
Op het eerste gezicht inderdaad klassieker dan waar wij Autonomy voor gingen gebruiken. Opnieuw nog eens goed naar de site van Lyon kijken, leverde in elk geval nog wel een paar constateringen op.


  1. Ze hebben in Lyon zowel een gewoon klassiek bibliotheeksysteem "Catalogue, recherche traditionnelle", als een op Autonomy gebaseerd zoeksysteem "Catalog+, recherche élargie" [let op het spellingsverschil !].
  2. Wat je met de "recherche élargie" doorzoekt blijkt toch wel iets meer/anders te zijn dan de "klassieke" catalogus. Behalve de catalogusrecords, blijken daarin ook de inhoudelijke antwoorden te zitten die informatiespecialisten voor gebruikers op allerlei onderwerpsvragen bij elkaar gezocht hebben ("le guichet du savoir", een beetje zoals de Nederlandse OB's voor Al@din doen). En bovendien nog de inhoud van een kennelijk recente dienstverlening "Points d'Actu" (Le point sur l'actualité) met nieuws en achtergrondinformatie om mensen te helpen de actualiteit beter te begrijpen. Dat die twee categorieën veel meer inhoudelijke tekst bevatten dan de - ook in Lyon nog tamelijk kale - catalogusrecords, wordt al gauw duidelijk als je ziet dat zoekvragen bovenproportioneel veel resultaten uit die twee categorieën opleveren.
  3. Interessant ook om hier het standaard Autonomy-interface (Retina) terug te zien. Na onze Proof of Concept met Autonomy - al weer twee jaar geleden - was die een beetje uit mijn geheugen weggezakt. Niettemin goed om ook voor ons eigen interface nog weer eens te kijken hoe in dat standaard interface

    • onder "suggested terms" de suggesties voor aanvullende zoektermen worden gepresenteerd;
    • in het "Advanced" interface ook meteen een Federated Search in een ander zoeksysteem (hier webzoekmachines) kan worden uitgevoerd (alleen jammer dat het Autonomy zoekresultaat dan meteen achter het scherm met Google- of Yahoo-resultaten verdwijnt);
    • ook een "Boolean" interface wordt geboden, dat behalve de verwarrende Google-advanced opties (all of these words / this exact phrase / any of these words / none of these words) ook nog een groot venster biedt om een echte (native) Booleaanse zoekvraag in te tikken; dat laatste blijft toch ook voor Omega het overwegen waard;
    • bij elke opgevraagde detail-presentatie ook meteen een aantal "gelijksoortige" documenten getoond wordt (al ben ik niet altijd onder de indruk van de inhoudelijke verwantschap, hoewel dat zo te zien vooral mis gaat - begrijpelijkerwijs - bij de kale catalogusrecords).


Enkele (voorbarige?) conclusies:

  • Voordat we een echte zoekmachine op onze catalogus loslaten moet er eerst meer tekst inzitten (maar dat had ik al eerder beweerd ;-)
  • Met het mengen van tekstrijke en tekstarme records moet je oppassen (ook geen echte eye-opener).
  • We moeten maar snel proberen om Autonomy's "suggested terms" en "document suggestions" ook in Omega te implementeren.
  • Moet Utrecht ook maar niet met Google Books gaan meedoen? We verkeren dan in goed gezelschap en we hebben meteen een heleboel meer full-text te doorzoeken tekst.

woensdag 25 april 2007

De probabilistische catalogus

Door mijn eerdere opmerkingen over catalogi, naar aanleiding van de NVB-WB dag, was ik een artikel uit D-Lib magazine van begin dit jaar nog een keer wat beter gaan lezen:
The Online Library Catalog: Paradise Lost and Paradise Regained? van Karen Markey.
Met de meeste meningen en overwegingen daarin kon ik het zonder meer eens zijn. Opmerkelijk was dat de vier na te streven oplossingen voor het re-animeren van de catalogus die hierin werden opgesomd al in begin jaren '90 waren geformuleerd.


  1. Make subject searching in online catalogs easier using post-Boolean probabilistic searching with automatic spelling correction, term weighting, intelligent stemming, relevance feedback, and output ranking. [daar kom ik zo op terug]
  2. Streamline users' book selection decisions at the catalog by adding tables of contents and back-of-the-book indexes to cataloging (i.e., metadata) records [nog altijd op ons verlanglijstje]
  3. Reduce the many failed subject searches by expanding the online catalog with full texts—journal and newspaper articles, encyclopedias, dissertations, government documents, etc. [in Omega wel gerealiseerd; nu de catalogus nog]
  4. Increase finding strategies in online catalogs through the library classification [dat is natuurlijk typisch Amerikaans, waar classificaties een veel belangrijker rol zijn blijven spelen]

De elf literatuurreferenties die aan deze vier hoofdpunten uit Markey's betoog hingen, bleken inderdaad allemaal uit de periode van 1978-1991 te dateren!! Had er in die 16 (of zelfs 29) jaar dan niet wat meer kunnen gebeuren?

Interessant was verder dat onder punt 1 een lans wordt gebroken voor het vervangen van het puur Booleaanse zoeken in onze bibliotheeksystemen, door probabilistische zoektechnieken. Die benaming "post-Boolean" klinkt natuurlijk wel wat demagogisch, als het ware implicerend dat Booleaans dus maar akelig ouderwets is. Maar het is wel een duidelijke ondersteuning dat wij in Utrecht 8 jaar geleden een goede keuze hebben gemaakt, voor de na te streven wijze van zoeken in Omega en zijn voorganger. De meeste van de door Mackey genoemde technieken vormden daarvoor namelijk het belangrijkste uitgangspunt – ook al wordt die zoektechniek door sommige bibliotheekmedewerkers nog altijd met enige achterdocht bekeken.

donderdag 19 april 2007

Hoe gaat het met de catalogus?

Op 5 april had de NVB-afdeling Wetenschappelijke bibliotheken een studiedag georganiseerd onder de titel: "Onderwerpsontsluiting II; vinden en verbinden". Die titel gaf al aan dat er (een jaar geleden) ook al eens een "Onderwerpsontsluiting I" was geweest. Alleen ging het deze keer eigenlijk helemaal niet zo veel meer over onderwerpsontsluiting, maar des te meer - direct of indirect - over de toekomst van de catalogus. Bij het programma van de dag zijn intussen ook de powerpointpresentaties van de sprekers te vinden. Over twee bijdragen toch ook hier iets meer:


  1. "Zoekmachines kunnen het wel alleen" was de uitdagende titel die Theo Huibers had gegeven aan zijn bijdrage. Enigszins demagogisch suggereerde hij de toehoorders dat handmatig ontsluiten van informatie in toenemende mate overbodig wordt, dankzij moderne technieken van information retrieval - iets waar de directeur van Autonomy het zeker mee eens is. Een slecht verstaander zou hieruit kunnen concluderen dat we helemaal kunnen ophouden met het genereren van metadata voor onze catalogi. En dus eigenlijk onze catalogi kunnen opdoeken. Voor dat laatste zijn misschien wel argumenten aan te voeren, maar dan niet vanwege deze uitdagende uitspraak. Er is namelijk helemaal niet zo'n grote tegenstelling als die uitspraak lijkt te suggereren. Voor redelijk gestructureerde catalogi blijven metadata en bepaalde vormen van autorisatie wel degelijk nodig. Maar computerprogramma’s kunnen dergelijke metadata steeds beter zelf genereren, gebruik makend van veel van dezelfde mooie technieken die er achter de schermen voor zorgen dat de zoekmachines van Huibers "het wel alleen kunnen". Die mooie technieken hebben alleen wel veel meer digitale gegevens nodig dan nu in onze catalogi zitten. Dat komt dan goed uit, want grotere hoeveelheden digitaal beschikbare tekst – inhoudsopgaven, samenvattingen en flapteksten, zo mogelijk zelfs de hele inhoud – hebben we toch al nodig om onze catalogi te laten overleven. Want daarmee worden ook de extra diensten mogelijk, of we die nu Library-2.0 of Web-2.0 noemen, waarmee we nieuwe generaties gebruikers nog enigszins voor onze catalogi hopen te interesseren. Anders kunnen we die inderdaad wel opdoeken. En dat kwam uit de bijdrage van Jeroen, later op de dag, ook goed naar voren.

  2. De tweede bijdrage die ik nog expliciet wil noemen, is het verhaal van Barend Mons, waarin een Wiki wordt ingezet voor terminologie- en kennisbeheer op een gespecialiseerd vakgebied. Daarbij kwamen zowel aspecten van geautomatiseerde kennisextractie als van inhoudelijke validatie van die kennis aan de orde.
    Een read-only versie (PPS) van de powerpoint van Mons is in het eerder genoemde programma te vinden.
    Een vrijwel identieke versie (gewone PPT) is elders ook beschikbaar.
    Een hele lezing (in het Engels) over het zelfde onderwerp is ook te bekijken.
    (Dit is weliswaar iets minder rechtstreeks van toepassing op de catalogus, maar wel heel interessant en eigenlijk ook nauwer met onderwerpsontsluiting verbonden dan mijn inleiding suggereerde).

Kennelijk was het een inspirerende dag, want ook op andere blogs is een heleboel over deze bijeenkomst te vinden.

  • In de eerste plaats op Jeroen's net opgestarte eigen (Engelstalige) blog "Infopinio" (met voor de buitenlandse lezers vooral een samenvatting van de door hem zelf gepresenteerde gegevens).
  • Verder concludeerde Inge Angevaare van de KB in haar blog: "Bibliotheek moet een paar tandjes bij zetten"
  • Ook Thecla Ettema uit Delft blijkt over dit soort bijeenkomsten uitgebreid te bloggen.
  • En tot slot(?) had ik me hierdoor zelf laten inspireren voor de column in het komende mei-nummer van Informatie Professional ("De catalogus kan het wel alleen" vanaf 23 april al in de voorverkoop op mijn website).