mercredi 5 juin 2013

Un réseau de bibliothèques ou 43 x la même?

Bouquineur incurable, j'ai fait plusieurs fois le tour de l'Île pour visiter des librairies que je ne connaissais pas. Amateur de bibliothèques, je n'ai pourtant visité que 5 ou 6 des 43 bibliothèques de la Ville de Montréal, sans compter celles des villes défusionnées. L'amateur de livres en moi court les librairies, les bazars, les ventes de garage et les marchés aux puces, mais il ne court pas les  bibliothèques. Je me pose la question:

Pourquoi ne suis-je jamais allé (ou presque) dans une autre bibliothèque publique de Montréal que la plus près de chez moi?

Comme pour tout le monde, ici ou ailleurs, ma bibliothèque publique est la plus proche, c'est une bibliothèque de proximité, la plus pratique: c'est ma bibliothèque locale. Outre cet argument géographique, pourquoi est-ce que je ne fréquente pas les autres bibliothèques de la ville?

Pourquoi je n'y vais pas? Parce que je vais y trouver, à quelques petites différences près, la même collection, les mêmes services, le même aménagement intellectuel.

Les nouvelles et futures bibliothèques offriront de magnifiques lieux, plus attrayants, des lieux culturels modernes destinés à la population locale, de proximité. Mais tous les autres Montréalais, ceux qui habitent plus loin et qui ont déjà leur bibliothèque, pourquoi se déplaceraient-ils pour les fréquenter?

Et si on imaginait plutôt les bibliothèques publiques de Montréal avec, oui, bien sûr, une architecture renouvelée, mais aussi avec des collections, des services de référence, des ressources documentaires et de l'équipement numérique différenciés?

Et si nous imaginions les bibliothèques comme des quartiers distincts pour occuper un espace original dans une ville de savoirs et de connaissances? Concevons-les différemment pour faire sortir les gens de leur "local", de leur proximité. Qu'est-ce cela demanderait de plus à nos bibliothèques pour nous faire bouger en dehors de notre quartier? Comment nous attirer vers les autres bibliothèques pour y lire et découvrir d'autres biens culturels?

Abstraction faite de la Grande Bibliothèque de BAnQ, pourquoi des professeurs emmèneraient-ils leurs élèves à d'autres bibliothèques que la plus près de leur école?  Pourquoi les bibliothèques ne deviendraient-elles pas des destinations culturelles, même pour les Montréalais? (Pour autre chose que leur architecture modernisée...)

Franco Matticchio

Imaginons... À Lachine, il serait possible de personnaliser l'offre autour de l'histoire du travail et de l'industrie. À Côte-des-Neiges, nous pourrions consulter un centre de référence sur les flux migratoires de la ville. Frontenac et Mercier sont bien localisées pour brancher leurs ressources sur le fleuve et le port. Voici pour les "contenus". Mais allons plus loin et appliquons le même principe de différenciation-personnalisation aux espaces de médiation. Pourquoi pas une bibliothèque "audio-sonore"? Une autre pourrait être le temple des "images-vidéos". Une autre deviendrait un lieu spécialisé en "écriture-lecture". Une autre réunirait tout sur la danse, les jeux et les sports. Une autre serait "fablab centrique". Une autre serait tout simplement... à l'ancienne! Une autre, sans livres ni imprimés! Pourquoi pas? Mais toutes sans livres, jamais! Toutes interconnectées, toutes reliées, bien sûr, par des objectifs, un fonds et un langage documentaire communs.

La nouvelle orientation: accentuer une dimension de la bibliothèque universelle générale dans une configuration locale, dans une bibliothèque orignale et unique. 

Que veut dire le terme "local" pour une bibliothèque?

C'est être située dans un quartier, bien sûr. Mais quoi d'autre? Cela peut signifier aussi "localisation" culturelle, un lieu propre, dans l'offre bibliothéconomique générale. Il pourrait y avoir une classification des bibliothèques (un Dewey+) pour situer chaque projet dans des catégories générales. Après tout, la clientèle locale pour une bibliothèque ne devrait pas être la même que celle de la pizzeria locale! Elle devrait venir de plus loin, de tous les quartiers, de partout, même de la sphère Web de l'autre bout de la planète.

Et si la différenciation des bibliothèques devenait un axe de développement pour les concevoir comme un tout modulaire, un circuit culturel, imaginé comme on conçoit un circuit touristique, rempli de points d'attractions, complémentaires, ayant chacune d'entre elles des profils, des personnalités techno-culturelles distinctives?

[Pour cela, diront plusieurs, il faudrait une vraie ville centrale forte, et ils n'auraient pas tort.]

Dès maintenant, la collection (à cause de l'accès numérique) ne peut plus être un réel facteur de différenciation. Alors, comment donner une valeur spécifique à une bibliothèque? Quelle personnalité, ou plutôt quel personnage-institution chaque bibliothèque devrait-elle jouer sur la scène culturelle urbaine?

Je me repose la question: qu'est-ce qui pourrait me donner le goût d'aller à une bibliothèque autre que Frontenac, Mont-Royal ou à BAnQ? Je ne sais pas. Pour le moment, j'ai le goût d'aller voir les nouveaux édifices pour le plaisir de l'architecture. Après ces jolis coups d'oeil, qu'est-ce qui pourrait me motiver à fréquenter, même de temps en temps, les quarante autres bibliothèques? Pourquoi j'y retournerais si c'est pour retrouver la même bibliothèque que celles à côté de chez moi?

Je sais, mes questions sont plus nombreuses que mes réponses. Mais concevoir un ensemble de bibliothèques comme un réseau de connaissances et d'expériences complémentaires, différencié, c'est un autre projet que de concevoir un série de bibliothèques généralistes qui offrent "tout" de la même manière à ses voisins

43 x la même bibliothèque = une seule offre de service.

43 x des bibliothèques personnalisées = un réseau des services.

Est-ce le même projet de concevoir une bibliothèque pour une ville ou un village, où elle sera la seule et l'unique, que d'en concevoir une pour l'intégrer à l'intérieur d'un réseau public d'une grande ville?

Le "local" dans une métropole et celui dans un village n'ont pas la même taille!

Bibliothèquement vôtre!

Luc Gauvreau

P.S.:  Pour explorer la diversité des aménagements possibles, je vous recommande l'album "Bibliothèques et lbrairies" de Irène Ellenberger, artiste, graphiste et conceptrice visuelle, sur Pinterest.

mercredi 6 mars 2013

Montréal en 1949 (partie 1)

Voilà plus de 60 ans, au lendemain de la Deuxième Guerre Mondiale, qu'aurait-on vu de l'Île de Montréal si nous avions pris l'un des avions de la Canadian Pacific Air Lines Ltd, Aerial Survey Division pour photographier le territoire?

Des champs et encore des champs, des milliers de petits et grands potagers, souvent enclavés dans des quartiers en construction, des dizaines de petits ruisseaux, des banlieues en expansion et l'incroyable place que prenait alors les chemins de fer, les immenses gares de triage. Et tant d'autres choses, comme le pavillon central de l'Université de Montréal, presque tout seul, au sommet du mont Royal.

Les Archives de la Ville de Montréal ont déposé dans le portail de données ouvertes de la Ville plus de 3 900 photos aériennes: c'est une collection fascinante à voir et à regarder. Pour réaliser cette cartographie aérienne de l'Île en 1949, le territoire a été séparé en 48 couloirs. De 50 à 95 photos étaient prises pour couvrir chaque couloir. Chacune d'entre elles représente donc qu'une petite fraction de l'ensemble. En les regardant une à une, on a beaucoup de difficulté à les situer, d'autant plus que le "chevauchement" entre les photos est assez grand, plus de 30 % du territoire se retrouve souvent sur les photos adjacentes.



Mais la technologie peut donner un bon coup de main! Pour juxtaposer les photos les unes aux autres, j'ai utilisé l'application Photosynth de Microsoft. C'est très facile à utiliser et à mettre en ligne (mais le téléchargement m'a semblé un peu long). Je n'ai pas vérifié chaque collage fait automatiquement, mais le résultat me semble très bon, sinon excellent. Voici le résultat pour 200 photos. Choisir "Agrandir pleine vue" pour un meilleur résultat. D'autres applications peuvent créer ce type de panorama composée de centaines de photos, avec plus de fonctionnalités et de souplesse.

Pour avoir un avant-goût de toutes les possibilités de découverte que l'on pourra faire avec la carte aérienne générale de l'Île en 1949, cette application remplit tout à fait son rôle.

Le long édifice au centre "inférieur" de l'image est le Grand Séminaire, rue Sherbrooke à l'Ouest de la rue Guy; plus à gauche, c'est le Collège Dawson, à l'ouest de la rue Atwater.

Bonne visite!


Vous pouvez comparer avec la carte actuelle:


View Larger Map

samedi 23 février 2013

Journée internationale des données ouvertes

Le 23 février, dans le cadre de la Journée internationale des données ouvertes, je donne un conférence sur le thème de la "culture ouverte". Voici un aperçu du diaporama dont je me servirai:


mercredi 13 février 2013

Un Web vraiment universel et pour tous les temps?

Comment?

Voici une hypothèse uchronique.

Imaginons que les Sumériens ont inventé le Web, Facebook et Twitter en même temps que l'écriture!!! 
Bien sûr, ils auraient aussi inventé un Google vraiment beta.

Et supposons que ce Web-là est à peu près comme celui d'aujourd'hui et n'a pas non plus évolué depuis ce temps.

Avec une WayBack Machine optimisée, on pourrait donc consulter le blogue de Gilgamesh où il raconte ses aventures avec Enkidou:





On pourrait lire les blogues des platoniciens, des Templiers, celui de Marco Polo, de Rabelais, du docteur Chénier et de Garibaldi.

Ce Twitter multi-millénaire serait devenu un système de traçabilité des énoncés humains à travers l'Histoire. Impossible? L'industrie alimentaire se prépare à mettre en place un système de traçabilité de chaque côtelette de porc, et de chaque raisin vert. Alors, pourquoi pas un tel système pour les écrits humains?

Imaginons maintenant que nous avons un petit gadget Google, genre machine à voyager dans le temps. On entre la date que l'on veut et/ou un lieu, par exemple, Europe 1520. On retournerait en arrière dans ce web universel et de tous les temps. On pourrait consulter, naviguer, peut-être même devenir "ami" avec Jacques Cartier avant qu'il ne parte pour nous découvrir.

Impossible?! Oui et non.

Si le Web sémantique dont on parle ne permet pas un jour de réaliser de tels projets, à quoi servira-t-il?

Et même plus, sera-t-il vraiment "sémantique" s'il ne pouvait les faire advenir?

Montréal ouvert: culture et histoire

Dans le cadre de la Journée internationale des données ouvertes du 23 février 2013

Quelles données ouvrir à Montréal, sur Montréal?
Quelles informations sur Montréal rendre publiques?

Perspective générale pour les données montréalaises et urbaines

- concevoir une ontologie sémantique de la ville contemporaine, un plan de classification hiérarchique des données, une sorte de tableau périodique des données urbaines
- pour identifier les données à recueillir, à trouver.
Ce serait une sorte de plan optimal des données qu'on peut réunir sur la réalité complexe d'une ville moderne.

- élargir l'éventail des fournisseurs de données: ouvrir toutes les données, pas seulement les données et les informations de l'administration municipale et sur les services de proximité, mais les données SUR Montréal. Voici une liste (incomplète) des principaux fournisseurs de ces données:
  1. les gouvernements fédéral et provincial, leurs ministères: santé, transport, éducation, économie, justice, culture, environnement, etc.
  2. les organismes publiques: Observatoire de la culture, Conseils des Arts, Hydro-Québec, commissions scolaires, universités, groupes de recherche, organismes culturels, registraire des entreprises
  3. les entreprises ou organismes privés: chambres de commerce, associations professionnelles, sociétés d'histoire, festivals, Radio-Canada 
  4. dans les collections de documents numérisés (BAnQ, McCord, MBA)
  5. archives des associations et des groupes communautaire
À ces archives collectives, il faut trouver lier les archives personnelles des citoyens. Ce sont des ressources documentaires immenses, uniques, irremplaçables. Avec le numérique, les citoyens font bien plus que consulter des archives: ils peuvent maintenant en créer, en diffuser, participer à leur description et à leur mise en valeur. Les archives documentaires doivent maintenant trouver les moyens d'intégrer cette richesse dans leur pratique et leur collection.

- développer des outils de référence
  • répertoire et inventaires des bases de données que possèdent les administrations municipales, les gouvernements
  • fichiers autorités pour les entitées de référence: noms, toponymes, raisons sociales, organismes, etc. 
  • dépôt de documents et de textes numériques (voir les publications officielles à BAnQ): ouvert aux outils d'analyse sémantique, d'extraction de données
Données et informations culturelles
  • priorité: ouverture des données bibliographiques de Bibliothèque et Archives nationales du Québec: 90 000 documents avec le sujet = Montréal
  • 15 900 ressources en ligne + celles des Archives dans Pistard: + de 100 000 documents
  • données du réseau des centres d'archives de Montréal: universités, musées, institutions, etc.
  • données des activités culturelles des maisons de la culture, bibliothèques (à MTL déjà ouvertes), musées, etc.
  • Commission de la toponymie du Québec (nom de lieux dans Topos)
  • base de données des collections des musées 
  • base de données des groupes universitaires
Suggestion d'utilisation des données historiques

Que les applications pour les données contemporaines soient ouvertes à l'ajout de données historiques (par l'importation en format csv ou autres) pour tous les citoyens, pour des projets plus modestes ou personnels. Le site des Maires de France peut être un excellent modèle http://www.francegenweb.org/mairesgenweb/

Pour d'autres réflexions sur ce sujet, consulter la version préliminaire de mon invitation à organiser les Premières Journées de la culture ouverte au mois de septembre 2013.

Commentaires bienvenus,

Luc Gauvreau

[Une première version de ce texte a paru en mars 2012]











mercredi 6 février 2013

Bibliothécaire en DJ, oui! Mais avec quelle musique?


Le bibliothécaire comme DJ, c'est la proposition (ou la question!) de Martin Lessard à propos du rôle des professionnels des lieux culturels centraux que sont les bibliothèques.  Dans le cadre des débats entourant le  livre numérique, sa réflexion a le premier avantage de nous emmener un peu plus haut et plus loin que la question des formats, des modèles d'affaires, des plate-formes de diffusion et des droits d'auteur. Les bibliothèques sont avant tout des lieux culturels dont la vie est plus longue que les informations en real time. Tout le monde le sait, mais il est bon de le rappeler de temps en temps.

Comme le dit Martin Lessard, son texte veut ouvrir des pistes de réflexion. Voilà qui est réussi. Une bonne piste, c'est fait pour aller ailleurs, ça fait réfléchir et fonctionner les neurones.  J'en emprunterai une que je considère essentielle dans le cadre des réflexions sur l'évolution des bibliothèques et sur le rôle des bibliothécaires: la neutralité. Un des fondements de ces dernières, de leurs principes historiques - sans lesquels elles ne peuvent pas remplir adéquatement leur mission sociale et politique-, c'est leur neutralité idéologique. Acquise parfois après de longues luttes, cette neutralité exige des bibliothèques qu'elles conservent les documents produits par une société et les rendent accessibles à la consultation, sans censure ni Enfer pour les obscénités, sans filtre contre le mauvais goût ni les bêtises, et même sans exclusion de la littérature haineuse et des discours extrêmes, réactionnaires, anti-scientifiques.

Dans une bonne bibliothèque, on doit trouver la bonne musique autant que la musique "plate". Mais comment définir ce qu'est de la bonne ou de la mauvaise musique? Les bibliothécaires laissent les auditeurs en décider.  Leur position démocratique dans la diffusion de la connaissance est là: constituer des collections représentatives de la vie sociale, artistique, intellectuelle, avec ses chefs-d'oeuvres et ses niaiseries, ses beautés et ses quétaineries, ses vérités, ses faussetés et ses mensonges. Il a fallu un très long combat avant que les bibliothèques cessent de porter des jugements sur le contenu de ce qu'elles conservaient. Cette "neutralité" me semble être leur plus importante contribution démocratique.

Dans le contexte numérique, il m'apparaît que cette neutralité essentielle est "menacée" (par le droit et l'économie aussi) mais, surtout, quelque peu oubliée. C'est en suivant cette piste de la neutralité que je me retrouverai tantôt sur la scène avec les bibliothécaires DJ de Martin, mais avec une équipe composée un peu différemment de la sienne...

La réédition de pamphlets antisémites de Louis-Ferdinand Céline par les Éditions Huit (Québec, 2012) peut et doit soulever des débats. Ce n'est pas un acte éditorial neutre, loin de là. Dans une telle situation, le rôle des bibliothécaires est de se taire. Comme citoyens, ils ne participent pas au débat dans le cadre de leur profession. Une fois le livre édité, la bibliothèque le conserve et le rendre disponible, sans en faire la promotion, sans l'inclure dans un remix de la littérature raciste non plus. Voici un autre exemple, plus cool. Devenu DJ en résidence, si un bibliothécaire se mettait à publier son Billboard, sa Curation numérique ou son Best of du rock, il risquerait de se retrouver attaqué par les partisans des Beatles et ceux des Rolling Stones! Pas sûr que la direction apprécierait devoir répéter, une fois de plus, que: "les choix et listes de recommandations de nos bibliothécaires ne représentent en aucun cas les préférences de la Bibliothèque..."

La bibliothèque n'est pas un tribunal d'arbitrage de la culture, des idées et de la morale. Le bibliothécaire n'est ni le procureur de la poursuite ni l'avocat de la défense: il fournit la documentation aux deux parties. Il se tient loin de tout procès, et surtout des procès d'intention qui pourraient l'accuser de ceci, de cela.

Deux exemples ne forment pas un échantillon bien convaincant, mais il me semble que transformer les bibliothécaires en DJ les ferait sortir de leur neutralité. Ils quitteraient le silence nécessaire à l'exercice de leur tâche consistant à conserver-décrire la documentation humaine d'une manière rigoureusement "neutre".

Mais!

Oui, oui, oui!  La bibliothèque doit être remixée, objet de multiples re-classements, de pratiques inédites de "curation", cela ne fait aucun doute. Mais par qui? Qui peuvent être les DJ de ces nouvelles pratiques bibliothéconomiques? Les bibliothécaires ou les citoyens?

Le rôle des bibliothécaires, à mes yeux, est de donner les moyens aux citoyens, aux éditeurs, aux professeurs, aux auteurs, aux créateurs, aux lecteurs et lectrices, aux enfants et aux adultes de venir jouer dans les collections collectives, mises en commun, pour les re-programmer, les re-diffuser.

Un DJ est un éditeur-diffuseur de contenus. Si les bibliothécaires deviennent comme eux, ils deviendront eux aussi des éditeurs et leur production va, nécessairement, entrer alors dans le champ de la critique. Or, à mes yeux, ils ne doivent pas s'aventurer dans cette sphère de la vie sociale. La bibliothèque nourrit l'esprit critique, les bibliothécaires rendent la critique possible, mais ils n'ent sont pas les producteurs. 

Pour rendre possible le remixage social de la bibliothèque, la contribution des bibliothécaires est pourtant essentielle. Comment? Par la création des "informations sur les informations" contenues dans les collections  documentaires déjà conservées et aussi, idéalement, dans toutes celles maintenant à l'extérieur, dans Internet. Ce que les professionnels des bibliothèques doivent remixer, ce sont leurs pratiques, leurs métadonnées: remixer le système Dewey, la classification de la Bibliothèque du Congrès ou encore les vedettes-matières de l'Université Laval, compléter les notices abrégées, achever le dépouillement, enrichir d'une manière encyclopédique et rigoureuse leurs fichiers d'autorités. Le matériel des bibliothécaires devenus DJ, ce sont les notes et les tounes de la bibliothéconomie.

Internet et les moteurs de recherche nous ont montré comment les descriptions des contenus par Dewey et LOC étaient, somme toute, pauvres, inachevées. Ce sont des classifications rigoureuses, standardisées, oui, mais combien limitées et contraignantes! Fermées à la participation-contribution des usagers, conçues dans le cadre taxonomique des savoirs du XIXe siècle occidental (malgré les modifications mineures qu'on leur a apportées), ce sont ces cadres cognitifs que les bibliothécaires doivent brasser, bousculer, ouvrir, faire danser... 

Ce travail de description des productions humaines est (était?) au coeur de la contribution intellectuelle des bibliothèques. Oui, elles peuvent devenir de grands juke-box, des pistes de danses animées par de renversants DJ, mais les bibliothécaires, je les vois dans l'arrière-scène produisant des millions de nouvelles micro métadonnées pour que les DJ vedettes sur la scène publique puissent avoir accès en deux ou trois clics à toute la documentation humaine.

Des bibliothécaires en DJ, je veux bien. Mais DJ de méta-données, de classifications "sauvages", aberrantes, dépoussiérées, enrichies, concepteurs de rayonnages provocants. Les bibliothécaires vont permettre d'"augmenter" la connaissance de la réalité, s'ils augmentent la richesse de leur contribution intellectuelle à la consignation et l'archivage des réalisations humaines.

Mais les DJ ont besoin de piste de danse et de foules de danseurs. Pour les satisfaire, les bibliothèques doivent développer aussi des scénographies, des aménagements, des ressources et des outils technologiques pour rendre cela possible.

Et alors... on lit!

mardi 10 avril 2012

Le Titanic et l'iceberg du real time

La visibilité du Titanic dans les médias ces jours-ci me donnerait le goût de pirater le Web... si j'avais les compétences d'un super-méga geek. 

Cela m'a inspiré cette divagation historique sur le thème poétique du jour: le naufrage de l'arrogance technologique dans l'océan incertain du futur!

Depuis hier, aujourd'hui, pour quelques jours encore, la célébrité de l'accident maritime du Titanic fait en sorte que le cours normal de l'actualité est légèrement dévié vers les eaux glacées de l'Atlantique Nord en 1912. Des nouvelles du jour sont maintenant celles des jours vieux de 100 ans parce que des informations  titanisques [sic] sont diffusées puis reprises des centaines, des milliers et des milliers de fois dans les médias sociaux et officiels. 

Une hypothèse qui divague

Si 1 000 faits historiques, 100 000 ou même 1 000 000 de faits anciens étaient ainsi re-diffusés dans le Web avec la même amplitude, fréquence et duplication, avec la même frénésie de remixage et de re-twitts, est-ce qu'on pourrait fléchir, détourner de l'actualité 10, 15, 25% des contenus mis en ligne? À la limite, pourrait-on faire croire un moment à des gens qui ouvrent leur plate-forme d'aggrégation de nouvelles qu'elles ont voyagé dans le temps durant leur sommeil et qu'elles reçoivent maintenant, en avril 2012, des nouvelles vieilles de 100, 200 ans?

De quelle manière serait-il possible de construire, secrètement, un gigantesque iceberg de données historiques? Ce pourrait être une sorte de réincarnation pôlenordesque de Moby Dick, l'agglomération de toutes les données imprimées dans l'ère pré-web. Gavé de krill d'informations oubliées, on le ferait dériver lentement dans le fil des réseaux sociaux, en real time de 2012, pour que le cours de l'actualité soit dévié de sa course, pour qu'il se défile à l'envers, à rebours de sa direction normale.

Orson Welles a fait croire aux New-Yorkais que les extraterrestres les envahissaient. Pourquoi ne pourrait-on pas (nous) faire croire que nous sommes à une autre époque? 

J'imagine des armées de chevaux de Troie installés sur des milliers et des milliers d'appareils numériques, sur des blogues, des comptes Twitter, Flickr, Gmail, Facebook, Youtube, Itunes (imaginons des comptes "amis" préprogrammés, synchronisés et interconnectés, clandestins, pour écouter et visionner telle ou telle oeuvre ancienne!) qui, au moment prévu, diffusent des millions de données historiques.

Un complot pour faire couler le Titanic du real time dans les abysses de l'Histoire
(c'est un élément poétique de la divagation!).

Je perds le Nord, et le présent, c'est sûr. Mais l'idée m'est venue en pensant aux énormes trous noirs qui auraient une force gravitationnelle si grande qu'ils pourraient faire dévier, fléchir le trajet de la lumière. 

Toutes les informations, documents et données anciennes que l'on met aujourd'hui en ligne sont comme des trous noirs au milieu Web. C'est la matière sombre de l'univers numérique. Déposée dans les bases de données du web invisible, hors de la chronologie du Web née à peine voilà 25 ans, la mémoire des sociétés et des cultures passées reste dans les oubliettes. On ne sent pas ni sa présence ni son poids: la dématérialisation numérique a plombé la continuité entre hier et maintenant.

Comment donner aux archives de la mémoire humaine une présence réelle, en real time, pour qu'elle apparaisse autrement qu'à l'occasion de la recherche de quelqu'un dans une base de données, ou lors de la consultation d'un site?

Facebook, Google+ et l'environnement Apple, on ne peut pas y échapper: ils sont toujours et tout le temps là.

Pourtant, si on pense au nombre et à la valeur des énoncés qu'il contient, l'univers total des livres et des imprimés (avant 1990) représente un réseau socio-culturel aussi important que les réseaux actuels. On pourrait discuter de la taille de chacun d'eux, mais celui de la mémoire historique est des milliers de fois plus riche et complexe que ce qu'on peut en voir aujourd'hui dans le Web. 

Comme le fatidique iceberg du Titanic s'était formé par l'accumulation de minuscules cristaux de glace, jusqu'à pouvoir couler le plus gros paquebot de l'époque, pourquoi ne pas concevoir un iceberg de données pour déchirer la surface de l'infini présent et nous montrer que nous voguons au-dessus des fosses, des heurs et malheurs de l'Histoire.

C'était mon petit iceberg à la mer, numérique.

Bon voyage!
Et joyeux naufrage!

mardi 28 février 2012

Ma bibliothèque portative

Dans le cadre du Colloque scientifique international sur les TIC en éducation, je présenterai une communication sur une éventuelle "bibliothèque personnelle portative" qui pourrait accompagner l'élève, de la maternelle à l'université (!). En voici le résumé:


La bibliothèque d'un établissement scolaire est aujourd'hui une seule des innombrables sources d'information, de documentation, de recherche et de lecture que professeurs, élèves et parents consultent pour enseigner et apprendre. Les manuels et les documents pédagogiques sont eux aussi entourés d'un univers de savoirs et de connaissances presque infini. De nouveaux supports et applications changent profondément le mode d'accès à ces ressources, leur utilisation en classe, que ce soit par le professeur ou les élèves.
À partir d'exemples tirés du domaine de l'histoire en particulier, "Ma bibliothèque portative" propose une réflexion sur la sélection, l'organisation et l'utilisation des ressources documentaires numériques dans un cadre pédagogique. C'est aussi la proposition d'une plateforme évolutive pour permettre aux élèves de se constituer une bibliothèque de connaissances adaptée à leur niveau d'études. Ce projet s'inscrit dans une recherche sur les outils de curation de contenu, de lecture, d'annotation, de recherche et d'édition collaboratives.


Je vais publier sur ce blogue mes réflexions à ce sujet. Si vous avez des idées, des commentaires, des suggestions, ajoutez-les, je les lirai avec plaisir.

samedi 28 janvier 2012

Temps, archives et Internet: une histoire hors du temps


Quand viendra le temps d'indexer un jour les milliards de documents "nés numériques", les archivistes, historiens et bibliothécaires auront un problème nouveau: trouver la date de parution-publication de chacun des documents, des textes, des tweets, des commentaires, des textos.

Au minimum, on peut trouver la date de création du site où paraît le document la première fois. Trouver la date de parution du document lui-même est déjà plus compliqué, même en supposant que le "document" n'ait été modifié qu'une seule fois. Et d'ailleurs, question fondamentale: qu'est-ce qu'un document dans Internet? Si même le concept de "document" est toujours valable.

Autre chose, quel document n'aura jamais changé de "lieu" de publication, de site? Il peut très bien avoir paru sur le site X en 1998, avoir été débranché pendant quelques années et avoir été republié plusieurs années plus tard.

Internet, c'est aussi le règne de la duplication des documents, tous peuvent être reproduits un très grand nombre de fois sur autant de sites, même à l'intérieur du même site. Pensons aux images ou illustrations, sur combien de sites une photo peut-elle être publiée? Des milliers, des millions...

C'est comme s'il y avait une confusion, un mélange, entre une édition particulière d'un document et les exemplaires de ce tirage. Dans internet, c'est comme s'il y avait autant d'édition d'un titre qu'il y a d'exemplaires! En fait, on pourrait donner aux sites internet le statut de bibliothèques virtuelles, soit un lieu où sont regroupés un nombre X de "documents", où ils sont conservés temporairement ou pour une longue durée. Ici, l'éditeur du document, ou plutôt l'entité responsable de la création du document, ne correspond pas au site lui-même.

Par exemple, que sont, sur le plan de la bibliographie, Youtube, Flickr, Facebook, Google+, WordPress, Twitter? Tous ces sites où les usagers publient et diffusent des documents: des éditeurs? Oui, car ils créent des interfaces particuliers pour la publication-affichage; non, car ils ne font pas de choix ni de sélection. Ils ne possèdent pas les droits d'auteur sur les oeuvres et les informations qu'ils diffusent, mais font signer un contrat où chaque abonné leur cède des droits quasi universels et éternels (non-exclusifs!, c'est tout ce qu'ils laissent à leurs abonnés.).

Comment étudier la diffusion d'une idée, d'un document, d'une image dans Internet? Il n'y a comme pas de points fixes... Comment établir une chronologie? Comment suivre la diffusion d'un document et même d'un site? Plusieurs sites ou pages changent de nom, de serveur, de fournisseurs de services Internet? On ne connaît même pas les anciennes adresses: comment pourra-ton faire une histoire d'Internet sans ce genre d'informations?

Il faudrait créer une sorte de cadastre général du territoire numérique, divisé comme un espace géographique, avec des villes, des rues, des villages abandonnés, fermés, disparus... Il doit y avoir déjà de grandes ruines numériques: des sites complètement abandonnés depuis des années et qui pourraient le demeurer encore des années et des années.

Sur les sites de pages personnelles, comme celle de Videotron ou Sympatico, par exemple, ou les anciens Wanadoo ou Geocities. Il doit y en avoir des gigantesques aux États-Unis. Sont-ils encore en ligne? Seulement débranchés mais conservés sur des zones de serveurs oubliés, ou vraiment complètement supprimés d'Internet?

Google aurait une politique de conservation des historiques de 1 an et demi. Mais sa "mémoire cache", Google la garde combien de temps? Est-ce que chaque capture d'écran des pages "écrase" la précédente, ou s'ajoute-t-elle à une archive de chaque site? C'est un peu ce que fait la WayBack Machine...

Cette situation ressemble beaucoup à la tradition orale: origine obscure, non datée, créé par on ne sait qui, texte-document transformé tranquillement, par de petites variations qui, au bout de plusieurs transformations, devient souvent peu reconnaissable. Phénomène proche aussi de la dispersion d'une rumeur, tout se transmet par "viralité" ou par communication-publicité virale.

Dans le cadre des méthodologies employées en histoire en ce moment, Internet n'est pas indexable ni pensable ni archivable (ou presque). Quand on archive-copie une page ou un site, c'est la date de l'archivage qui est ajoutée à l'archivage et non pas sa date de "mise en ligne". Et dès que quelqu'un affiche de l'information sur un écran, une autre date de "mise en ligne" s'ajoute ou efface la première.

C'est toute la notion de chronologie qui fout le camp! Ce n'est pas une mince "disparition" pour l'histoire.

Comment établir une chronologie d'Internet?

On peut établir un chronologie de l'imprimé, mais d'Internet?
La mise à jour continuelle des informations et des documents rend la chronologie presque impossible à établir. On ne peut tout même pas conserver les archives de chaque micro-changement que l'on peut faire sur un document numérique. Que devront-nous faire pour archiver la page d'accueil d'un site? Archiver une saisie d'écran à chaque fois qu'il y a la moindre modification?

Wikipedia conserve apparemment toutes les modifications effectuées sur toutes les pages. Faudra bien élaguer tout ça un jour! Dans 5 ans, qu'est-ce que cela sera? Un immense fouillis. D'abord, comment distinguer entre une modification tout à fait mineure d'un ajout ou d'un développement essentiel? Les changements de contenus (et même là, il y a plusieurs niveaux de modifications possibles), des changements substantiels. Malgré tout l'effort des milliers de participants, les connaissances de Wikipedia vont aussi devenir obsolètes. Par exemple, la listes des liens vers d'autres articles, comment sera-t-elle mise à jour au fil et à mesure de l'évolution de Wikipedia? Faudrait avoir une encyclopédie déjà conçue qui indiquerait que le nouvel article X doit être ajouté à la liste des liens de l'article Y.

Aussi, puisque les articles sont rédigés par des individus plus ou moins associés, la mise à jour sera forcément inégale. Telle information ajoutée dans un article, par exemple, la mort de X, ne sera pas nécessairement ajoutée à un autre, ce qui fait que le nouveau mort X sera toujours vivant ailleurs dans Wikipedia. Il y aura donc différentes temporalité à l'intérieur même de Wikipedia. Une nouvelle édition de la Britannica ou d'Universalis proposait une mise à jour complète de l'ensemble de l'encyclopédie. Un bel effort même si, à la publication, elle était déjà forcément un peu décalée, surtout pour les informations factuelles.

Wikipedia deviendra de plus en plus une encyclopédie a-synchrone, où les savoirs et les disciplines s'écarteront d'un ensemble cohérent pour offrir de plus en plus de informations contradictoires, peut-être. Il y a le problème de l'exactitude de l'article en lui-même, mais il y a le problème plus fondamental de la cohérence de la totalité des informations.

Ça rejoint la question des "frontières du texte" devenues floues, incertaines qu'abordent souvent les spécialistes de textologies numériques.
Tout est brouillon, tout peut avoir le statut de brouillon, rien n'est clos, fermé, pour toujours.

samedi 19 novembre 2011

Données ouvertes SUR Montréal

Il y a des centaines de milliers, des millions de données et d'informations SUR Montréal en plus de celles que possèdent la Ville.
Voici quelques autres source de données publiques ou utilisables:

- Geoliqi a créé une application pour localiser tous les lieux dans les articles de Wikipédia

C'est fait à partir de l'API d'Infochimps pour géolocaliser toutes les données géographiques contenus dans les articles de Wikipedia

- concevoir une application qui lie ces données aux catalogue des bibliothèques de la Ville (ou d'autres base de données pour lier les articles de Wikipedia à la documentation pour les géo-positionner sur une carte interactive. En cliquant sur Place Ville-Marie, Outremont, rue Saint-Laurent... on pourrait obtenir la documentation sur ce lieu. Même application avec une timeline montréalaise: lier la documentation aux et aux événements...

Le Dictionnaire biographique du Canada contient des infos sur des milliers de Montréal

- Internet Archives permet de télécharger facilement la totalité des données bibliographiques des documents qui contiennent "Montréal" (en fichier csv)

- Google Books: l'API devrait rendre possible l'exploitation des documents liés à Montréal

Commission de toponymie du Québec (Topos): chercher tous les toponymes montréalais et créer des applications ou une carte interactive en affichant la notice sur l'histoire du lieu; ajouter des fonctionnalités Web 2.) pour que les citoyens puissent ajouter leur propre souvenirs ou documents sur les lieux montréalais.

Inventaire des lieux de mémoie de la Nouvelle-France: extraire tous les lieux commémoratifs de l'île de Montréal, les géo-positionner

Liste à poursuivre

-

Recherche dans les données des bibliothèques de Montréal

Le 19 novembre 2011 [ à l'occasion du Hackhaton de données ouvertes] , la Ville de Montréal a rendu accessible des données des catalogues de ses 43 bibliothèques. Le fichier contient des informations sur plus de 4,4 millions. En plus des données bibliographiques, certaines données sur les prêts et la circulation des documents devraient être aussi accessibles.

Voici quelques orientations et idées pour exploiter et visualiser ces données.

Tableaux-synthèses de référence à créer pour:

- global pour l'ensemble des bibliothèques : statistiques variés, dynamiques
- bibliothèque: type de doc, catégorie de sujet, etc.
- auteur et éditeur: nombre de titres, prêts
- titres: données globales, par bibliothèque...

Pour l'analyse des pratiques de lecture et culturelles des Montréalais:

1) Prêts des documents (qu'est-ce que les gens ont lu, regardé, écouté)
- total par TYPE de documents (livres, films, musique) et par SUJETS (à partir des mots-clés); outil pour approfondir la recherche par genre de documents par TYPE (romans, documentaires, thriller, etc.), par sous-catégorie de SUJET; par âge ou sexe (si disponible); par succursale

- par DATE (d'édition); par DATE du SUJET ou du TITRE (si disponible: chercher les caractères numériques (ANNÉE) dans le champ SUJET ou TITRE, ex. "1900"

- en valeur absolue; ET en pourcentage, pondéré en fonction du % de type de documents, sujets dans le catalogue globale (ex.: prêt de 40% des films, 25% des livres, 60 des films)

- nombre de prêts par documents uniques, avec une échelle X documents prêtés + de 100 fois, 75 -99 fois, 0 fois; par succursale (pour établir un profil des SUCCURSALES)

- autres possibilités: par LANGUE du documents; origine (Québec - France, autres)

- s'il y a des données sur les ACQUISITIONS: visualiser les acquisions par ANNÉE, TYPE, SUJET, succursale (pour suivre l'évolution de la politique d'acquisition)

2) Nouvelles voies de la recherche sur la documentation  et la visualisation des résultats

Les outils de recherche des bibliothèques sont souvent banals: de longue liste de résultats. Cherchez à inventer de nouveaux modes de visualisations pour la recherche par CONENU et SUJET

- total des documents par TYPE, SUJETS, ANNÉE (absolu/pourcentage pondéré); par succursale

- inventer un mode de navigation dans les SUJETS, sans moteur de recherche, uniquement visuellement, par catégorie et sous-catégorie (voir la visualisation de 3 millions d'articles de Wikipedia avec Sylverlight)

SUR Montréal

- chercher "Montréal" dans tous les champs (environ 32 000 résultats): analyser les SUJETS, et les visualiser dans différents modes: arbre sémantique, hiérarchique, chronologique

- extraires les entités nommées montréalaises (lieux, quartier, personnages historiques, événements, etc.) et les géo-positionnner sur une carte interactive; les positionner dans des chronologies générale et thématiques

Avec l'extraction et la classification des entitées nommées (dans un thésaurus, une ontologie sémantique), les possibilités deviennent extrêmement nombreuses

---
Ces sujets m'intéressent depuis longtemps. Je vous invite à me contacter pour en discuter.

Luc Gauvreau
lgovro@gmail.com




jeudi 17 novembre 2011

Une Grande Bibliothèque ouverte pour et SUR Montréal

Dans le mouvement des données ouvertes, celui des villes et des gouvernement ouverts, les informations historiques ou culturelles, contenues dans les archives de l'imprimé et les bibliothèques font souvent l'objet de peu de discussion. Les applications pratiques pour répondre aux citoyens en "real time" semblent être les plus développées, susciter le plus grand intérêt. Pourtant, les administrations municipales ne sont pas que des infrastructures matérielles, mais aussi des lieux de culture. Les bibliothèques, musées, festivals, théâtres, cinémas, parcs et jardins font aussi partie des services essentiels qu'une ville doit offrir à ses citoyens. Il faut donc aussi ouvrir les données et les informations des institutions culturelles pour que Montréal devienne une vraie ville ouverte.

Dans ce domaine, ce sont les programmes de numérisation dont on parle le plus, ou des projets en arts numériques. En ce moment, il y a des centaines de milliers pages et d'images, sans doute quelques millions, déjà en ligne, reliées à Montréal et son histoire. Cette documentation est-elle pour autant vraiment accessible, diffusée, lue?

Les ressources de données et d'informations contenues dans ces millions pages sont généralements peu consultées, sous utilisées par rapport aux multiples usages que l'ont peut en faire aujourd'hui. Les sites institutionnels dans lesquels on les consulte sont rarement autre chose qu'un entrepôt de fichiers pdf ou jpg que l'on trouve à partir d'un catalogue en ligne élémentaire, avec peu ou pas de fonctionnalités du Web 2.0. Comme si après la numérisation, il ne restait plus rien à faire. Au contraire, le vrai travail de recherche et d'innovation ne fait que commencer. On doit plutôt considérer cela comme un nouveau territoire de données à exploiter. Cela exige d'en refaire l'inventaire, l'indexation, la classification avec les outils d'extraction, d'analyse et de visualisation que nous possédons aujourd'hui.

Heureusement, il y a parfois de belle initiative. Samedi, le 19 novembre, au Hackhaton, la Ville de Montréal va ouvrir le catalogue de ses 43 bibliothèques, ainsi que des données sur la circulation des documents. C'est une excellente nouvelle! Pour étudier les pratiques culturelle des Montréalais, pour créer toutes sortes de visualisations des collections, pour intégrer les activités des abonnés dans leurs réseaux sociaux, pour explorer la documentation sur Montréal de mille façons, c'est vraiment une très stimulante initiative. C'est une porte ouverte sur d'autres manières de concevoir l'accessibilité aux bibliothèques.

En ce moment, les documents et les informations SUR Montréal sont dispersés dans plusieurs institutions: archives et services de la Ville, bibliothèques nationales (Québec, Canada), bases de données gouvernementales, centres d'archives, sociétés d'histoires, musées (McCord), etc. Avec l'ouverture des données et l'interopérabilité croissant des systèmes de gestion des bibliothèques, les millions de pages "montréalaises" déjà numérisées par Google Books, BAnQ, Internet Archives, Notre mémoire en ligne, il est maintenant possible de regrouper toute cette documentation dans une seule base de données. Tous les documents, données et informations du domaine public pourraient être accessibles à travers un API pour créer la Grande Bibliothèque Ouverte Numérique de Montréal. On peut aussi imaginer de nouvelles bibliothèques pour réunir "virtuellement" toute l'information disponible par arrondissement, quartier, lieu, événement.

- participation de BAnQ au mouvement de l'Open bibliographic data: libre accès aux données et au fichier autorité
- partage de la documentation (données et fichiers numérisés) sur Montréal avec la Ville, d'autres institutions, les citoyens
- s'associer à la communauté de développeurs pour accroitre la diffusion de la culture québécoise et de l'information sur Montréal
- initier un large débat sur l'utilisation des oeuvres et des documents du domaine public, par le milieu scolaire, les éditeurs, les développeurs, les citoyens
- accueillir un prochain Hackhaton dans le grand hall de la Bibliothèque pour inventer de nouvelles façons de lire, d'écouter, d'organiser l'information historique et culturelle SUR Montréal.

Les élections ont lieu du 22 au 27 novembre 2011, en ligne, sur le site de BAnQ. Pour plus d'informations et voter, visiter le site internet:

Je vous remercie de votre appui,

Luc Gauvreau
-

lundi 14 novembre 2011

Élection au CA de BANQ

J'ai posé ma candidature pour représenter les usagers de l'île de Montréal au conseil d'administration de Bibliothèque et Archives nationales du Québec. Quinze autres personnes ont posé leur candidature...

J'aimerais compter sur votre appui.

Amateur de livres et de bibliothèques depuis l’école primaire, j’aimerais mettre mon expérience aux services des abonnés montréalais de BAnQ pour en faire une institution encore plus accessible, mieux branchée sur les ressources du numérique. Depuis plus de 20 ans, j’ai utilisé tous les services des bibliothèques, des microfilms aux bases de données, et j’ai consulté toutes les collections, des cartes postales aux archives privées. Je m’intéresse maintenant aux mutations de l’écrit et de l’imprimé vers le numérique.

Pour lire la suite de ma présentation, je vous invite à la consulter sur le site de BAnQ.

Pour avoir le droit de vote, il faut: habiter sur l'île de Montréal, avoir
18 ans et plus, être abonné à BAnQ.

Le scrutin électronique aura lieu du 22 novembre à 10 h au 27 novembre à 17 h.

Merci de faire circuler cette information parmi vos amis, vos réseaux sociaux, vos contacts.

Je vous remercie de votre soutien,

Luc Gauvreau

jeudi 10 novembre 2011

Le Montréalscope (version complète)

Au Web In 2011 consacré au Web du futur, organisé par l'Alliance numérique, tous les conférenciers avaient 10 minutes pour exposer leurs projets et leurs idées: c'est pas long! Mais cela a donné un rythme stimulant à la journée.
Pour voir et lire ma présentation complète du Montréalscope, il m'aurait bien fallu 20 ou même 30 minutes. Vous pouvez juger par vous-même.
Pour lire mes commentaires, cliquer sur la roulette des options et Afficher les commentaires. L'affichage plein écran est meilleure.
C'est un projet in progress, comme on dit. Tous les commentaires sont bienvenus. Merci!


mardi 1 novembre 2011

Le Montréalscope: histoire données au futur

Au Web In 2011, organisé par Alliance numérique, j'ai présenté une proposition pour organiser et observer la totalité des informations sur Montréal et son histoire:

Le projet du Montréalscope propose d'ouvrir un chantier numérique pour construire le premier territoire virtuel urbain, l'espace structuré de la totalité des données de l'histoire et du présent de la ville. C'est une plateforme pour inventer un nouveau Grand Montréal, une hyper-réalité augmentée, un lieu d'échange commun d'exploration, de découvertes, d'aventures culturelles et technologiques.
Les bibliothèques conservent les données de millions de textes. La numérisation des imprimés ouvre les livres et rend possible l'extraction des informations qu'ils contiennent.
Le défi est aujourd'hui d'entreprendre un séquençage des écrits humains pour lier les données publiées dans l'imprimé aux « Big Data » diffusées en temps réel dans le Web et les réseaux sociaux. (Présenté par Luc Gauvreau; conception visuelle: Irène Ellenberger)


La semaine prochaine, toutes les conférences devraient être en ligne dans le site du Web In.

vendredi 2 septembre 2011

Métaphores du livre

Au Moyen-Âge, le monde était le Grand Livre de Dieu dans lequel on apprenait à déchiffrer le sens qu'Il y avait mis tout en ayant foi dans les mystères que ce Livre divin contenait. Aujourd'hui, le livre n'est plus une métaphore structurante du monde ni même de la connaissance. C'est plutôt le livre qui est comme la Grande Toile, comme le Web, fait de relations, de liens. Un dictionnaire (imprimé sur papier) est vu maintenant comme un document numérique dans lequel les liens hypertextes sont réalisés en tournant les pages plutôt qu'en appuyant sur le museau de la souris.

À quel moment le comparant "livre" est-il devenu un "comparé"? Que cela signifie-t-il? Certainement, un changement en profondeur dans la place qu'il occupe dans la culture.

L'idée d'une Église catholique contre le livre et la lecture est toujours paradoxale. Si elle a mis en place l'Inquisition et toutes sortes de politique de censure à travers le temps et les pays, c'est que l'Église croyait dans les pouvoirs du livre, des livres: elle était bien obligée avec la Bible comme fondement.

Si on s'élève aujourd'hui contre toute forme de censure du livre, des idées ou des paroles, ce n'est pas que pour des raisons de libertés individuelles. C'est aussi parce que la croyance dans les pouvoirs du texte et du livre a beaucoup diminuée sinon disparue. Pourquoi mettre en place tout un système d'interdiction de l'écrit si on ne lui reconnaît pas le pouvoir de modifier les esprits ou de les changer? Pourquoi interdire un livre quand on ne croit pas qu'il puisse changer quoi que ce soit? Pourquoi le ferait-on?

Les termes, les images et les métaphores pour décrire Internet ont envahi le domaine des métaphores: réseau, toile, navigation, discontinu, fragmentaire, aléatoire, virtuel, numérique, lien, non-linéaire, connexion, etc. Internet a re-métaphorisé un lexique ancien appartenant à d'autres domaines de l'activité humaine: naviguer et toile par exemple, empruntés à la marine, ont acquis d'autres significations dans le domaine des NTIC. On pourrait chercher dans le Petit Robert numérique les termes pour lesquels on a ajouté une entrée précédée d'expressions comme "en informatique", "dans Internet", comme on mentionne "en linguistique", en "biologie", etc. Il y a des nouveaux mots, mais quels "anciens" mots ont acquis des sens nouveaux?

Dans le Grand Corpus Numérisé, comme celui auquel donne accès les Ngrams de Google, pourrait-on dessiner l'évolution du champ sémantique d'un mot-clé de la culture comme "livre", observer sa période d'extension sémantique presque impérialiste et son déclin à l'heure présente. On y observerait le parcours d'un mot au début de son usage intensif, alors qu'on le compare à quelque chose, le moment où il est le comparé. Puis, en même temps que l'accroissement de sa valeur culturelle et symbolique, le mot "livre" est devenu à son tour un comparant, une sorte de levain sémantique qu'on lie métaphoriquement à d'autres mots pour faire lever leur sens.

Aujourd'hui, ce mot-clé de "livre" redevient un simple comparé, ou pire, il connaît une sorte d'inversion sémantique de son aire métaphorique. De valorisant, il devient péjoratif: linéaire comme un livre, fermé, ou "autoritaire", monosémique, etc., comme si tout ce qui lui avait donné le pouvoir de devenir le Grand Comparant, jusqu'à créer l'équation Monde = Livre, s'estompait peu à peu, se refermait sur la culture du livre d'où il était sorti.

Le livre et disons mieux, disons le roman, au moins la longue histoire du roman occidental, a peut-être été un combat contre le chaos du monde, échevelé, discontinu, in-sensé. Des centaines d'années à construire ce que Bakhtine appelait la "maîtrise des faits dans la temporalité", de la réalité prise dans le mouvement du temps, sans début fixe ni fin déterminée. Comment dans ce temps sans commencement ni fin, sans programme ni finalité, raconter une ou des histoires, les faire tenir entre quelques-unes ou des centaines de pages? Tout le travail de générations de romanciers a été cela. Tellement bien réussi que le récit "avec un début et un fin bien déterminés" paraît être la forme naturelle du récit alors qu'il en est une de ses formes les plus construites. C'est plutôt le récit échevelé, sans queue ni tête, le récit sans début évident ni fin certaine qui est la forme "naturelle" du récit.

Les récits non-linéaires, mis en valeur dans la littérature du XXe siècle, et célébrés par tout un courant des études sur les récits de l'ère numérique, seraient peut-être plutôt qu'une avancée vers des formes plus évoluées du récit, une sorte de régression au stade primitif du récit, aussi chaotique que le monde avant que le premier véritable conteur y donne sens et lui donne des significations. Dans la persistance des récits "traditionnels", ceux qui demeurent encore et contre toute tentative les vrais seuls best-sellers aujourd'hui, ce besoin grégaire, atavique, d'opposer au désordre insensé du monde, un récit lié-liant, s'exprime l'opposition de la conscience à la réalité immédiate composée des infinies perceptions des sens et des mouvements du monde.

mercredi 4 mai 2011

Publier des bases de données

Les bases de données, terme réservé jusqu'à récemment aux professionnels de l'informatique, est devenu une expression courante, et si le gens n'en sont pas toujours conscients, une part de plus en grande de l'information dans Internet, sinon la plus grande partie, se trouve, d'une façon ou d'une autre, dans une base de données. Les pages html statiques sont de plus en plus rares. À mesure que s'étend les applications où on peut ajouter des infos en ligne, les réviser, les compléter, les supprimer, plus cela sous-entend une "base de données" ou un système de gestion de contenu organisé d'une façon similaire à une base de données relationnelles. Les profils d'usagers, les blogues, les intranets où le personnel ajoute du contenu et le modifie, s'appuient plus ou moins sur des bases de données. (Techniquement, ce n'est peut-être pas le bon terme, mais l'esprit et les possibilités sont les mêmes).

Mais, voilà, il y a, pourrait-on dire, deux modalités pour présenter le contenu d'une base de données:

-1) une base de données "statique" qui attend les requêtes de l'usager dans un moteur de recherche pour afficher une partie du contenu.

- 2) une base de données dynamique et active ou plutôt "activée" par les responsables qui affichent plusieurs contenus de la base de données dans des gabarits, des modules de publication et des formats pré-établis.

Par exemple, sur les sites des journaux et des médias d'informations, on trouve sur toutes les pages des informations de la base de données déjà "affichées" pour l'usager: chroniques, manchettes, blogues, sections, etc. Chaque page contient en fait tout un ensemble de "requêtes", simples ou complexes", pré-définies, qui affichent l'ensemble des résultats dans une structure infographique donnée dès que l'usager fait afficher la page dans son navigateur. En fait, la page d'accueil de CyberPresse ou de Radio-Canada est comme une multi-requêtes qui affiche les résultats sous le titre de chaque rubrique et section.

Par opposition, on pourrait imaginer une sorte de portail absurde où plutôt que d'affiche immédiatement les dernières nouvelles sportives, culturelles, politiques, économique, il y aura sous chaque rubrique une ptit moteur de recher où l'usager trouverait autant de petit moteur de recherche où il devrait entre une recherche pour que sa page se remplissent d'informations!!! Ce média ne survivrait pas longtemps.

Cela est absurde, et pourtant les sites des bibliothèques institutionnelles et surtout de plusieurs grandes collections de fichiers numériques sont construits souvent dans cette esprit-là ou presque. C'est-à-dire que l'information affichée est sous la responsabilité de l'usager, c'est lui qui doit travailler à faire apparaître des informations et des contenus, sinon il ne voit rien. L'usager est devant une base de données statique qui attend d'être activée.

Sur les sites commerciaux, les gestionnaires ont déjà cherché de l'information avant même qu'un usager arrive dans leur site. Ce qui s'affiche dans la fenêtre du navigateur, ce sont les données de la base pré-activée par les responsables.

Le site de Google Archives pour la recherche dans les journaux numérisés, c'est un peu, beaucoup ça. L'étonnante Timeline qui s'affiche en haut de chaque résultat s'appuie nécessairement sur une méta-requête, sur une pré-indexation intelligente de toutes les dates dans les millions de page du corpus. Google a dû chercher et indexer les 365 dates de toutes les années (2 mars 1652, 3 avril 1876, etc, pour chaque date, pour chaque année!!!) que couvre leur corpus pour pouvoir créer automatiquement une Timeline aussi performante.

À la requête simple de l'usager, comme chercher l'expression "New France", s'ajoute une requête extrêmement complexe de la recherche des occurrences de ce terme, croisées avec la multitude des dates que l'on trouve à une certaine "proximité" sémantique de "New France". En fait, il est difficile de savoir comment Google a procédé, mais une chose est sûr: la requête simple de l'usager y est multipliée par le travail de formalisation et d'indexation réalisés avant qu'il la fasse.

Une fois liée à la méga-requête de la Timeline de Google, l'usager n'a plus à faire d'autres requêtes pour préciser la période historique qu'il veut couvrir, puisque Google y a déjà pensé. Mieux que ça, on peut imaginer une équipe d'historien construire des thésaurus thématique sur des grands événements ou des plus petits pour que la Timeline fasse apparaître non pas les seuls occurrences d'une expression à travers les années et les siècles, mais tout un réseau de mots-expresssions distribués sur des durées longues et courtes.

samedi 23 avril 2011

Voyage dans les lieux de mémoire de la Nouvelle-France

Le projet d'inventaire des lieux de mémoire de la N-F par le Célat est très avancé et intéressant. Comme souvent, l'interface n'a pas la qualité et de la richesse de la recherche: les universitaires sont habitués à travailler à la dure, sans beaucoup de flafla. Les informations données sont souvent exhaustives, parfois dans les moindres détails du dépouillement; plusieurs clics avant de voir ce qu'on veut voir. La norme serait 3 clics: plus que ça, les gens ne cliquent plus. On peut se demander si même d'autres chercheurs y trouvent vraiment leur compte. Critique secondaire par rapport à la valeur de la recherche et au but du projet...

Il y a tout de même là une question de fond: est-ce que les sites de recherche, où sont affichés-diffusés les résultats, reçoivent le soutien éditorial pour vraiment les mettre en valeur? N'importe quelle publication de recherche sur papier tombe aujourd'hui dans les mains de professionnels: éditeurs, graphistes, rédacteurs, imprimeurs, etc. On n'a qu'à voir comment la mise en page des revues savantes a évolué, comme Voix et images, ou les titres de Nota Bene.

Quand on regarde les sites qui publient les résultats de recherche, ceux qui auraient le potentiel de rejoindre un assez grand public, on a l'impression de revenir en arrière. La qualité de l'ergonomie, du design, de l'infographie n'est pas à la hauteur de la recherche ni des équivalents sur papier. Les presses universitaires devraient développer des expertises en édition numérique pour concevoir les sites de recherche et agir comme de vrais éditeurs comme elles le font auprès des chercheurs qui leur envoient un bon gros manuscrits en fichier Word.

Il y a aussi une problématique nouvelle, celle de publier des informations et des données qui sont des base de données, et ne s'affichent qu'à partir d'une requête de l'usager. La quantité d'informations affichées peu varier considérablement: imprimées, les informations sont toujours identiques d'un usager à l'autre. Il y a donc une sorte d'esthétique propre à l'usage des BD (base de données) à développer: une esthétique du moteur de recherche et de l'appareil des requêtes et une esthétique de l'affichage des résultats. Le numérique donne aussi la possibilité à l'usager d'ajuster les deux éléments selon ses intérêts et ses préférences: recherche simple, complexe, résultats élémentaires ou complets.
Ces deux esthétiques vont beaucoup influencer le type et le nombre d'usagers.
Dans le contexte où chaque personne branché utilise de nombreux moteurs de recherche et se familiarise avec des sites très populaires, tous les sites sont en concurrence avec les meilleurs. On délaisse les sites peu performants, même au contenu intéressant. On se tourne vers les sites aux ergonomies les plus conviviales: c'est comme ça. Et un site fabuleux mais mal conçu n'y pourra rien.

mardi 8 mars 2011

Exercice de recherche prospective... Corpus amériquain et européen

(Une première version de ce projet a été écrite dans la cadre d'échanges avec Christian Vandendorpe, auteur de Du papyrus à l'hypertexte. Essai sur les mutations du texte et de la lecture, Montréal, Boréal & Paris, La Découverte, 1999, 271p.)

À partir de Google Archives qui a indexé toutes les dates (la frise chronologique n'est plus affichée maintenant), j'ai essayé quelques requêtes personnelles. Je me suis d'abord branché à Google Books pour sélectionner 50 titres des Éditions du Septentrion (spécialisée en histoire Canada-Québec) et je les ai ajoutés à Ma Bibliothèque personnelle Google Books. Ensuite, j'ai paramêtré "Éditeur = "Éditions du Septentrion", et voici ce que j'ai cherché et trouvé à partir de "Grandes Questions". Évidemment, l'échantillon est arbitraire, non scientifique, et les résultats en soi sont trop incomplets pour permettre des conclusions précises.

Je voulais plutôt tester une méthode de recherche et d'extraction de données "sémantiques".

Grande Question I

1) Pourrait-on construire une base de données biographiques/généalogiques des habitants de la Nouvelle-France à partir de 10 millions de pages?
(Mon échantillon est de 50 ouvrages, entre 10 000 et 15 000 pages). Dans les listes suivantes: sujet de recherche = total des résulats trouvés:

- "né à" = 166 lieux de naissance d'homme (précédé ou suivi des noms de personne)
- "née à" = 66 lieux de naissance de femmes
- "il meurt le" = 30 dates de décès d'hommes
- "la mort de" = 222 décès
- "le fils de" = 119 noms d'homme et relations fils-parents
- "la fille de" = 85 noms de femmes et relations filiales
- "grand-père de" = 37 noms d'hommes et relations filiales

- "âgé de" = 120 repères biographiques masculins
- "âgée de" = 60 repères biographiques féminins
- "étudié à" = 33 infos sur les études de X dans le lieu d'enseignement Y
Etc, etc...

La méthode serait la suivante:

- sur le plan lexical, on établit une liste de «mots-chercheurs» et leur réseau de synonymes
- lié à un lexique encyclopédique des noms Autorité des toponymes, anthropoymes, etc.
- sur le plan grammatical, on "lemmentise" les expressions (né, naquit...), on varie selon le genre (elle/il) et le nombre
- sur le plan syntaxique, on schématise les structures pertinentes et joue de la permutation: la/le(s) fils/fille(s); enfant(s), etc.

À partir de ces données brutes, on crée des sous-requêtes pour trouver les informations associées ("fils de" + Nom Propre) pour raffiner autant qu'on peut la cueillette d'infos. On étiquette chaque résultat, puis on filtre, vérifie, corrige, identifie les doublons, supprime de fausses occurrences, et on commence à construire une base généalogique, un dictionnaire biographiques des habitants de la Nouvelle-France, et un index général qui indiquent les textes où ils sont mentionnés. (Après quelques mois de travail!)

Grande Question II

2) À partir d'un sous-corpus de la totalité des textes de découvertes et d'exploration (multilingues), peut-on tracer la carte la plus complète de leur déplacement chronologique dans le territoire du Nouveau Monde?
Pour ce faire, il faudrait répertorier tous les indices temporels possibles:


- "lundi le" = 27 lundi historiques
- "en juin" = 200 événements
- "au mois de" = 130 dates et événements
- "aux années" (trouvent les expressions comme "jusqu'aux années 1950") = 80 événéments
- "avant 1760" = 21 évéments ou interprétations d'avant la Conquête
- "après 1760" = 20 évéments ou interprétations d'avant la Conquête
Etc., etc.

Ensuite, il faudrait considérer la durée des événements (je n'ai pas retenu le total des résultats pour toutes les autres recherches après avoir trouvé la "méthode"):

- L'expédition dura deux ans et quatre mois
- un procès qui dura douze ans
- une bataille qui dura toute la journée
- Le trajet dura quatre heures
- l'incendie ne dura pas plus d'une heure
- Cette association ne dura que ces deux années-là
- son gouvernement, qui dura de 1887 à 1891
- Pendant la semaine que dura la bataille
- La grève des enseignants dura deux mois
- Etc., etc. 

La structuration de ces résultats montre qu'on pourrait créer une table de concordances exploitée de cette manière, avec un logiciel qui saisirait le substantif-événement-sujet placé avant le verbe et le(s) substantifs temporels compléments circonstanciels de temps placés après:

- trouver les verbes, expressions, locutions qui indiquent des déplacements
- "embarque sur" = permet de trouver 34 noms de bateaux, des voyages en train, etc
- "arrive à" et "arrivé à" = 372 lieu d'arrivées
- "partit de" = 24 lieux de départs
- "le voyage de" = 83 voyages + nom propre et/date
- le voyage de Carton de Wiart
- le voyage de nôtre Capitaine Jacques Quartier
- Le voyage de retour commence le 6 juillet 1672
- le Voyage de Pehr Kalm au Canada en 1749
- le voyage de Montréal à Walla Walla
- Le voyage de messire Brady n'est pas moins de trois jours et de 24 lieues de
route
- Au temps de Frédéric, le voyage de Montréal à Sainte-Anne-de-Beaupré par bateau
dure trente-six heures [très riches données temporelles et spatiales en un seul énoncé]
"il s'établit" = 36 "établissements" + Noms
il s'établit lui-même à La Hève
il s'établit d'abord sur la rue du Parloir
À partir de la banque terminologique de la Commission de toponymies et d'autres inventaires officiels, on indexerait tous les toponymes. Il y a peut-être même un programme d'analyse linguistique qui pourrait trouver les lieux: si on cherche "où", on trouve des "lieux", etc. Le temps et l'espace ont des champs lexicaux larges mais définis: années, mois, moment, jours, avant, pendant, après, etc.; maison, colline, rivière, port, ville, paroisse, comtés. Un programme pourrait de cette manière recueillir des données fabuleuses. Ça deviendrait une base d'une recherche, une collection de matériaux linguistiques, des sources d'analyses. Je parle surtout de documents historiques, mais la même chose pourrait être fait dans un Grand Corpus Littéraire Numérisé. Qu'est-ce que cela pourrait signifier et nous apprendre? Qui sait? Quand on aura ces données, on les fera parler. Ensuite, on pourrait superposer les résultats de l'univers fictif sur celui de l'histoire réelle. On pourrait étudier alors sur une très grande échelle la "mimesis".

Grande Question III

3) Que peut-on savoir de la vie économique en Nouvelle-France à partir de la recherche dans le fonds numérisé sur l'Amérique française. Suivant la même méthode:

- "où il achète"
- Le 28 septembre 1697, il achète du marchand Pierre Lamoureux de Saint- Germain deux emplacements
- En décembre 1678, il achète du maïs
- "où il vend"
- En 1736, il vend encore un navire à Benjamin
- il vend ses produits en gros à un autre marchand local
- il vend la terre à Jean-Baptiste, offrant ainsi à l'ancien esclave
- il vend de nombreux emplacements de 10 par 30 mètres
- le tailleur Lizée afin qu'il paie les 8 livres qu'il devait pour un habit et une culotte.
- il paie 100 sous
- "prix de"
- à Olivier Cadet en 1753 au prix de 550
- il vend à Olivier Charbonneau, au prix de 200
- Les lynx qu'il rapporte sont évalué* entre 6 et 15 écus, un prix de beaucoup inférieur
Le prix de la pension est de 120 livres par année
- Etc. etc.

On recueille donc ainsi la totalité des informations économiques brutes pour un corpus donné, pour une époque donnée.

L'objectif général

D'abord, je ne dis pas que ce genre de cueillette de données n'a jamais été faites, et les types requêtes ne sont nullement nouvelles: conditions (if, else, if not...), variables, "joker". Mais l'analyse des données textuelles-sémantiques est toujours complexe quand on veut aller plus loin que compter les occurrences. Qu'est-ce que ces exemples pourraient nous apprendre pour l'étude de Très Grands Corpus?

Peut-être le plus important. Au départ, pour développer un protocole de recherche, ce qui compte, ce n'est pas du tout la grandeur du corpus (un petit 100 000 pages serait parfait): ce qu'il faut, c'est concevoir les modules de requêtes et surtout, surtout, savoir un peu ce qu'on veut découvrir, dans quelle direction on veut chercher.

Au début de ces recherches dans les Grands Corpus, les données quantitatives vont s'imposer. On débrousse, on code, on inventorie, on compte, on fait des statistiques: on les fera faire par les ordis! Ensuite, on peut créer d'autres requêtes qui interrogent les relations que nous avons établies entre les données, commencer à tisser les réseaux de parentés, les lier aux villes et paroisses, tracer les cartes des alliances et des mariages. Ensuite, projeter ces réseaux sociaux et familiaux sur les réseaux économiques établis parallèlement. Puis, pour la période d'exploration de la Nouvelle-France, relier les deux premiers ensembles aux chemins de découvertes et d'établissement pour superposer les déplacements-explorations sur la vie économiques et les réseaux de parentés. C'est dans ce genre de projet que des applications de crowdsourcing seraient les plus utiles: il y a un cadre de recherche structuré, "pré-digéré", par des experts; ensuite, on stimule et encourage la participation des collectivités intéressées.

Avec toutes ces informations et données représentées sur une carte branchée sur une géo-chronologie, on pourrait reconstituer sur la base d'un Très Grand Corpus Documentaire, l'établissement des communautés francophones en Amériques. On met le curseur à 1534, on clique et on voit à l'écran se dérouler l'établissement des communautés françaises en Amérique.
Je simplifie à l'extrême la complexité et peut-être même la faisabilité d'un tel projet, mais il n'est pas du tout sûr qu'on peut prouver scientifiquement que cela soit impossible...

Comment?

- comment brancher à grande échelle le milieu sur les nouvelles sources documentaires
- comment brancher les ressources documentaires les unes avec les autres

L'autre point serait comment auto-brancher le milieu de la recherche sur lui-même, interconnecter, réseauter organiquement les chercheurs, les amateurs, les non-experts.

Dans l'évolution des ;échanges et des modes de production de la recherche, n'aurait-on pas besoin d'un réseau supra-institutionnel pour regrouper les chercheurs entre eux, liés par leurs travaux et intérêts, leurs publications (et non seulement par leur lien institutionnel), branchés sur leurs publications, etc.