- Kagi intègre Small Web à la recherche, à un site web, au RSS et à une API afin de remettre en lumière les contenus web personnels enfouis sous la publicité et la commercialisation
- Small Web désigne un web non commercial créé par des particuliers pour l’expression de soi et le partage de connaissances plutôt que pour le profit ; Kagi a sélectionné environ 6 000 sites web et collecte leurs nouveaux contenus
- La recherche Kagi s’appuie sur les index Teclis et TinyGem pour afficher aussi des articles de blogs personnels, même avec des requêtes générales comme
swiftuiouapple watch - Le nouveau site Kagi Small Web fonctionne sans JavaScript et permet de laisser un “appreciate” sur les articles ou d’écrire des notes publiques qui disparaissent après environ une semaine
- Les opérateurs de sites peuvent participer via la liste de curation sur GitHub, le site de feedback et Discord ; le RSS est mis à jour toutes les 5 heures et l’API est proposée à 2 dollars pour 1 000 requêtes
Le web visé par Kagi Small Web
- Kagi Small Web est une initiative lancée par Kagi pour créer un web plus humain
- “Small Web” n’a pas de définition unique, mais désigne généralement un web non commercial créé pour l’expression personnelle ou le partage de connaissances plutôt que pour le profit
- Le concept rejoint l’esprit du web des débuts, moins commercialisé, avant que les modèles économiques fondés sur la publicité ne dominent Internet
- Pour approfondir, Ben Hoyt présente The Small Web is Beautiful, et une liste d’articles connexes est également liée dans le dépôt GitHub
Comment les contenus sont collectés et exposés
- Kagi Small Web rassemble les articles publiés au cours des 7 derniers jours depuis une liste de blogs sélectionnés manuellement, et les affiche par plusieurs canaux
- Ils apparaissent automatiquement dans les résultats de recherche Kagi pour les requêtes pertinentes
- Ils sont consultables sur le site Kagi Small Web
- Ils sont fournis sous forme de flux RSS
- Ils sont inclus dans la news enrichment API de la Search API
- Les membres Kagi existants n’ont aucun réglage particulier à effectuer pour voir les contenus Small Web dans les résultats de recherche
- Cette expérimentation a été inspirée par une discussion sur Hacker News et a commencé fin juillet en faisant apparaître les articles de blogs d’utilisateurs de HN dans les résultats de recherche
- La liste de curation actuelle comprend environ 6 000 véritables sites web tenus par des personnes aux centres d’intérêt variés
- L’ensemble de l’initiative et la liste des sites sélectionnés sont publiés sur le GitHub de Kagi
Le web personnel intégré aux résultats de recherche
- Kagi affichait déjà des contenus Small Web via ses propres index de recherche Teclis et TinyGem
- Avec cette intégration, les contenus web de qualité mais peu connus deviennent plus directement un élément différenciant des résultats de recherche Kagi
- Exemples de recherche
- Une recherche
swiftuiaffiche un article SwiftUI lié à iOS 17 publié sur le blog “Use Your Loaf” de Keith Harrison - L’URL d’exemple de recherche Kagi a été générée avec la fonctionnalité Share this Search, ce qui permet même aux utilisateurs sans compte Kagi de voir les résultats
- Une recherche
apple watchfait aussi apparaître un article récent publié sur le blog “Screaming at My Screen” de Timo - Dans les mêmes résultats, l’article de 2015 Apple Watch Pixels apparaît également via l’index Teclis
- Une recherche
- Contrairement aux résultats dominés par de grands sites, ce type de résultats aide à découvrir des points de vue plus variés sur un même sujet
Le site Kagi Small Web
- Le site Kagi Small Web est une nouvelle plateforme destinée à mettre en avant les contenus récents du Small Web qui passent facilement inaperçus dans les moteurs de recherche classiques
- Le site fonctionne sans JavaScript, conformément à l’esprit du Small Web
- Les utilisateurs peuvent envoyer un “appreciate” à un article ou laisser une note publique temporaire
- Les notes disparaissent au bout d’environ une semaine, à mesure que de nouveaux contenus circulent
- Cette conception souligne le caractère éphémère et imparfait du Small Web
- Lors d’un accès anticipé auprès de certains bêta-testeurs du canal Discord, un utilisateur a dit que voir son blog inclus dans le flux sélectionné lui donnait envie d’écrire davantage
Critères de curation et conditions de publication
- Pour entrer dans le flux sélectionné, les critères suivants doivent être remplis
- Le blog doit contenir des publications datant d’au moins 3 ans
- Les contenus doivent être en anglais
- Le site doit proposer une expression personnelle authentique ou une forte valeur informative
- Les contenus NSFW sont exclus
- Pour qu’un article apparaisse sur le site Kagi Small Web, des conditions supplémentaires s’appliquent
- L’article doit avoir été écrit dans les 7 derniers jours
- Le site doit être compatible avec l’intégration en iframe
- Les sites non compatibles avec les iframes peuvent tout de même continuer à être indexés pour les résultats de recherche
- Le code du site est lui aussi publié en open source, et les merge requests sont acceptées
L’expérimentation Small YouTube
- Kagi propose également Small YouTube, une fonctionnalité expérimentale
- Cette fonctionnalité met en avant les contenus de créateurs YouTube émergents ayant moins de 400 000 abonnés
- Kagi recueille des retours sur ce critère
RSS, API et canaux de participation
- Le flux RSS de Kagi Small Web fournit des mises à jour en temps réel et est actualisé toutes les 5 heures
- Les utilisateurs de l’API peuvent accéder à des actualités de qualité hors des grands circuits via l’index TinyGem, qui intègre Kagi Small Web
- Le tarif est de 2 dollars pour 1 000 requêtes
- En cas de site manquant ou d’inclusion inappropriée, il est possible de contribuer à la liste de curation en suivant les directives
- Les signalements de bugs et suggestions de fonctionnalités sont à soumettre sur kagifeedback.org avec le tag
small-web - Les discussions générales ont lieu sur le Discord de Kagi
Les postulats assumés par le projet
- Si le web est fait par d’innombrables personnes, le point de départ de cette initiative est de comprendre pourquoi elles sont masquées dans les moteurs de recherche traditionnels et comment y remédier
- Les contenus explorés pouvant inclure à peu près n’importe quoi, Kagi estime que les recommander implique de faire un choix qui engage sa réputation
- Les personnes qui contribuent au Small Web créent en y consacrant du temps et des efforts, même sans garantie d’audience
- L’objectif de Kagi est de raviver un web plus humain, riche en créativité, en expression personnelle et en contenus porteurs de sens
1 commentaires
Avis sur Hacker News
Vlad de Kagi ici. Juste après la publication du billet de blog, le flux RSS s’est cassé de façon inattendue, ce qui m’a vraiment semblé dans l’esprit du small web :) Le flux est maintenant rétabli, et comme le site utilise le même flux, il fonctionne de nouveau
C’était un projet auquel je tenais personnellement, et comme l’équipe était occupée sur autre chose, j’ai mis les mains assez profondément dans le code moi-même. Quand je dis que « le flux s’est cassé », cela veut en fait dire que c’est moi qui l’ai cassé. Pour un développeur à l’ancienne, le logiciel est une affaire salissante, et j’ai aussi appris, en revenant sans cesse corriger ce que je pensais déjà acceptable, que je ne suis plus un aussi bon codeur. Le code est visible dans le dépôt lié : https://github.com/kagisearch/smallweb
Plus important encore, ce site a remplacé pour moi le besoin de découverte, et j’ai aimé la sensation de découvrir des personnes et des textes variés. Beaucoup de choses inattendues sont remontées, et j’ai eu l’impression que le Web redevenait plus proche. Il y a dans ce concept un fil d’espoir, ainsi qu’une vraie amélioration de la qualité et de la diversité des recherches
La liste des sites web inclus est consultable ici : https://github.com/kagisearch/smallweb/blob/main/smallyt.txt
Les derniers articles apparaissent déjà aussi dans les résultats de recherche Kagi pour les requêtes pertinentes : https://kagi.com/smallweb
À l’avenir, j’aimerais pouvoir chercher uniquement dans le small web, et cela pourrait peut-être être proposé plus tard sous forme de lens
Concernant les règles d’auto-promotion, je ne suis pas d’accord avec la politique actuelle. Pour les blogs anciens, même en abaissant le critère à environ un an, j’aimerais que les gens puissent les soumettre eux-mêmes. La majeure partie du Web de petite taille/indépendant manque de visibilité, donc cela aiderait. Mon blog semble avoir été collecté depuis un ancien fil « partagez vos blogs sur HN », donc il est déjà dans l’index, mais d’autres n’ont peut-être pas eu cette chance
Kagi est pour moi une réussite immense. C’est le premier moteur de recherche qui me donne de meilleurs résultats que Google, respecte la vie privée, propose de la personnalisation et davantage de fonctionnalités
C’est https://search.marginalia.nu, et il est aussi souvent mentionné sur HN : https://hn.algolia.com/?query=marginalia
Je suis client de Kagi et très satisfait. Le moteur de recherche est étonnamment bon, et cette fonctionnalité me conforte encore davantage dans mon choix de moteur de recherche
La phrase « Ces notes seront remplacées par du nouveau contenu au bout d’environ une semaine et disparaîtront. Cela souligne le caractère éphémère et imparfait du small web. » revient simplement à dire que Kagi ne veut pas ajuster les notes ni les conserver durablement. Inutile de dénigrer le small web. Beaucoup de petits sites conservent très bien leur contenu
Kagi dispose peut-être de données sur la fréquence à laquelle les sites tombent, mais d’après mon expérience, même le contenu des grandes plateformes disparaît souvent, y compris quand ce n’est pas simplement parce que son créateur l’a oublié. Les sites du small web créés par des personnes qui s’en soucient ont au contraire de bien meilleures chances de durer longtemps
Ce serait bien que Kagi Small Web ait une interface ActivityPub, afin qu’on puisse ajouter les sites les mieux notés de la journée à sa timeline Mastodon ou Lemmy
Kagi vaut largement son prix. Je l’utilise comme moteur de recherche principal depuis six mois, et pendant cette période je crois avoir utilisé Google
!gune dizaine de fois.Cela dit, j’utilise beaucoup la recherche, et je lance souvent des recherches par erreur, donc je dépasse assez souvent chaque mois le volume de recherches de l’offre « Pro », ce qui est dommage. Heureusement, il existe au moins l’option d’acheter des recherches supplémentaires sans passer à l’offre illimitée, qui est assez chère.
Les résultats de recherche sont systématiquement meilleurs qu’ailleurs, y compris que DuckDuckGo, et je resterai donc un client payant satisfait.
Cela me rappelle un peu la première fois que j’ai découvert Google, à l’époque d’AltaVista.
En plus, Searx prend en charge beaucoup plus de moteurs de recherche et je peux le configurer exactement comme je le souhaite.
Kagi a clairement de bonnes intentions et un bon produit, donc j’espère que cela marchera pour eux, mais je préfère une solution open source auto-hébergée équivalente, même moins peaufinée et avec moins de fonctionnalités, à un SaaS propriétaire qui oblige à créer un compte.
Modification : en fait, je me trompais. Kagi a aussi son propre crawler et son propre index : https://help.kagi.com/kagi/search-details/search-sources.html Cela dit, je n’ai pas l’impression que les résultats de Searx soient insuffisants, donc je ne manque pas grand-chose.
Ce qui m’inquiète avec Searx, et en partie avec Kagi, c’est que des tiers peuvent bloquer ce genre de requêtes API à tout moment ; Searx deviendrait alors inutilisable, et les résultats de Kagi pourraient devenir moins pertinents. Je ne sais pas si cette approche est durable pour créer un moteur de recherche, mais j’apprécie beaucoup l’attitude de Kagi et de Searx vis-à-vis de la publicité. Utiliser les moteurs de recherche grand public via son propre frontend est, même en étant généreux, une expérience frustrante.
C’est précisément pour ce genre de choses que je suis vraiment content d’être abonné à Kagi. Non seulement j’en tire de la valeur, mais cela montre aussi que l’argent que je paie sert à faire évoluer Kagi dans une direction avec laquelle je suis d’accord.
Par comparaison, Spotify n’est qu’un de mes abonnements, mais il me donne l’impression d’être hostile. Je paie, mais si j’avais le sentiment qu’il existe une alternative, je résilierais immédiatement.
J’apprécie énormément le fait que ce que j’ai l’impression d’acheter corresponde à la direction prise par le développement de Kagi.
Spotify est vraiment hostile et manipulateur, et terrible pour les artistes. De mon point de vue, l’écran d’accueil est excessivement commercial, et l’interface CarPlay est franchement un désastre hostile à l’utilisateur, au point d’être dangereuse.
TIDAL est plutôt bon à bien des égards. Il rémunère aussi correctement les artistes et les recommandations sont correctes. Mais l’app traîne depuis des années des bugs stupides, dont le plus agaçant est que, lorsque l’on lance la lecture aléatoire d’une playlist, l’interface ne mélange qu’une dizaine de morceaux pré-mis en cache en haut de la liste. Si vous essayez de lire toute votre bibliothèque en aléatoire, vous finissez par entendre toujours la même dizaine de morceaux.
J’aurais aimé aimer Deezer, mais l’app n’était pas terrible et il manquait plus de morceaux que je ne m’y attendais.
J’ai finalement adopté Apple Music. Comme j’utilise un iPhone, cela s’intègre naturellement bien, et l’interface CarPlay est excellente. La rémunération des artistes est aussi presque au niveau de TIDAL. Les recommandations sont suffisamment bonnes, et je n’ai pas trop l’impression que l’écran d’accueil pousse en permanence uniquement ce que les grands labels ont payé pour promouvoir. L’app Windows est épouvantable et il n’y a pas d’app Linux, mais heureusement, une très bonne app open source appelée Cider règle ce problème.
Il semble que vous supprimiez MathML des flux RSS : est-ce voulu, ou utilisez-vous un ancien outil de nettoyage qui ne le reconnaît pas ? Par exemple, le dernier billet https://www.jefftk.com/p/weekly-incidence-vs-cumulative-infections de mon flux RSS https://www.jefftk.com/news.rss contient ceci :
<math display="block"><msup><mi>e</mi><mrow><mi>k</mi><mi>t</mi></mrow></msup></math>Mais dans le flux RSS Kagi https://kagi.com/api/v1/smallweb/feed, cela apparaît sous la forme
eetkt.Modification : j’ai ouvert une issue : https://github.com/kagisearch/smallweb/issues/10
Quelques questions se posent
Premièrement, je me demande sur quoi repose le fait de favoriser les mises à jour récentes de blogs. D’après mon expérience, les mises à jour récentes donnent les résultats de recherche les plus faibles, sont plus vulnérables aux modifications ou aux liens cassés, et sont globalement de moindre qualité. Je me demande aussi si pousser les contenus récents ne risque pas d’inciter à produire des articles de faible qualité en masse pour augmenter ses chances d’apparaître dans la liste
Deuxièmement, quand on touche un peu à ce domaine, il penche toujours presque absurdement vers les blogs de tech/programmeurs. Le groupe des gens qui ont un blog et celui des gens qui s’intéressent à la programmation se recoupent fortement, mais je pense que ce serait aussi plus attrayant pour d’autres groupes si d’autres centres d’intérêt étaient mieux représentés. Je me demande si vous y avez réfléchi et, si oui, ce que vous pensez pouvoir faire
Sur le premier point, il y a plusieurs facteurs. Pour une même requête, un contenu plus récent est souvent plus pertinent, et à tout le moins sa fraîcheur évite qu’il devienne complètement hors sujet. Ce qu’un moteur de recherche doit surtout éviter, ce sont les résultats totalement non pertinents. La qualité est en partie garantie dès le départ par le fait qu’il s’agit d’une liste sélectionnée
Comme nous nous appuyons sur la technologie des flux RSS, il a été relativement facile de collecter et maintenir la liste, et il y avait aussi beaucoup de sources à utiliser comme données initiales
Se concentrer sur les articles récents peut encourager certaines personnes à écrire davantage, comme dans l’exemple mis en avant dans l’article de blog. Le Web a globalement besoin de plus de contenus non commerciaux de qualité, et c’est finalement à cela que nous voulons contribuer. Fournir une plateforme qui encourage ce comportement, même très petite, nous rapproche d’un Web que nous aimons
Sur le second point, je suis globalement d’accord. Cela dit, pour cette tentative, nous avons essayé de constituer un vivier de sites variés, et on voit par exemple beaucoup de sites liés à l’économie ou à la photographie. Au bout du compte, nous ne pouvons qu’encourager la création de contenus dans des domaines variés via des plateformes comme Kagi ou Marginalia, et espérer que cela fonctionne
Vraiment excellent ! Ces deux derniers mois, je me suis lancé personnellement dans un parcours d’exploration de liens du small web. Tout a commencé avec le post HN « Ask HN: Pouvez-vous partager votre blog personnel ? », et j’ai découvert que quelqu’un avait aussi créé un site regroupant les liens de ce fil : https://dm.hn/
J’ai exporté les 1 651 liens de blogs dans un fichier XLS, puis, de temps en temps, j’en ouvre 5 à 7, je lis des articles au hasard et je les marque comme « vus ». Jusqu’ici, j’en ai consulté 250 sur 1 651
J’aimerais que Kagi propose une fonctionnalité similaire permettant de voir au même endroit les liens vers des sites personnels collectés depuis toutes les sources
https://github.com/kagisearch/smallweb/blob/main/smallweb.txt
Merci d’avoir mis en avant un lien vers mon texte « The Small Web is Beautiful ». Je le considère comme mon manifeste personnel du logiciel, donc je suis heureux de le voir davantage promu
J’aime vraiment ce que fait Kagi Small Web. J’apprécie l’initiative qui consiste à commencer à faire remonter ce type de très bon contenu. J’espère que vous continuerez comme ça. Je pense aussi essayer la recherche Kagi
Vlad, c’est super ! Il est difficile de savoir à quel point cela aide réellement les utilisateurs ou l’entreprise, mais ça réchauffe le cœur de voir que ce genre de chose arrive encore sur l’Internet moderne
J’aimerais ajouter mon site à la liste, mais comme je bloque tous les crawlers dans
robots.txt, il semble que la soumission directe ne soit pas autorisée. Y a-t-il un moyen de l’ajouter ?Je suis d’accord pour apparaître dans les résultats de recherche Kagi, mais je ne veux pas être aspiré par Google, ChatGPT et toute la clique suivante, donc j’ai tout bloqué de la façon la plus simple