SearXNG, moteur de métarecherche Internet gratuit
(github.com/searxng)- SearXNG est un moteur de métarecherche qui interroge plusieurs sources de recherche, sans suivre ni profiler les utilisateurs
- L’installation s’effectue via le guide d’installation officiel, et les réglages détaillés sont décrits dans le guide de configuration
- Des informations supplémentaires sur l’exploitation et l’administration sont disponibles dans la section admin de la documentation SearXNG
- Le salon Matrix
#searxng:matrix.orgest proposé comme canal de contact communautaire - Le projet est distribué sous la licence GNU Affero General Public License, AGPL-3.0
Rôle de SearXNG
- SearXNG est un moteur de métarecherche
- Les utilisateurs ne sont ni suivis ni profilés sur SearXNG
Installation et configuration
- Pour l’installation, il est recommandé de consulter le guide d’installation
- Les réglages et ajustements détaillés peuvent être consultés dans le guide de configuration
- Des informations complémentaires sur l’exploitation sont rassemblées dans la documentation admin
Communauté et contribution
- Pour les questions ou les échanges avec la communauté, le canal Matrix
#searxng:matrix.orgest disponible - Pour les détails sur les contributions, il est recommandé de consulter CONTRIBUTING
Licence
- Ce projet est distribué sous la GNU Affero General Public License
- Les détails de la licence sont disponibles dans LICENSE
2 commentaires
Avis sur Hacker News
Si vous voulez rechercher uniquement dans le corps de toutes les pages de votre historique de navigation, ou seulement dans certaines pages mises en favoris, jetez un œil à DownloadNet. Son ancien nom — et peut-être celui qu’il reprendra — est « DiskerNet »
Il se greffe au navigateur pour offrir une expérience de navigation enrichie, avec une interface simple qui rappelle le Google de 1997 sans CSS. La recherche n’est pas encore très avancée, mais ça viendra, et c’est déjà assez utile
https://github.com/dosyago/DownloadNet
Il permet aussi de consulter hors ligne tout le contenu visité ou mis en favoris. C’est pratique pour naviguer normalement tout en sauvegardant les contenus dans des environnements où il faut économiser la bande passante satellite, comme les plateformes pétrolières, les navires ou le fret longue distance
Je préférerais que rien, à part mon cerveau humain, ne conserve quoi que ce soit de lié à ma navigation. Mais bon, c’est juste mon point de vue
Et je ne vois pas pourquoi cette promotion aussi flagrante a sa place ici, au-delà même du simple hors-sujet, alors qu’il s’agit d’un outil à l’opposé complet de la vie privée personnelle
Ça me rappelle le bon vieux temps. Avant Google, on utilisait des métamoteurs de recherche pour augmenter ses chances de trouver une bonne réponse au milieu des résultats de recherche spammy d’AltaVista, HotBot, Lycos et compagnie
On pouvait aussi inclure des résultats de recherche FTP, ce qui était utile à l’époque où les FTP anonymes publics étaient encore courants
Celui-ci vaut aussi le détour. Ce n’est pas Kagi, mais les résultats sont plutôt bons, et on peut l’auto-héberger avec Docker
https://felladrin-minisearch.hf.space/
C’est bien. J’aimerais qu’il y ait un moyen de bloquer certains domaines pour qu’ils n’apparaissent jamais dans les résultats
Édition : il semble qu’un ticket soit déjà ouvert
https://github.com/searxng/searxng/issues/2351
L’idée de SearXNG, c’est de fonctionner sans conserver d’état, sans session côté serveur, et sans JavaScript
Cela dit, cette approche limite certaines fonctionnalités à cause des restrictions de taille des cookies. D’autres formes de stockage côté navigateur nécessitent JavaScript
On peut toujours le faire en ajoutant manuellement une exclusion à chaque recherche, mais la liste peut devenir longue et l’expérience utilisateur n’est pas terrible
Kagi intègre cette fonction et elle est agréable à utiliser
On peut aussi utiliser l’extension de navigateur uBlacklist. Dans mon cas, le problème, c’est que tout devenait plus lent
Je n’en suis pas certain, mais j’ai l’impression qu’elle filtre les résultats réels après la recherche. Les deux méthodes ci-dessus empêchent les résultats d’être inclus dès le départ
Je l’utilise sur Firefox pour filtrer les déchets Pinterest des résultats, et il existe aussi une version pour Chrome et Safari
https://github.com/iorate/ublacklist
Si vous faites tourner ça sur une connexion Internet résidentielle, vous risquez de vous faire bloquer l’accès aux moteurs de recherche
Pour un usage personnel, il suffit de l’exécuter sur votre propre machine ou d’y accéder via un VPN. Les requêtes vers les moteurs en amont peuvent être envoyées via un proxy ou un VPN si nécessaire
Certains fonctionnent bien aussi via Tor, et d’autres peuvent passer par des tunnels commerciaux ou auto-hébergés
Si vous l’exécutez en local et que vous êtes le seul à l’utiliser, vous ne serez pas bloqué. Pour le moteur concerné, cela ressemble à peu près au même volume de requêtes qu’un usage direct
Même si quelques personnes de plus l’utilisent chez vous, ça devrait encore aller
J’ai fait tourner l’ancien searx en local pendant un ou deux ans sans aucun problème
Il existe de nombreuses instances searx hébergées publiquement. On trouve en ligne des listes d’instances publiques, et si vous cherchez un outil qui envoie chaque recherche depuis la barre d’adresse du navigateur vers une instance aléatoire, vous pouvez utiliser neocities : https://searx.neocities.org/changelog
Je l’utilise tout le temps. L’inconvénient, c’est qu’on tombe parfois sur une instance qui ne renvoie rien du tout ou dont les résultats sont très mauvais. Cela arrive moins souvent ces derniers temps
SearXNG est excellent, mais il y a quelques points à surveiller
Le faire tourner sur une machine qui fournit du NAT à plusieurs appareils peut aider à éviter le blocage par les moteurs en amont comme DuckDuckGo. S’il n’est pas possible de l’exécuter sur une IP utilisée à d’autres fins, il serait utile d’avoir une fonction permettant d’envoyer l’accès à certains moteurs en amont via un proxy distinct. Ce problème est vraiment fréquent
J’aimerais un mode de recherche 100 % littérale, où tous les mots que j’entre doivent impérativement apparaître tels quels dans les résultats. C’est peut-être l’équivalent de mettre un "+" devant chaque mot et de mettre chaque mot entre guillemets. C’est agaçant de voir des modifications de termes que je n’ai pas explicitement demandées, sous prétexte qu’il y aurait trop peu de résultats
Comme cela a déjà été dit ailleurs, j’aimerais pouvoir exclure explicitement certains domaines. Je comprends que SearXNG vise l’absence de conservation d’état, mais cela pourrait aussi être configuré via une URL dédiée, ou comme paramètre appliqué à toutes les recherches. Par exemple, quand je cherche un manuel PDF, je ne veux jamais voir de sites comme "manualslib.com"
Si ces points étaient réglés, ce serait idéal, mais à part ça, faire tourner SearXNG et recommander aux gens de l’utiliser à la place de Google a plutôt bien fonctionné
Tout le monde vante Searx, mais personnellement, j’aime bien presearch.com
Je n’ai aucun lien avec eux ni aucun intérêt financier. Et leur modèle économique fondé sur la cryptomonnaie ne m’intéresse pas non plus
En réalité, je pense que l’absence de filtrage des résultats à la Google ou Bing ne vient pas d’une posture de défense de la liberté d’expression, mais plutôt d’un manque de moyens, ou d’autres priorités plus importantes pour réussir. C’est un peu comme aux débuts d’Internet, quand les entreprises cherchaient d’abord à faire fonctionner les choses, plutôt qu’à n’afficher que des émotions positives de façade ou les bonnes formules
Quoi qu’il en soit, quand je cherche quelque chose d’obscur ou un sujet que Google filtrerait fortement, j’utilise presearch pour obtenir un deuxième point de vue. J’aimerais qu’archive.org fasse quelque chose de similaire. archive.org a une quantité énorme de données, mais l’indexation et la recherche n’y sont pas très bonnes
C’est mon outil préféré pour faire la moyenne des résultats médiocres de chacun des moteurs de recherche dominants et obtenir quelque chose de globalement utilisable
J’en ai fait mon moteur par défaut sur tous mes appareils au cours de l’année écoulée, et j’en suis très satisfait. Il n’est tombé en panne que deux fois ; une simple mise à jour a suffi à le remettre d’aplomb
Avis sur Hacker News
Je suis le créateur original de Searx, mais je ne participe plus au développement à cause des limites du concept de métarecherche. Mon nouveau projet de recherche est https://github.com/asciimoo/hister (https://hister.org/)
Hister est un indexeur spécialisé pour les sites web et les fichiers locaux, et il enregistre automatiquement les pages visitées rendues par le navigateur.
Comme il stocke le contenu intégral des pages, il permet une prévisualisation hors ligne des résultats et la fourniture des pages complètes via MCP.
Un exemple d’utilisation de MCP est disponible ici : https://hister.org/posts/give-your-ai-assistant-a-private-me...
J’en suis arrivé à la conclusion qu’un dépôt de contenu auto-hébergé combinant moteur de recherche et extension de navigateur pour extraire et stocker le contenu et les métadonnées des pages web serait la configuration idéale pour moi ; si possible, je voulais aussi du partage de contenu fédéré et l’import de contenus sous Creative Commons comme Wikipedia ou Gutenberg.
Hister semble correspondre presque exactement à ce que je voulais, et j’aimerais faire un audit du code puis le déployer dans quelques semaines.
Je ne télécharge que le titre, la description, la miniature et les champs Open Graph courants, et l’index me semble assez léger. Il contient 2 millions de pages explorées.
https://github.com/rumca-js/Internet-Places-Database
Il prend en charge les tags et le vote.
Récemment, j’ai aussi publié ma première application F-Droid.
https://github.com/rumca-js/OfflineWebSearch
https://f-droid.org/en/packages/io.github.rumcajs.offlineweb...
Depuis plusieurs années, je rassemble divers liens liés au travail et je les utilise tous les jours, surtout pour répondre à des questions aléatoires d’amis ou de collègues comme si je sortais un lapin d’un chapeau. Par exemple, si quelqu’un demande des idées de palettes de couleurs pour des graphiques de données, je peux lui fournir immédiatement des recherches scientifiques pertinentes ; pareil pour des algorithmes peu connus.
Avec le temps, ma collection est devenue assez volumineuse et trouver ce qu’il faut est devenu très pénible ; je me demande si ce projet conviendrait bien à mon problème.
Ça ressemble à un outil clé pour fournir de la recherche aux modèles locaux.
Je me demande quelles configurations les autres utilisent pour offrir cette fonctionnalité.
Depuis la sortie du modèle Gemma quantifié à 24 milliards de paramètres, les appels d’outils fonctionnent bien sur une 4070 Ti Super, et grâce à ces appels d’outils réussis, l’environnement local est enfin devenu utilisable.
À noter que je parle dans un contexte général, pas spécifiquement pour le codage.
curletjq.C’est tout en bas de cette page : https://docs.searxng.org/admin/settings/settings_search.html
llama-server, par exemple.Open WebUI propose une intégration avec SearX et d’autres fournisseurs, mais les résultats que j’ai obtenus n’étaient pas très impressionnants.
J’utilise SearXNG comme moteur de recherche Internet par défaut depuis plus de 5 ans, avec aussi des solutions de repli comme le backend YaCy. Avec cette configuration, je construis aussi de la recherche dans des documents internes ou des applications RAG, et SearXNG prend également en charge les résultats JSON
Il y a toutefois des inconvénients à accepter au nom de la confidentialité. C’est plus lent et la qualité des résultats est inférieure à celle d’autres moteurs de recherche, mais pour la plupart des requêtes c’est assez rapide et assez bon
Il arrive que des moteurs comme DuckDuckGo ou Brave bloquent la recherche et imposent de résoudre un CAPTCHA ; utiliser une clé d’API permet d’éviter cela
Avec son propre backend, on peut donner la priorité à certains résultats : par exemple, si l’on a crawlé le small web ou des sites importants pour soi, ces sites apparaissent en haut des résultats de recherche
Je me demande si tu fais tourner une instance YaCy toi-même « très rapidement », ou s’il existe une configuration particulière
D’après mon expérience, YaCy diffuse lentement les résultats en streaming pendant environ 30 secondes, ce qui ne convenait pas vraiment comme backend SearX
Je sers aussi en local, avec
kiwix-serve, des fichiers ZIM de Wikipedia, Wiktionary, Gutenberg, ArchWiki, etc., mais le moteur de recherche Kiwix [0] renvoie lui aussi beaucoup trop de résultats et pollue la page de résultats SearX, donc il ne convient pas vraiment comme backendJe n’ai pas encore essayé de connecter SearX à une instance Recoll locale [1]. Recoll ne prend pas en charge l’indexation des fichiers ZIM, mais il pourrait être utile pour d’autres documents HTML archivés
La recherche est difficile à bien faire ; s’il existe une configuration qui fonctionne vraiment bien, j’aimerais en savoir plus
[0] https://kiwix-tools.readthedocs.io/en/latest/kiwix-serve.htm...
[1] https://docs.searxng.org/dev/engines/online/recoll.html
J’utilise SearXNG depuis plusieurs années. À cause de la censure réseau inhumaine du GFW et de la détection de proxy par les moteurs de recherche, je n’exploite pas ma propre instance et je m’appuie sur la liste des instances publiques [1] et sur libredirect [2]
Le service d’une instance donnée n’est pas garanti, mais on peut passer en moins d’une minute, quasiment sans coût, à une autre instance disponible
Il est difficile de dire que SearXNG aide à se dégoogliser. Un métamoteur de recherche appelle d’autres moteurs de recherche, comme Google, pour collecter les résultats
Cela dit, avec SearXNG, on peut vite éviter des choses comme les résumés par IA
[1] https://searx.space
[2] https://github.com/libredirect/browser_extension
Il faut souvent aller dans les paramètres pour désactiver les moteurs de recherche qui ne fonctionnent pas, ou sélectionner ceux qui marchent bien. En général, c’est parce que l’instance est bloquée, ce qui pose un problème de fiabilité
Les moteurs qui fonctionnent varient d’une instance publique à l’autre, donc même enregistrer un hash de configuration ne marche pas toujours
Ce serait bien que SearXNG ajuste automatiquement les moteurs de recherche à afficher en fonction de leur fiabilité, ou propose une option de ce type
Je l’auto-héberge depuis plusieurs années comme moteur par défaut pour toutes mes recherches, et je le recommande vivement
TinySearch enveloppe SearXNG et fonctionne bien pour les agents. C’est mieux que le MCP SearXNG natif, car il optimise le contexte avant qu’il n’atteigne l’agent et évite ainsi de gaspiller des tokens
https://github.com/MarcellM01/TinySearch
Connecté à l’API Brave Search, cela fonctionne bien, mais utilisé comme scraper, c’est assez instable. Google a cessé de fonctionner depuis quelques jours
J’ai créé https://github.com/denysvitali/searxng-mcp pour l’utiliser comme MCP avec des agents de codage. Cela fonctionne très bien jusqu’à ce qu’on atteigne les limites de requêtes d’un fournisseur, par exemple DuckDuckGo
Pour l’exécuter, il faut aussi un serveur SearXNG ; dernièrement, je me suis donc orienté vers une solution autonome, https://github.com/denysvitali/search-mcp
[1]: https://github.com/nikvdp/searxng-ai-kit
J’aime beaucoup SearXNG depuis un moment. Mon antipathie envers Google n’a fait que croître, et c’est excellent de pouvoir chercher en évitant que de petits modèles d’IA ou choses du genre soient installés sur mon PC sans mon consentement
J’ai toujours aimé cet outil, mais je reste partagé sur le gain de confidentialité quand la recherche est envoyée non pas à une entreprise, mais à 280 entreprises