1 points par GN⁺ 2024-04-07 | 2 commentaires | Partager sur WhatsApp
  • SearXNG est un moteur de métarecherche qui interroge plusieurs sources de recherche, sans suivre ni profiler les utilisateurs
  • L’installation s’effectue via le guide d’installation officiel, et les réglages détaillés sont décrits dans le guide de configuration
  • Des informations supplémentaires sur l’exploitation et l’administration sont disponibles dans la section admin de la documentation SearXNG
  • Le salon Matrix #searxng:matrix.org est proposé comme canal de contact communautaire
  • Le projet est distribué sous la licence GNU Affero General Public License, AGPL-3.0

Rôle de SearXNG

Installation et configuration

Communauté et contribution

  • Pour les questions ou les échanges avec la communauté, le canal Matrix #searxng:matrix.org est disponible
  • Pour les détails sur les contributions, il est recommandé de consulter CONTRIBUTING

Licence

  • Ce projet est distribué sous la GNU Affero General Public License
  • Les détails de la licence sont disponibles dans LICENSE

2 commentaires

 
GN⁺ 2024-04-07
Avis sur Hacker News
  • Si vous voulez rechercher uniquement dans le corps de toutes les pages de votre historique de navigation, ou seulement dans certaines pages mises en favoris, jetez un œil à DownloadNet. Son ancien nom — et peut-être celui qu’il reprendra — est « DiskerNet »
    Il se greffe au navigateur pour offrir une expérience de navigation enrichie, avec une interface simple qui rappelle le Google de 1997 sans CSS. La recherche n’est pas encore très avancée, mais ça viendra, et c’est déjà assez utile
    https://github.com/dosyago/DownloadNet
    Il permet aussi de consulter hors ligne tout le contenu visité ou mis en favoris. C’est pratique pour naviguer normalement tout en sauvegardant les contenus dans des environnements où il faut économiser la bande passante satellite, comme les plateformes pétrolières, les navires ou le fret longue distance

    • Je ne vois absolument aucune documentation indiquant quels navigateurs sont pris en charge
    • Je comprends mal pourquoi quelqu’un que ce sujet intéresse, même un peu, voudrait devenir le « maître archiviste de sa propre navigation Internet »
      Je préférerais que rien, à part mon cerveau humain, ne conserve quoi que ce soit de lié à ma navigation. Mais bon, c’est juste mon point de vue
      Et je ne vois pas pourquoi cette promotion aussi flagrante a sa place ici, au-delà même du simple hors-sujet, alors qu’il s’agit d’un outil à l’opposé complet de la vie privée personnelle
    • En quoi est-ce meilleur que YaCy ?
  • Ça me rappelle le bon vieux temps. Avant Google, on utilisait des métamoteurs de recherche pour augmenter ses chances de trouver une bonne réponse au milieu des résultats de recherche spammy d’AltaVista, HotBot, Lycos et compagnie

    • Ce n’était pas seulement pour éviter le spam : certains métamoteurs, je crois que c’était Dogpile, permettaient aussi d’interroger des moteurs spécialisés comme White Pages ou Yellow Pages. C’était bien avant Yelp, et on pouvait y trouver des listes d’entreprises et des coordonnées qui n’apparaissaient pas facilement dans les moteurs web généralistes
      On pouvait aussi inclure des résultats de recherche FTP, ce qui était utile à l’époque où les FTP anonymes publics étaient encore courants
    • Quelle nostalgie. Quelques décennies plus tard, voilà que ça revient sous le nom de vie privée numérique
    • J’aimais bien Copernic. C’était un outil de métarecherche natif pour Windows 9x
    • Northern Light était pas mal aussi
    • Il y avait aussi Dogpile
  • Celui-ci vaut aussi le détour. Ce n’est pas Kagi, mais les résultats sont plutôt bons, et on peut l’auto-héberger avec Docker
    https://felladrin-minisearch.hf.space/

  • C’est bien. J’aimerais qu’il y ait un moyen de bloquer certains domaines pour qu’ils n’apparaissent jamais dans les résultats
    Édition : il semble qu’un ticket soit déjà ouvert
    https://github.com/searxng/searxng/issues/2351

    • Pour info, je fais partie des mainteneurs
      L’idée de SearXNG, c’est de fonctionner sans conserver d’état, sans session côté serveur, et sans JavaScript
      Cela dit, cette approche limite certaines fonctionnalités à cause des restrictions de taille des cookies. D’autres formes de stockage côté navigateur nécessitent JavaScript
    • Google avait cette fonction autrefois, mais l’a abandonnée
      On peut toujours le faire en ajoutant manuellement une exclusion à chaque recherche, mais la liste peut devenir longue et l’expérience utilisateur n’est pas terrible
      Kagi intègre cette fonction et elle est agréable à utiliser
      On peut aussi utiliser l’extension de navigateur uBlacklist. Dans mon cas, le problème, c’est que tout devenait plus lent
      Je n’en suis pas certain, mais j’ai l’impression qu’elle filtre les résultats réels après la recherche. Les deux méthodes ci-dessus empêchent les résultats d’être inclus dès le départ
    • uBlacklist fait exactement ça sur Google et quelques autres moteurs
      Je l’utilise sur Firefox pour filtrer les déchets Pinterest des résultats, et il existe aussi une version pour Chrome et Safari
      https://github.com/iorate/ublacklist
    • Kagi a cette fonction
  • Si vous faites tourner ça sur une connexion Internet résidentielle, vous risquez de vous faire bloquer l’accès aux moteurs de recherche

    • C’est vrai uniquement si vous l’exposez publiquement sans authentification et faites transiter les requêtes via une ligne résidentielle, ce qui n’est pas la configuration recommandée
      Pour un usage personnel, il suffit de l’exécuter sur votre propre machine ou d’y accéder via un VPN. Les requêtes vers les moteurs en amont peuvent être envoyées via un proxy ou un VPN si nécessaire
      Certains fonctionnent bien aussi via Tor, et d’autres peuvent passer par des tunnels commerciaux ou auto-hébergés
    • Ce point semble nécessiter bien plus d’explications que ce qui a été dit dans ce fil
      Si vous l’exécutez en local et que vous êtes le seul à l’utiliser, vous ne serez pas bloqué. Pour le moteur concerné, cela ressemble à peu près au même volume de requêtes qu’un usage direct
      Même si quelques personnes de plus l’utilisent chez vous, ça devrait encore aller
      J’ai fait tourner l’ancien searx en local pendant un ou deux ans sans aucun problème
    • Vous pouvez expliquer plus en détail ?
  • Il existe de nombreuses instances searx hébergées publiquement. On trouve en ligne des listes d’instances publiques, et si vous cherchez un outil qui envoie chaque recherche depuis la barre d’adresse du navigateur vers une instance aléatoire, vous pouvez utiliser neocities : https://searx.neocities.org/changelog
    Je l’utilise tout le temps. L’inconvénient, c’est qu’on tombe parfois sur une instance qui ne renvoie rien du tout ou dont les résultats sont très mauvais. Cela arrive moins souvent ces derniers temps

  • SearXNG est excellent, mais il y a quelques points à surveiller
    Le faire tourner sur une machine qui fournit du NAT à plusieurs appareils peut aider à éviter le blocage par les moteurs en amont comme DuckDuckGo. S’il n’est pas possible de l’exécuter sur une IP utilisée à d’autres fins, il serait utile d’avoir une fonction permettant d’envoyer l’accès à certains moteurs en amont via un proxy distinct. Ce problème est vraiment fréquent
    J’aimerais un mode de recherche 100 % littérale, où tous les mots que j’entre doivent impérativement apparaître tels quels dans les résultats. C’est peut-être l’équivalent de mettre un "+" devant chaque mot et de mettre chaque mot entre guillemets. C’est agaçant de voir des modifications de termes que je n’ai pas explicitement demandées, sous prétexte qu’il y aurait trop peu de résultats
    Comme cela a déjà été dit ailleurs, j’aimerais pouvoir exclure explicitement certains domaines. Je comprends que SearXNG vise l’absence de conservation d’état, mais cela pourrait aussi être configuré via une URL dédiée, ou comme paramètre appliqué à toutes les recherches. Par exemple, quand je cherche un manuel PDF, je ne veux jamais voir de sites comme "manualslib.com"
    Si ces points étaient réglés, ce serait idéal, mais à part ça, faire tourner SearXNG et recommander aux gens de l’utiliser à la place de Google a plutôt bien fonctionné

  • Tout le monde vante Searx, mais personnellement, j’aime bien presearch.com
    Je n’ai aucun lien avec eux ni aucun intérêt financier. Et leur modèle économique fondé sur la cryptomonnaie ne m’intéresse pas non plus
    En réalité, je pense que l’absence de filtrage des résultats à la Google ou Bing ne vient pas d’une posture de défense de la liberté d’expression, mais plutôt d’un manque de moyens, ou d’autres priorités plus importantes pour réussir. C’est un peu comme aux débuts d’Internet, quand les entreprises cherchaient d’abord à faire fonctionner les choses, plutôt qu’à n’afficher que des émotions positives de façade ou les bonnes formules
    Quoi qu’il en soit, quand je cherche quelque chose d’obscur ou un sujet que Google filtrerait fortement, j’utilise presearch pour obtenir un deuxième point de vue. J’aimerais qu’archive.org fasse quelque chose de similaire. archive.org a une quantité énorme de données, mais l’indexation et la recherche n’y sont pas très bonnes

  • C’est mon outil préféré pour faire la moyenne des résultats médiocres de chacun des moteurs de recherche dominants et obtenir quelque chose de globalement utilisable

  • J’en ai fait mon moteur par défaut sur tous mes appareils au cours de l’année écoulée, et j’en suis très satisfait. Il n’est tombé en panne que deux fois ; une simple mise à jour a suffi à le remettre d’aplomb

 
GN⁺ 9 일 전
Avis sur Hacker News
  • Je suis le créateur original de Searx, mais je ne participe plus au développement à cause des limites du concept de métarecherche. Mon nouveau projet de recherche est https://github.com/asciimoo/hister (https://hister.org/)
    Hister est un indexeur spécialisé pour les sites web et les fichiers locaux, et il enregistre automatiquement les pages visitées rendues par le navigateur.
    Comme il stocke le contenu intégral des pages, il permet une prévisualisation hors ligne des résultats et la fourniture des pages complètes via MCP.
    Un exemple d’utilisation de MCP est disponible ici : https://hister.org/posts/give-your-ai-assistant-a-private-me...

    • Je cherchais un moyen d’enrichir les informations utiles pour des LLM auto-hébergés et des outils d’agents. Les outils de métarecherche comme SearXNG réduisent le risque d’être bloqué par la détection de bots lorsqu’on cherche des informations, mais ce qu’on veut généralement injecter dans un outil, ce sont des informations qu’on a déjà trouvées, lues ou vues.
      J’en suis arrivé à la conclusion qu’un dépôt de contenu auto-hébergé combinant moteur de recherche et extension de navigateur pour extraire et stocker le contenu et les métadonnées des pages web serait la configuration idéale pour moi ; si possible, je voulais aussi du partage de contenu fédéré et l’import de contenus sous Creative Commons comme Wikipedia ou Gutenberg.
      Hister semble correspondre presque exactement à ce que je voulais, et j’aimerais faire un audit du code puis le déployer dans quelques semaines.
    • Hister ressemble beaucoup à quelque chose que je voulais depuis un moment sans jamais l’avoir construit. La plupart de ce que je fais avec un moteur de recherche consiste à retrouver des choses déjà vues, donc pouvoir le faire rapidement en local serait excellent.
    • Moi aussi, j’utilise une sorte de moteur de recherche personnel.
      Je ne télécharge que le titre, la description, la miniature et les champs Open Graph courants, et l’index me semble assez léger. Il contient 2 millions de pages explorées.
      https://github.com/rumca-js/Internet-Places-Database
      Il prend en charge les tags et le vote.
      Récemment, j’ai aussi publié ma première application F-Droid.
      https://github.com/rumca-js/OfflineWebSearch
      https://f-droid.org/en/packages/io.github.rumcajs.offlineweb...
    • Ça a l’air intéressant, mais je serais aussi curieux d’en savoir plus sur ce que sont les limites du concept de métarecherche.
    • Il y a environ 20 ans, un ami avait créé un proxy local qui collectait tout le trafic web pour s’en servir comme une sorte de mémoire à long terme. Il avait une interface web qui permettait de retrouver rapidement quelque chose vu une dizaine de jours plus tôt, ou un algorithme précis dont on se souvenait vaguement sans se rappeler le nom.
      Depuis plusieurs années, je rassemble divers liens liés au travail et je les utilise tous les jours, surtout pour répondre à des questions aléatoires d’amis ou de collègues comme si je sortais un lapin d’un chapeau. Par exemple, si quelqu’un demande des idées de palettes de couleurs pour des graphiques de données, je peux lui fournir immédiatement des recherches scientifiques pertinentes ; pareil pour des algorithmes peu connus.
      Avec le temps, ma collection est devenue assez volumineuse et trouver ce qu’il faut est devenu très pénible ; je me demande si ce projet conviendrait bien à mon problème.
  • Ça ressemble à un outil clé pour fournir de la recherche aux modèles locaux.
    Je me demande quelles configurations les autres utilisent pour offrir cette fonctionnalité.
    Depuis la sortie du modèle Gemma quantifié à 24 milliards de paramètres, les appels d’outils fonctionnent bien sur une 4070 Ti Super, et grâce à ces appels d’outils réussis, l’environnement local est enfin devenu utilisable.
    À noter que je parle dans un contexte général, pas spécifiquement pour le codage.

    • Il existe un mode JSON à activer dans les paramètres ; ensuite, on peut interagir avec un simple script Python, ou bien un agent peut s’en servir avec curl et jq.
      C’est tout en bas de cette page : https://docs.searxng.org/admin/settings/settings_search.html
    • J’utilise TinySearch MCP. Cela dit, avec Unsloth Studio, il appelle plutôt l’API HTML de DuckDuckGo, et ça fonctionne plutôt bien.
    • Je me demande aussi à quoi ressemble une pile IA entièrement locale, avec recherche web et autres outils inclus. À première vue, SearX n’intègre pas de serveur MCP, donc on ne peut pas l’appeler directement depuis llama-server, par exemple.
      Open WebUI propose une intégration avec SearX et d’autres fournisseurs, mais les résultats que j’ai obtenus n’étaient pas très impressionnants.
    • Je me demande si tu fais tourner un modèle quantifié. Un ami qui a une 4080 veut faire des expérimentations avec des modèles locaux, et comme cette carte doit être assez proche, ce serait intéressant si tu pouvais donner un peu plus de détails sur ta configuration.
  • J’utilise SearXNG comme moteur de recherche Internet par défaut depuis plus de 5 ans, avec aussi des solutions de repli comme le backend YaCy. Avec cette configuration, je construis aussi de la recherche dans des documents internes ou des applications RAG, et SearXNG prend également en charge les résultats JSON
    Il y a toutefois des inconvénients à accepter au nom de la confidentialité. C’est plus lent et la qualité des résultats est inférieure à celle d’autres moteurs de recherche, mais pour la plupart des requêtes c’est assez rapide et assez bon
    Il arrive que des moteurs comme DuckDuckGo ou Brave bloquent la recherche et imposent de résoudre un CAPTCHA ; utiliser une clé d’API permet d’éviter cela
    Avec son propre backend, on peut donner la priorité à certains résultats : par exemple, si l’on a crawlé le small web ou des sites importants pour soi, ces sites apparaissent en haut des résultats de recherche

    • Moi aussi, j’utilise SearXNG tous les jours depuis plus de 5 ans
      Je me demande si tu fais tourner une instance YaCy toi-même « très rapidement », ou s’il existe une configuration particulière
      D’après mon expérience, YaCy diffuse lentement les résultats en streaming pendant environ 30 secondes, ce qui ne convenait pas vraiment comme backend SearX
      Je sers aussi en local, avec kiwix-serve, des fichiers ZIM de Wikipedia, Wiktionary, Gutenberg, ArchWiki, etc., mais le moteur de recherche Kiwix [0] renvoie lui aussi beaucoup trop de résultats et pollue la page de résultats SearX, donc il ne convient pas vraiment comme backend
      Je n’ai pas encore essayé de connecter SearX à une instance Recoll locale [1]. Recoll ne prend pas en charge l’indexation des fichiers ZIM, mais il pourrait être utile pour d’autres documents HTML archivés
      La recherche est difficile à bien faire ; s’il existe une configuration qui fonctionne vraiment bien, j’aimerais en savoir plus
      [0] https://kiwix-tools.readthedocs.io/en/latest/kiwix-serve.htm...
      [1] https://docs.searxng.org/dev/engines/online/recoll.html
  • J’utilise SearXNG depuis plusieurs années. À cause de la censure réseau inhumaine du GFW et de la détection de proxy par les moteurs de recherche, je n’exploite pas ma propre instance et je m’appuie sur la liste des instances publiques [1] et sur libredirect [2]
    Le service d’une instance donnée n’est pas garanti, mais on peut passer en moins d’une minute, quasiment sans coût, à une autre instance disponible
    Il est difficile de dire que SearXNG aide à se dégoogliser. Un métamoteur de recherche appelle d’autres moteurs de recherche, comme Google, pour collecter les résultats
    Cela dit, avec SearXNG, on peut vite éviter des choses comme les résumés par IA
    [1] https://searx.space
    [2] https://github.com/libredirect/browser_extension

    • Avec les instances publiques, il faut aujourd’hui en essayer un bon paquet pour vérifier lesquelles fonctionnent correctement. SearXNG aurait besoin d’une meilleure gestion de la qualité
      Il faut souvent aller dans les paramètres pour désactiver les moteurs de recherche qui ne fonctionnent pas, ou sélectionner ceux qui marchent bien. En général, c’est parce que l’instance est bloquée, ce qui pose un problème de fiabilité
      Les moteurs qui fonctionnent varient d’une instance publique à l’autre, donc même enregistrer un hash de configuration ne marche pas toujours
      Ce serait bien que SearXNG ajuste automatiquement les moteurs de recherche à afficher en fonction de leur fiabilité, ou propose une option de ce type
  • Je l’auto-héberge depuis plusieurs années comme moteur par défaut pour toutes mes recherches, et je le recommande vivement

    • J’ai découvert récemment qu’Exa était assez cher, donc je vais essayer SearXNG. C’est particulièrement vrai quand une recherche récupère 30 à 40 sources ; je l’utilisais par défaut, puis la facture m’a surpris
  • TinySearch enveloppe SearXNG et fonctionne bien pour les agents. C’est mieux que le MCP SearXNG natif, car il optimise le contexte avant qu’il n’atteigne l’agent et évite ainsi de gaspiller des tokens
    https://github.com/MarcellM01/TinySearch

    • La dernière fois que j’ai vérifié, SearXNG n’avait pas de serveur MCP intégré
  • Connecté à l’API Brave Search, cela fonctionne bien, mais utilisé comme scraper, c’est assez instable. Google a cessé de fonctionner depuis quelques jours

  • J’ai créé https://github.com/denysvitali/searxng-mcp pour l’utiliser comme MCP avec des agents de codage. Cela fonctionne très bien jusqu’à ce qu’on atteigne les limites de requêtes d’un fournisseur, par exemple DuckDuckGo
    Pour l’exécuter, il faut aussi un serveur SearXNG ; dernièrement, je me suis donc orienté vers une solution autonome, https://github.com/denysvitali/search-mcp

    • J’ai créé quelque chose de similaire ([1]) qui pourrait être intéressant. C’est proche du projet, mais avec une différence amusante : searxng est inclus en interne dans le bundle, ce qui évite d’avoir à lancer ou trouver une instance SearXNG séparée
      [1]: https://github.com/nikvdp/searxng-ai-kit
  • J’aime beaucoup SearXNG depuis un moment. Mon antipathie envers Google n’a fait que croître, et c’est excellent de pouvoir chercher en évitant que de petits modèles d’IA ou choses du genre soient installés sur mon PC sans mon consentement

  • J’ai toujours aimé cet outil, mais je reste partagé sur le gain de confidentialité quand la recherche est envoyée non pas à une entreprise, mais à 280 entreprises