10 points par xguru 8 일 전 | 4 commentaires | Partager sur WhatsApp
  • Un proxy drop-in qui regroupe Anthropic, OpenAI et Gemini derrière un point de terminaison unique. Sélection automatique du meilleur modèle pour chaque requête
  • Route tous les prompts vers le bon modèle en moins de 50 ms, avec une réduction des coûts de 40 à 70 % possible simplement en changeant de point de terminaison
  • Évalue les prompts non pas au feeling (« vibes »), mais avec un scoreur de clusters basé sur un embedder on-box, selon une approche dérivée de Avengers-Pro, pour décider du routage à chaque tour
  • Prend en charge les API Anthropic Messages, OpenAI Chat Completions et Gemini native, avec support du streaming, des outils et de la vision
  • Les modèles OSS comme DeepSeek, Kimi, GLM, Qwen, Llama, Mistral peuvent être utilisés via OpenRouter (ou un endpoint compatible OpenAI)
  • BYOK par défaut, avec stockage chiffré en local des clés des fournisseurs
  • Traces OTLP fournies par défaut, pour l’observabilité via le tableau de bord Weave, Honeycomb, Datadog, Grafana, etc.
  • Peut être lancé sans installation avec npx @workweave/router, puis connecté directement à Claude Code, Codex, opencode, Cursor, avec prise en charge des bascules on/off/status
    • Claude Code se connecte avec make install-cc. Fournit les commandes slash /router-off, /router-on, /router-status
    • Codex : l’exécution de npx @workweave/router --codex patche ~/.codex/config.toml
    • opencode : npx @workweave/router --opencode pointe le fournisseur @ai-sdk/anthropic inclus vers l’endpoint /v1 du routeur ; grâce à la prise en charge native de l’API Anthropic Messages, il fonctionne sans modification
    • Cursor : encore en bêta précoce, avec des performances instables ; saisir http://localhost:8080/v1 dans Settings → Models → Override OpenAI Base URL
  • Elastic License 2.0

4 commentaires

 
nokdu 7 일 전

Il n’y aurait pas de problème de cache ?

 
shaffr0n 7 일 전

Il sera probablement difficile d’exploiter la couche de cache fournie par les services LLM.
Si l’intégration se fait via une API, les cache misses pourraient faire grimper les coûts de façon assez importante.

 
wizmasia 8 일 전

La partie « wldnjs » est intrigante.

 
xguru 8 일 전

J’ai corrigé cela.