Weave Router - un routeur de modèles pour agents qui dirige chaque prompt vers le modèle optimal
(github.com/workweave)- Un proxy drop-in qui regroupe Anthropic, OpenAI et Gemini derrière un point de terminaison unique. Sélection automatique du meilleur modèle pour chaque requête
- Route tous les prompts vers le bon modèle en moins de 50 ms, avec une réduction des coûts de 40 à 70 % possible simplement en changeant de point de terminaison
- Évalue les prompts non pas au feeling (« vibes »), mais avec un scoreur de clusters basé sur un embedder on-box, selon une approche dérivée de Avengers-Pro, pour décider du routage à chaque tour
- Prend en charge les API Anthropic Messages, OpenAI Chat Completions et Gemini native, avec support du streaming, des outils et de la vision
- Les modèles OSS comme DeepSeek, Kimi, GLM, Qwen, Llama, Mistral peuvent être utilisés via OpenRouter (ou un endpoint compatible OpenAI)
- BYOK par défaut, avec stockage chiffré en local des clés des fournisseurs
- Traces OTLP fournies par défaut, pour l’observabilité via le tableau de bord Weave, Honeycomb, Datadog, Grafana, etc.
- Peut être lancé sans installation avec
npx @workweave/router, puis connecté directement à Claude Code, Codex, opencode, Cursor, avec prise en charge des bascules on/off/status- Claude Code se connecte avec
make install-cc. Fournit les commandes slash/router-off,/router-on,/router-status - Codex : l’exécution de
npx @workweave/router --codexpatche~/.codex/config.toml - opencode :
npx @workweave/router --opencodepointe le fournisseur@ai-sdk/anthropicinclus vers l’endpoint/v1du routeur ; grâce à la prise en charge native de l’API Anthropic Messages, il fonctionne sans modification - Cursor : encore en bêta précoce, avec des performances instables ; saisir
http://localhost:8080/v1dans Settings → Models → Override OpenAI Base URL
- Claude Code se connecte avec
- Elastic License 2.0
4 commentaires
Il n’y aurait pas de problème de cache ?
Il sera probablement difficile d’exploiter la couche de cache fournie par les services LLM.
Si l’intégration se fait via une API, les cache misses pourraient faire grimper les coûts de façon assez importante.
La partie « wldnjs » est intrigante.
J’ai corrigé cela.