1 points par selene 2 시간 전 | Aucun commentaire pour le moment. | Partager sur WhatsApp

• Résoudre la complexité du modèle de production : le système de recommandation existant de Netflix reposait sur des milliers de features conçues manuellement et sur une architecture complexe, ce qui rendait coûteux l’ajout de nouveaux cas d’usage ; GenRec, basé sur les grands modèles de langage (LLM), a été développé pour le remplacer.
• Pipeline clé de GenRec : GenRec convertit l’historique utilisateur, les métadonnées des contenus et le contexte en prompts en langage naturel (verbalization), puis génère le classement des recommandations en combinant un LLM de fondation affiné sur des données propres à Netflix avec une tête de scoring consciente du catalogue.
• Framework d’apprentissage en deux étapes : dans la phase 1, un LLM open source est adapté au corpus de Netflix afin d’apprendre les contenus et les schémas de comportement ; dans la phase 2, un post-entraînement est effectué à partir de données de ranking et d’objectifs de récompense.
• Introduction du context engineering : pour résoudre les contraintes de budget de tokens, Netflix a appliqué du context engineering, en conservant les interactions à fort signal, en omettant les événements à faible signal ou en compressant les comportements répétitifs, ce qui a fortement réduit le nombre de tokens et les coûts sans dégrader la qualité.
• Fonction objectif de ranking pondérée par la récompense : en utilisant une fonction de perte pondérée par des proxies de satisfaction membre à long terme et par des objectifs métier (réajustés selon le type de contenu et son stade de lancement), Netflix a obtenu une optimisation allant au-delà du simple clic.
• Inférence prefill-only basée sur vLLM : dans sa stack interne de serving LLM s’appuyant sur vLLM, Netflix a exécuté le modèle en mode prefill-only au lieu du décodage autorégressif, afin de calculer les scores de l’ensemble des candidats en un seul passage forward et d’optimiser ainsi le coût de serving.
• Résultats des tests A/B en ligne : lors d’un test A/B de grande ampleur mené pendant quatre semaines sur environ 10 % du trafic, GenRec a enregistré des améliorations statistiquement significatives sur les métriques en ligne de court et de long terme par rapport au modèle de ranking de production existant, tout en n’utilisant qu’une quantité bien moindre de données labellisées de phase 2 et de signaux d’entrée.

Aucun commentaire pour le moment.

Aucun commentaire pour le moment.