Odaily Planet Daily berichtet, dass das KI-Modell-Routing-System NeMo Switchyard eingeführt wurde, um Entwicklern zu helfen, Aufgaben von KI-Agenten (AI Agent) dynamisch zwischen mehreren großen Modellen zuzuweisen und dabei Kosten und Latenzzeiten zu senken, ohne die Leistung zu beeinträchtigen.
Es wird erklärt, dass der Aufbau von KI-Agenten nicht bedeutet, dass man auf ein einzelnes großes Modell angewiesen sein muss. Verschiedene Modelle haben unterschiedliche Vorteile in Bezug auf Inferenzfähigkeit, Reaktionsgeschwindigkeit und Betriebskosten. Zum Beispiel könnte ein leichtgewichtiges Modell für Klassifizierungsaufgaben geeignet sein, während komplexe Inferenz ein leistungsstärkeres Modell erfordert. Wenn alle Anfragen an das größte Modell gesendet werden, führt dies zu höheren Kosten und Latenzzeiten; die ausschließliche Verwendung kleiner Modelle könnte jedoch die Qualität der Ausführung komplexer Aufgaben beeinträchtigen. NeMo Switchyard wählt durch einen intelligenten Routing-Mechanismus automatisch das am besten geeignete Ausführungsmodell aus mehreren spezialisierten und fortschrittlichen Modellen aus, basierend auf Faktoren wie Aufgabenanforderungen, Modellfähigkeiten, Kosten, Latenz und Systemstatus. Dieses System unterstützt Entwickler dabei, zwischen verschiedenen Modellanbietern und Modellversionen zu wechseln, ohne die Anwendungsarchitektur zu ändern.
Es wird vorgestellt, dass NeMo Switchyard verschiedene Routing-Strategien bietet, darunter ein LLM-Klassifizierer-Routing ohne Training, Phasen-Routing (Stage Router), Eskalations-Routing (Escalation Router) und ein anpassbares Routing-Modell, das auf realen Arbeitslastdaten trainiert wurde. Dabei wird das Eskalations-Routing bevorzugt Aufgaben an kostengünstige Modelle zuweisen und bei Erkennung einer erhöhten Komplexität der Aufgaben, anhaltenden Fehlern oder Stagnation der Ausführung die Anfragen an leistungsstärkere Modelle eskalieren, um ein Gleichgewicht zwischen Leistung und Kosten zu erreichen.
Es wird berichtet, dass NeMo Switchyard in relevanten Tests durch die Zuweisung von Aufgaben zwischen verschiedenen Modellen die Betriebskosten von KI-Agenten erheblich senken konnte, während eine hohe Abschlussrate der Aufgaben beibehalten wurde. Beispielsweise senkte eine auf Eskalations-Routing basierende Lösung in den LangChain-Multirunden-Agententests die Kosten um etwa 74 % im Vergleich zur ausschließlichen Verwendung fortschrittlicher Modelle, wobei nur 7 % der Anfragen ein fortschrittliches Modell benötigten.
Darüber hinaus wurde mit Unternehmen wie Cognition, Nous Research, Ramp, LangChain, LiteLLM und Kong zusammengearbeitet, um NeMo Switchyard in den Entwicklungsprozess von KI-Agenten und die Unternehmensanwendungsinfrastruktur zu integrieren.
Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.





























