Das Cybersecurity-Unternehmen Trellix baute das Herzstück von Trellix Wise, seinem generativen KI-System zur Bedrohungsuntersuchung, um eine bewusste Multi-Modell-Architektur neu auf, und senkte die Inferenzkosten um den Faktor 30 bei gleichbleibender, von seinen Sicherheitsanalysten geforderter Genauigkeit, laut AWS-Engineering-Dokumentation und Anthropics Kundenbericht.
Die Ausgangslage
Trellix entstand 2022 aus der Fusion von McAfee Enterprise und FireEye und bedient heute mehr als 53.000 Kunden mit einer KI-gestützten Sicherheitsplattform. Seine Analysten leben in einem reißenden Strom. Wie das Unternehmen in seinem Sponsor-Beitrag bei Harvard Business Review beschreibt, treffen die meisten Unternehmen, die ihre Erkennungsabstimmung unangetastet lassen, täglich über tausend Sicherheitswarnungen. Jede Warnung steht für eine Entscheidung: eskalieren, verwerfen, untersuchen. Menschliche Triage bei diesem Volumen erzeugt Ermüdung, und Ermüdung erzeugt übersehene Eindringversuche, Angreifer bewegen sich schnell genug, um Daten zu exfiltrieren, bevor ein Analyst die entscheidende Warnung erreicht.
Trellix Wise beantwortete dieses Volumen mit autonomer Untersuchung: Das System analysiert und klassifiziert Ereignisse über Endpunkt, Netzwerk, E-Mail und Cloud hinweg, korreliert Threat Intelligence mit historischen Daten und weist jedem Ereignis einen Risikowert zu. Der naheliegende Weg zum Aufbau war der damalige Standard, jede Phase jeder Untersuchung an ein einziges Frontier-Modell zu senden. Dieses Design funktionierte bei der Genauigkeit und brach bei der Ökonomie zusammen. Die Kosten wuchsen linear mit dem Warnungsvolumen, und das Warnungsvolumen war das gesamte Problem.
Die Entscheidung, die es möglich machte
Trellix traf eine Design-Entscheidung, die kontraintuitiv wirkt: den Ein-Modell-Standard verwerfen und jede Phase einer Untersuchung an das ihrer Komplexität passende Modell leiten. Das Team erkannte, dass eine Bedrohungsuntersuchung eine Kette eigenständiger Aufgaben ist und dass jede Aufgabe ihre eigene Genauigkeitsanforderung trägt. Tiefes Schlussfolgern und die finale Risikobewertung blieben bei Anthropics Claude Sonnet, dem Modell mit dem höchsten Grad analytischer Detailtiefe. Die hochfrequenten, mäßig komplexen Phasen, Datenerfassung und -abruf, wanderten zu Amazon Nova Microeinem leichten Modell auf derselben Amazon-Bedrock-Plattform.
Der elegante Teil ist der Mehrfach-Durchlauf. Statt eines teuren Sonnet-Aufrufs für die Datenerfassungsphase führt Trellix mehrere Nova-Micro-Durchläufe parallel aus und maximiert die Abdeckung der Daten, die eine Untersuchung benötigt. Da Nova Micro pro Inferenz fast 100-mal weniger kostet und 3 bis 5 Inferenzen in der Zeit eines einzigen Sonnet-Aufrufs ausführt, erhält das Team breitere Abdeckung und schnellere Bearbeitung zu einem Bruchteil des Preises. Um das leichte Modell zuverlässig zu halten, begrenzt Trellix dessen Ausgaben mit proprietärem Prompt-Engineering und Referenzdaten und hält Halluzinationen innerhalb akzeptabler Grenzen für die Zielaufgabe. Ein drittes Modell, Amazon Nova Lite, übernimmt leichtes Coding und Konnektor-Integration in den Professional Services.
Das Ergebnis, mit vollem Kontext
Der Vorteil auf Architekturebene ist die Reduktion der Untersuchungskosten um den Faktor 30, den das Mehrfach-Durchlauf-Design liefert, aufgebaut aus den rund 100-mal geringeren Kosten pro Inferenz von Nova Micro, angewandt auf die volumendominierenden Phasen. Die Geschwindigkeit stieg im Gleichschritt: Nova Micro produziert 3 bis 5 Inferenzen in dem Zeitfenster, das eine einzelne Sonnet-Inferenz belegen würde, und Trellix berichtet von einer initialen Warnungsanalyse in 30 Sekunden innerhalb des Systems.
Der nachgelagerte Effekt auf die Analysten ist die Zahl, die für ein Security Operations Center zählt. Anthropics Kundenbericht dokumentiert 8 eingesparte Stunden je 100 Sicherheitswarnungendie das System verarbeitet, ein Durchsatz, der dem Hinzufügen von 10 Sicherheitsanalysten zum Team entspricht. Der HBR-Beitrag ergänzt das Erkennungsergebnis: Trellix Wise senkte die durchschnittliche aktive Warnungszahl der Kunden von über tausend auf unter zehn und verkürzte die mittlere Erkennungszeit um bis zu 50 Prozent. Die Konnektor-Bauzeit, die einst 40 Stunden dauerte, ist jetzt in unter fünf Minuten abgeschlossen.
Dieses Desk hält Ehrlichkeit als Maßstab, daher reisen die Einschränkungen mit den Metriken mit. AWS beschreibt das Deployment als schrittweisen Roll-out in die Produktion nach einer Pilotbewertung, dies ist ein System in aktiver Ausweitung. Das Engineering-Team weist zudem darauf hin, dass Nova Micro eine höhere Ausgabenvariabilität als größere Modelle zeigt, weshalb es genau dieses Modell in Prompt-Vorgaben einbettet und das finale Urteil Claude Sonnet vorbehält. Und es erklärt deutlich, dass standardisierte öffentliche Benchmarks für die Entscheidung unzureichend blieben: Trellix bewertete jedes Modell gegen den eigenen Anwendungsfall, Aufgabe für Aufgabe, um zu erfahren, wo das leichte Modell die Genauigkeit hielt und wo das große Modell seine Kosten rechtfertigte. Die Routing-Karte ist das Produkt dieser Messung, eine Faustregel.
Was andere Organisationen lernen können
Die übertragbare Lektion trifft am härtesten jedes Team, das seine LLM-Rechnung schneller steigen sieht, als es der Verbrauch rechtfertigt. Trellix behandelte explodierende Inferenzkosten als Architekturproblem statt als Budgetproblem, und Architektur ist replizierbar auf eine Weise, wie es Budgetspielraum selten ist. Das Playbook hat drei Schritte. Erstens, den Arbeitsablauf in Phasen zerlegen und die Genauigkeit benennen, die jede Phase wirklich verlangt, denn ein Datenabruf-Durchlauf und ein finales Risikourteil verdienen verschiedene Modelle. Zweitens, die hochfrequenten Phasen mit geringerem Einsatz an ein kleines, schnelles Modell leiten und das Frontier-Modell für die Urteilsentscheidungen reservieren, mit Mehrfach-Durchlauf-Validierung, um die Abdeckung zurückzugewinnen, die das kleine Modell allein erreichen müsste. Drittens, auf der eigenen Arbeitslast messen, die Routing-Karte, die Trellix das 30-Fache sparte, entstand aus aufgabenspezifischer Bewertung, und Ihre wird anders ausfallen.
Die Bedingung für die Replikation ist Disziplin dabei, wo Genauigkeit tragend ist. Teams, die blind routen, um Kosten zu senken, geben die Ergebnisse preis, die die KI überhaupt rechtfertigten. Trellix verdiente seine Einsparungen gerade deshalb, weil es Claude Sonnet auf den Phasen hielt, die entscheiden, ob ein echter Eindringversuch erfasst wird, und alles Übrige auf Modelle verlagerte, die für ihre engere Aufgabe hochgenau sind. Das Ergebnis ist eine Kostenstruktur, die mit der Mission skaliert, statt gegen sie zu kämpfen.
Artikel von SAGASuccess Stories & Real Cases
SAGA berichtet über Enterprise-KI-Implementierungen mit verifizierten Ergebnissen. Jede Metrik hat eine Quelle. Jedes Unternehmen wird genannt.
Quellen
- Trellix (trellix.com)
- AWS-Engineering-Dokumentation (aws.amazon.com)
- Anthropics Kundenbericht (claude.com)
- Sponsor-Beitrag bei Harvard Business Review (hbr.org)