LightLLMs

Kleine und schnelle LLMs für Edge Computing

Motivation

Große Sprachmodelle (LLMs) finden immer breitere Anwendung in Gesellschaft, Industrie und Wissenschaft. Da sie viel Rechenleistung und Speicher benötigen, ist ihr Einsatz auf Edge-Geräten mit begrenzten Ressourcen wie z. B. Smartphones herausfordernd. Um LLMs für Edge Computing nutzbar zu machen, müssen ihre Modellgrößen und Rechenkomplexität reduziert werden.

Ziele und Vorgehen

Die Forschenden wollen LLMs klein und schnell genug machen, damit sie in Smartphones, Autos oder Robotern eingesetzt werden können. Um Rechenkomplexität und Speicherbedarf zu reduzieren, kombiniert das Team unterschiedliche, sich gegenseitig ergänzende Methoden: Parameter-Sharing reduziert die Grundgröße des Modells, KV-Cache-Kompression reduziert den temporären Speicher, der während der Inferenz benötigt wird, und hybride Architekturen ermöglichen es, aufgabenspezifische Berechnungen sparsamer zu gestalten. So verringern sich durch das gleichzeitige Anwenden dieser drei Methoden nicht nur der statische und dynamische Speicher, sondern auch die eigentliche Rechenlast. Gleichzeitig ermöglicht die Kombination eine bessere Koordination und Kontrolle der Gesamtreduzierung. Dafür entwickeln die Forschenden neue Algorithmen, testen sie auf realen Edge-Geräten und veröffentlichen den Quellcode.

Innovationen und Perspektiven

Die Forschenden veröffentlichen die Ergebnisse, damit sie Universitäten, öffentliche Forschungsinstitute und Industrielabore einsetzen können. Die Methoden fließen in Lehrveranstaltungen ein, öffnen Wege für Kooperationen in Europa und Asien und fördern neue Forschungspartnerschaften.

Projektinformation

Projektleitung

Technische Universität Darmstadt
Fachbereich Elektrotechnik und Informationstechnik (etit)
Hardware für Künstliche Intelligenz
Merckstr. 5
64283 Darmstadt

Volumen

0,37 Mio. € (davon 0,37 Mio. € (100%) Förderanteil durch BMFTR)

Laufzeit

09/2026 – 08/2029