『176 - Praxis mit dem DGX Spark』のカバーアート

176 - Praxis mit dem DGX Spark

176 - Praxis mit dem DGX Spark

無料で聴く

ポッドキャストの詳細を見る

Praxis mit dem DGX Spark: Komplette KI-Infrastruktur im StresstestIn dieser Folge des KI Gilde Podcasts teilen wir unsere harten Praxiswerte beim parallelen, lokalen Betrieb einer vollständigen KI-Infrastruktur auf dem DGX Spark.Die wichtigsten Erkenntnisse der Folge:

    • vLLM statt llama.cpp: Warum vLLM bei der parallelen Verarbeitung deutlich mehr Token herausholt, der vorab allokierte KV-Cache aber schnell zur Speicherfalle wird.
    • Crash-Gefahr durch RAM-Limits: Wie große Kontextfenster den Server unvermittelt zum Absturz bringen können und warum wir einen "Wächter" für den Arbeitsspeicher einrichten mussten.
    • Modell-Management mit LiteLLM: Der erfolgreiche Parallelbetrieb von großen Sprachmodellen, Rerankern sowie Text-zu-Sprache (TTS) und Sprache-zu-Text (STT).
    • Die Reasoning-Falle: Warum es schädlich ist, wenn Modelle ihre "inneren Gedanken" an das Audiomodell weitergeben und wie wir das Problem gelöst haben.
    • Unser Benchmark-Sieger: Warum das Modell "Qvent 3.6" durch seine starke Kombination aus Kontextverarbeitung und Token-Generierung unser absoluter Allrounder geworden ist.
adbl_web_anon_alc_button_suppression_t1
まだレビューはありません