#17 Multimodale KI: Wenn der Chatbot auch Bilder und Tabellen liest

カートのアイテムが多すぎます

ご購入は五十タイトルがカートに入っている場合のみです。

カートに追加できませんでした。

しばらく経ってから再度お試しください。

ウィッシュリストに追加できませんでした。

しばらく経ってから再度お試しください。

ほしい物リストの削除に失敗しました。

しばらく経ってから再度お試しください。

ポッドキャストのフォローに失敗しました

ポッドキャストのフォロー解除に失敗しました

#17 Multimodale KI: Wenn der Chatbot auch Bilder und Tabellen liest

無料で聴く

ポッドキャストの詳細を見る

Firmen-Chatbots sollen auf Knopfdruck das gesamte Unternehmenswissen zugänglich machen. Doch die meisten sind blind für alles, was kein reiner Text ist: Prozessdiagramme, Bilder und Tabellen werden ignoriert. Die Folge: unvollständige oder nutzlose Antworten.
In dieser Folge sprechen wir mit Richard Zimmermann, der sich in seiner Bachelorarbeit genau dieser Herausforderung gestellt hat. Er erklärt, wie man mit dem Ansatz der "Retrieval-Augmented Generation" (RAG) einem Sprachmodell beibringt, auch multimodale Daten zu verstehen und zu nutzen.
Wir tauchen tief in die Technik ein und klären, warum es nicht nur darum geht, der KI Daten zu geben, sondern auch darum, ihr die richtigen Informationen in der richtigen Menge zu präsentieren, um das "Lost in the Middle"-Problem zu vermeiden.

まだレビューはありません