Disaggregated Inferencing: يعني إيه وليه شراكة AMD و Cerebras مهمة؟
カートのアイテムが多すぎます
カートに追加できませんでした。
ウィッシュリストに追加できませんでした。
ほしい物リストの削除に失敗しました。
ポッドキャストのフォローに失敗しました
ポッドキャストのフォロー解除に失敗しました
-
ナレーター:
-
著者:
Send us something, Share your comments directly :)
هل شراكة AMD و Cerebras هتغير شكل داتا سنترز الذكاء الاصطناعي؟
في الحلقة دي، بنشرح الإعلان المهم اللي حصل في مؤتمر AMD Advancing AI 2026، وليه معمارية الـ Disaggregated Inference بقت أهم بكتير من فكرة إنك تزود كروت (GPUs) وخلاص.
عملية الـ Inference في الـ LLMs مش خطوة واحدة؛ دي بتتقسم لمرحلتين مختلفين تماماً عن بعض في متطلبات الهاردوير:
مرحلة الـ Prefill: ودي عملية معقدة حسابياً (Compute-bound) ومحتاجة قدرة معالجة ضخمة عشان تعالج الـ Input وتطلع أول Token.
مرحلة الـ Decode: ودي معتمدة تماماً على سرعة الذاكرة (Memory-bandwidth bound) وزمن الاستجابة عشان تبدأ تطلع الـ Tokens ورا بعض.
في الحلقة دي هنتكلم عن:
ليه الـ Prefill والـ Decode كل مرحلة فيهم محتاجة نوع هاردوير مختلف تماماً؟
شرح مبسط لمفاهيم زي الـ TTFT و ITL وإيه هو الـ KV Cache.
ليه تشغيل المرحلتين على نفس الـ GPU Pool بيعمل عنق زجاجة (Bottleneck) ويهدر موارد السيرفرات؟
إزاي بنفصل الـ Workloads باستخدام راك AMD Helios مع شريحة Cerebras WSE-3؟
تحديات الفابريك والشبكات: يعني إيه Latency Tax وقت نقل الـ KV Cache بين الكلاسترز المختلفة؟
بتشبيهات وأمثلة عملية من الواقع، هنشوف إزاي المعمارية دي شغالة، وليه مستقبل البنية التحتية للذكاء الاصطناعي مبقاش متوقف على عدد الـ GPUs، بل على أوبتيمايزيشن المسار الكامل (End-to-End) للـ Tokens.
والسؤال الأهم: هل الـ Disaggregated Architecture هتكون هي المعيار الجديد، ولا تكلفة الشبكات والـ Latency هتعطل الفكرة؟
Follow us on
Apple Podcast
Google Podcast
YouTube Channel
Spotify