『Disaggregated Inferencing: يعني إيه وليه شراكة AMD و Cerebras مهمة؟』のカバーアート

Disaggregated Inferencing: يعني إيه وليه شراكة AMD و Cerebras مهمة؟

Disaggregated Inferencing: يعني إيه وليه شراكة AMD و Cerebras مهمة؟

無料で聴く

ポッドキャストの詳細を見る

【Amazonプライム会員限定】今ならプレミアムプランが4か月 月額99円。

10月19日まで。※適用条件あり

Send us something, Share your comments directly :)

هل شراكة AMD و Cerebras هتغير شكل داتا سنترز الذكاء الاصطناعي؟

في الحلقة دي، بنشرح الإعلان المهم اللي حصل في مؤتمر AMD Advancing AI 2026، وليه معمارية الـ Disaggregated Inference بقت أهم بكتير من فكرة إنك تزود كروت (GPUs) وخلاص.

عملية الـ Inference في الـ LLMs مش خطوة واحدة؛ دي بتتقسم لمرحلتين مختلفين تماماً عن بعض في متطلبات الهاردوير:

مرحلة الـ Prefill: ودي عملية معقدة حسابياً (Compute-bound) ومحتاجة قدرة معالجة ضخمة عشان تعالج الـ Input وتطلع أول Token.

مرحلة الـ Decode: ودي معتمدة تماماً على سرعة الذاكرة (Memory-bandwidth bound) وزمن الاستجابة عشان تبدأ تطلع الـ Tokens ورا بعض.

في الحلقة دي هنتكلم عن:

ليه الـ Prefill والـ Decode كل مرحلة فيهم محتاجة نوع هاردوير مختلف تماماً؟

شرح مبسط لمفاهيم زي الـ TTFT و ITL وإيه هو الـ KV Cache.

ليه تشغيل المرحلتين على نفس الـ GPU Pool بيعمل عنق زجاجة (Bottleneck) ويهدر موارد السيرفرات؟

إزاي بنفصل الـ Workloads باستخدام راك AMD Helios مع شريحة Cerebras WSE-3؟

تحديات الفابريك والشبكات: يعني إيه Latency Tax وقت نقل الـ KV Cache بين الكلاسترز المختلفة؟

بتشبيهات وأمثلة عملية من الواقع، هنشوف إزاي المعمارية دي شغالة، وليه مستقبل البنية التحتية للذكاء الاصطناعي مبقاش متوقف على عدد الـ GPUs، بل على أوبتيمايزيشن المسار الكامل (End-to-End) للـ Tokens.

والسؤال الأهم: هل الـ Disaggregated Architecture هتكون هي المعيار الجديد، ولا تكلفة الشبكات والـ Latency هتعطل الفكرة؟

Follow us on

Apple Podcast
Google Podcast
YouTube Channel
Spotify


adbl_web_anon_alc_button_suppression_t1
まだレビューはありません