『株式会社ずんだもん技術室AI放送局 podcast 20260604』のカバーアート

株式会社ずんだもん技術室AI放送局 podcast 20260604

株式会社ずんだもん技術室AI放送局 podcast 20260604

無料で聴く

ポッドキャストの詳細を見る
youtube版(スライド付き) 関連リンク Introducing Gemma 4 12B: a unified, encoder-free multimodal model Google DeepMindは、一般的なノートPCなどのローカル環境で軽快に動作する、高性能なマルチモーダルAIモデル「Gemma 4 12B」を発表しました。本モデルは、モバイル向けモデルの「E4B」と、より高度な「26B MoEモデル」のギャップを埋める位置づけとして開発され、メモリ消費を抑えながらも強力な推論能力を備えているのが特徴です。 新人エンジニアの方に向けて、このモデルの革新的なポイントを4つに分けて解説します。 1. 「エンコーダフリー」という新しいアプローチ 従来の画像や音声に対応するAI(マルチモーダルモデル)は、画像用や音声用の独立した「エンコーダ(前処理用AI)」を使ってデータを変換し、メインの言語モデル(LLM)に渡していました。 しかし、Gemma 4 12Bではこのエンコーダを排除した革新的なアーキテクチャを採用しています。 画像(ビジョン)処理: 軽量な埋め込みモジュールのみを使用し、処理の大部分をLLM本体が直接行います。音声オーディオ処理: エンコーダを完全に無くし、生の音声信号を直接テキストトークンと同じ空間にマッピングして処理します。 このシンプルな構造(Unified Architecture)により、処理の遅延(レイテンシ)とメモリの使用量を劇的に削減することに成功しました。 2. ノートPC(ローカル環境)で動く軽さ モデルのサイズが12B(120億パラメータ)とコンパクトに抑えられているため、16GBのVRAM(ビデオメモリ)やユニファイドメモリを搭載した一般的なPCがあれば、完全にオフラインのローカル環境で動作させることができます。これにより、クラウドのAPIコストを気にせず、手元で手軽にマルチモーダルAIを動かすことができます。 3. 大型モデルに迫る高度な推論力 メモリ消費量は半分以下であるにもかかわらず、ベンチマーク性能は上位モデルである「26B MoE」に迫る実力を持っています。これにより、複雑な「複数ステップの推論」や、自律的に動く「AIエージェント」のワークフローをローカルで実現可能です。また、Multi-Token Prediction(MTP)技術を搭載しており、推論速度も高速化されています。 4. オープンで充実した開発エコシステム ライセンスは「Apache 2.0」で提供され、自由な開発や商用利用が可能です。Hugging Face、Ollama、LM Studio、llama.cppなど、開発者が普段使っている主要なローカル推論ツールやライブラリに最初から対応しています。さらに、AIエージェント構築を支援する公式のスキルライブラリ「Gemma Skills」も同時に公開されています。 Gemma 4 12Bは、特別なGPUサーバーを用意せずとも、手元のPCだけで最先端の「画像・音声・テキスト」を融合したプロダクト開発を始められる、エンジニアにとって非常に魅力的な選択肢です。 引用元: https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12b/ Introducing new capabilities to GPT-Rosalind OpenAIは、ライフサイエンス(生命科学)研究およびエンタープライズ規模の創薬に特化したAIモデル「GPT-Rosalind」のアップデートと新機能を発表しました。本モデルは、GPT-5.5が持つ高度なエージェント機能(自律的なコーディングやツール利用)に、医学化学やゲノミクスといった専門領域の強力な知識を融合させたものです。 本アップデートの主な要点と、技術的な特徴は以下の通りです。 1. 専門ベンチマークにおける高い性能と優れたトークン効率 ライフサイエンス研究の現場に即した複数のベンチマークにおいて、従来のGPT-5.5を上回る精度を達成しつつ、消費するトークン数を大幅に削減(コストパフォーマンスが向上)しています。 LifeSciBench: 科学的根拠の処理、分析、設計、推論など、実際の研究に必要なエンドツーエンドのタスクを評価する新ベンチマーク。本モデルは業界トップクラスの成績を記録。MedChemBench (医学化学): 創薬プロセスの最適化などを評価。GPT-5.5に比べトークン消費量を7.2%削減しつつ、精度を向上(27.5% vs 25.1%)。GeneBench (ゲノミクス・定量生物学): 長期的な計画と分析が必要なエージェントタスクを評価。GPT-5.5比でトークン数を31%削減し、21.6%の精度を達成。...
adbl_web_anon_alc_button_suppression_t1
まだレビューはありません