TECHNOLOGY PROFILE
国産マルチモーダル基盤モデル
Japan-developed Multimodal Foundation Model
技術概要
文章だけでなく、画像、動画、音声など複数種類の情報を統合して理解・生成し、AIエージェントやフィジカルAIの基盤となる国産AIモデルです。
技術詳細
国産マルチモーダル基盤モデルは、日本語の理解、論理推論、指示遂行に加え、画像、動画、音声など複数種類の情報を処理するAI基盤です。
従来の大規模言語モデルは、主に文章を入力して文章を生成します。
マルチモーダル基盤モデルは、文章に加えて、工場内の映像、機械の動作音、各種センサーの数値、作業指示などを組み合わせて判断できる可能性があります。
Noetraは、まず高度な日本語理解、論理推論、指示遂行能力を持つ推論基盤モデルを構築する計画です。
その後、画像、動画、音声を理解するマルチモーダル基盤モデル、さらに物理空間を認識する世界基盤モデルへ段階的に発展させます。
主な利用分野として、企業向けAIエージェント、製造現場の支援、産業用ロボット、自動車、物流、社会インフラなどが想定されます。
日本企業が保有する製造現場のデータを国内で管理しながら利用できれば、日本の製造業に適したAIを構築できる可能性があります。
現時点では本格的な研究開発を開始した段階です。
モデルの性能、公開時期、利用料金、導入企業、海外AIと比較した競争力は、今後確認する必要があります。
