国産マルチモーダル基盤モデル

国産マルチモーダルAI

TECHNOLOGY PROFILE

国産マルチモーダル基盤モデル

Japan-developed Multimodal Foundation Model

技術概要

文章だけでなく、画像、動画、音声など複数種類の情報を統合して理解・生成し、AIエージェントやフィジカルAIの基盤となる国産AIモデルです。

技術詳細

国産マルチモーダル基盤モデルは、日本語の理解、論理推論、指示遂行に加え、画像、動画、音声など複数種類の情報を処理するAI基盤です。

従来の大規模言語モデルは、主に文章を入力して文章を生成します。

マルチモーダル基盤モデルは、文章に加えて、工場内の映像、機械の動作音、各種センサーの数値、作業指示などを組み合わせて判断できる可能性があります。

Noetraは、まず高度な日本語理解、論理推論、指示遂行能力を持つ推論基盤モデルを構築する計画です。

その後、画像、動画、音声を理解するマルチモーダル基盤モデル、さらに物理空間を認識する世界基盤モデルへ段階的に発展させます。

主な利用分野として、企業向けAIエージェント、製造現場の支援、産業用ロボット、自動車、物流、社会インフラなどが想定されます。

日本企業が保有する製造現場のデータを国内で管理しながら利用できれば、日本の製造業に適したAIを構築できる可能性があります。

現時点では本格的な研究開発を開始した段階です。

モデルの性能、公開時期、利用料金、導入企業、海外AIと比較した競争力は、今後確認する必要があります。

この技術を使用するプロジェクト

この記事を書いた人

趣味を兼ねた骨董品の売買を経て、株式やFXなどの投資に関心を持つようになりました。

投資先を考える根拠として日本企業の技術を調べる中で、見つけた情報とその後の進展を記録する必要性を感じ、AIの力を借りて「未来産業地図」を制作。

技術・企業・プロジェクトを結び付け、研究、実証、量産、商用化までの動きを継続して追跡しています。

目次