文章だけでなく画像・音声・動画など複数の種類の入出力を1つのモデルで扱えること。
マルチモーダルは、テキストに加えて画像・音声・動画などを同じモデルで入力・出力できる性質です。画像を見せて説明させる、図表を読み取らせる、といった業務利用が広がっています。
この用語は PEP検定 シラバス第1章「生成AIと大規模言語モデルの基礎知識」の範囲です。
PEP検定は、こうした用語を実務のプロンプト設計と評価に結びつける力を測ります。練習問題で確かめてみてください。