生成AIの種類一覧|テキスト・画像・動画・コード生成の技術まとめ

テキストを入力するだけで、画像や動画、音楽、コードまで自動生成する——生成AIはここ数年で急速に多様化し、出力できるコンテンツの種類が大きく広がりました。この記事では、2026年時点における生成AIの全種類を出力モダリティ別に整理し、各種類の代表サービスと仕組みを支える基盤技術(アーキテクチャ)まで一覧でまとめます。「テキスト・画像・動画・音声・音楽・コード・マルチモーダル・エージェント」の8分類を網羅した保存版です。

スポンサーリンク

生成AIの種類を出力形式で分類

生成AIとは、学習したデータをもとに新しいコンテンツを「生成」するAIの総称です。何を生成するかによって大きく8種類に分類されます。

← 横にスクロールできます →

分類 生成するもの 主な技術 代表サービス
テキスト生成AI 文章・会話・要約 LLM・Transformer ChatGPT・Claude・Gemini
画像生成AI 静止画・イラスト 拡散モデル・GAN Midjourney・DALL-E 3・Stable Diffusion
動画生成AI 動画・アニメーション 動画拡散モデル Sora・Veo・Runway
音声合成AI 音声・ナレーション ニューラルTTS ElevenLabs・VOICEVOX
音楽生成AI 楽曲・BGM 音楽トークナイザ Suno・Udio・AIVA
コード生成AI プログラムコード コードLLM GitHub Copilot・Cursor
マルチモーダルAI 複数形式の統合処理 CLIP・VLM GPT-4o・Gemini 2.5 Pro
エージェントAI タスクの自律実行 Tool Calling・RAG Claude Code・Devin

テキスト生成AI(大規模言語モデル・LLM)

テキスト生成AIは、大量のテキストデータで学習した大規模言語モデル(LLM: Large Language Model)を中心に発展してきました。質問への回答・文章作成・翻訳・要約など、言語に関わるほぼあらゆるタスクに対応します。各技術の詳しい用語解説は「AI・機械学習の用語一覧|基礎から最新LLM用語まで180語まとめ」もあわせてご覧ください。

← 横にスクロールできます →

モデル名 開発元 特徴
ChatGPT(GPT-4o/GPT-5) OpenAI 世界最大のユーザー数。会話・創作・分析に強い
Claude(Opus/Sonnet/Haiku) Anthropic 長文処理と安全性設計に注力。文脈保持が得意
Gemini 2.5 Pro Google DeepMind Googleサービスとの連携。マルチモーダル統合
Llama 3.x Meta オープンソースLLM。自社サーバーへの展開が可能
Mistral Large Mistral AI 軽量かつ高精度。欧州プライバシー法規制に対応
DeepSeek V3 深度求索(中国) 低コスト・高性能で注目を集めたオープンソースLLM
Qwen(通義千問) Alibaba 多言語対応の中国発LLM。日本語処理も向上
Command R+ Cohere エンタープライズ向けRAG特化LLM

テキスト生成AIの豆知識:RAGとは

RAG(Retrieval-Augmented Generation=検索拡張生成)は、LLMの弱点である「知識の古さ・ハルシネーション」を補う技術です。ユーザーの質問に対し、外部データベースや社内文書を検索してから回答を生成するため、最新情報や専用知識を扱う企業向けAIに広く採用されています。

スポンサーリンク

画像生成AI

テキストプロンプトから画像を生成する技術は、現在拡散モデル(Diffusion Model)が主流です。2022年のStable Diffusion公開を機に民主化が進み、2026年時点では商用品質の画像が数秒で生成できます。

← 横にスクロールできます →

サービス名 基盤技術 特徴
Midjourney v7 独自拡散モデル 芸術的・高品質アート生成。コミュニティ利用が活発
DALL-E 3 拡散モデル ChatGPTと統合。自然言語の指示に忠実
Stable Diffusion 3.5 拡散モデル オープンソース。LoRA・ControlNetで高度カスタマイズ可
Adobe Firefly 独自拡散モデル 商用利用を前提に設計。著作権リスクを低減
Ideogram 2.0 拡散モデル 画像内テキスト(文字)の精度が高い
Flux.1 フロー整合(Flow Matching) 高速・高精度。Stable Diffusionの後継として注目
Leonardo.Ai 拡散モデル ゲーム・キャラクター向けに特化
Imagen 3 拡散モデル Google製。フォトリアルな品質

ControlNet・LoRAとは

  • ControlNet:生成画像のポーズ・構図・輪郭を指示画像で制御する技術。「このポーズで生成」「この輪郭に合わせて」といった精密な条件付けが可能です。
  • LoRA(Low-Rank Adaptation):大規模モデルの一部パラメータのみを追加学習することで、特定のスタイルや人物の再現を効率的に行う技術。数百枚の画像で特定の絵柄を学習できます。

動画生成AI

動画生成AIは2024〜2026年に急成長した分野です。テキストや静止画から数秒〜数分の動画を生成します。現在も品質・長さ・一貫性の向上が続いており、最も進化が速いカテゴリの一つです。

← 横にスクロールできます →

サービス名 開発元 特徴
Sora 2 OpenAI 物理法則に基づく自然な動きの表現
Veo 3 Google DeepMind 音声付き動画生成。口の動きと音声が同期
Runway Gen-4 Runway 商用クリエイター向け。高い一貫性制御
Kling AI 2.0 快手(中国) 長尺・高品質。商用利用に対応
Luma Dream Machine Luma AI テキスト・画像からの高品質動画生成
Pika 2.2 Pika Labs 短尺SNS動画生成に強み
HeyGen 3.0 HeyGen AIアバター動画。多言語の口パク合成
Synthesia 4 Synthesia 企業向けプレゼン・研修動画自動生成
スポンサーリンク

音声合成AI(Text-to-Speech・TTS)

テキストを音声に変換するTTS技術は、ニューラルネットワークの導入で自然さが飛躍的に向上しました。現在は感情・話速・声質を細かく制御できるサービスが主流です。

← 横にスクロールできます →

サービス名 開発元 特徴
ElevenLabs ElevenLabs 最高品質の感情表現。声のクローン生成に対応
Google Cloud TTS Google 多言語対応・高精度。Wavenet/Standard複数音声
Azure Speech Services Microsoft 企業向けAPI。日本語音声の質が高い
VOICEVOX ヒホ 無料・日本語特化。感情パラメータ細かく調整可
Fish Audio Fish Audio 短い音声サンプルから声クローン生成
Murf AI Murf 英語ポッドキャスト・ナレーション向け
COEIROINK シロワニ VOICEVOX互換。二次創作向け声優音声
NaturalReader NaturalReader 長文読み上げ・学習支援向け

音声合成の技術豆知識

話者適応(Speaker Adaptation)技術により、数秒〜数分の録音サンプルから話者の声の特徴を学習し、その声で任意のテキストを読み上げる「声のクローン」が実現しています。悪用防止のため、多くのサービスで利用規約による制限が設けられています。

音楽生成AI

テキスト(歌詞・ジャンル指定)から楽曲を生成する音楽AIは、2023〜2024年に急速に普及しました。BGM制作・作曲支援・効果音生成など用途は多岐にわたります。

← 横にスクロールできます →

サービス名 特徴
Suno v4 テキストから歌詞付きフル楽曲を生成。品質・速度が業界最高水準
Udio 2 音楽スタイルの細かな指定が可能。高品質なアレンジ生成
AIVA(Artificial Intelligence Virtual Artist) クラシック・映画音楽系に強い。商用ライセンス付き
Stable Audio 2 Stability AI製。長尺・高品質音楽生成
MusicGen(Meta) オープンソース。研究・非商用利用向け
Google MusicFX Google製。テキストからBGM即時生成
Jukebox OpenAI製(旧世代)。音楽生成AIの先駆け
Beatoven.ai BGM・効果音生成に特化。著作権フリー
スポンサーリンク

コード生成AI

プログラムコードを自動生成・補完するAIは、開発者の生産性を大きく変えています。「プロンプトを書くだけでアプリが作れる」というヴァイブコーディング(Vibe Coding)スタイルも広がりました。

← 横にスクロールできます →

サービス名 特徴
GitHub Copilot Microsoft/GitHub製。VSCode等に統合されたコード補完
Claude Code Anthropic製AIエージェント。複雑なタスクの自律実行
Cursor AI統合型コードエディタ。コードベース全体を理解して補完
Devin Cognition製。自律型ソフトウェアエンジニアAI
Codeium(Windsurf) 無料・高速なコード補完。多言語対応
Amazon Q Developer AWS向けクラウド開発・セキュリティ支援
Tabnine プライバシー重視。ローカル環境での学習に対応
Replit AI ブラウザIDEに統合。ノーコード寄りの開発

マルチモーダルAI・エージェントAI

マルチモーダルAI

1つのモデルがテキスト・画像・音声・動画を統合的に処理できるマルチモーダルAIは、2025〜2026年に実用段階を迎えました。

← 横にスクロールできます →

種類 代表例 特徴
視覚言語モデル(VLM) GPT-4o・Gemini 2.5・Claude 3.5 画像を見て質問に答える・説明する
テキスト→画像変換 DALL-E 3・Ideogram テキスト指示から画像を生成
音声←→テキスト GPT-4o Audio・Gemini Audio 音声をリアルタイム処理・変換
動画理解 Gemini 2.5 Pro・GPT-4V 動画の内容を解析・質問応答
CLIP OpenAI テキストと画像を同一空間で対応付け。画像検索・分類の基盤技術

エージェントAI

指示を与えると、計画立案→ツール利用→実行→検証をループして自律的にタスクを完遂するAIを「エージェントAI」と呼びます。

← 横にスクロールできます →

種類 代表例 特徴
コーディングエージェント Claude Code・Devin コードの自律実行・バグ修正・テスト
リサーチエージェント Perplexity・ChatGPT Deep Research 複数ソースを検索・要約して回答
RPA型エージェント OpenAI Operator・Anthropic Computer Use ブラウザ・PCを自律操作
マルチエージェント AutoGen・CrewAI 複数のAIが連携して複雑なタスクを分担

エージェントAIの中核技術がTool Calling(ツール呼び出し)です。LLMが「いつ・どのツールを使うか」を判断し、検索・コード実行・API呼び出し・ファイル操作などを自律的に組み合わせます。代表的なエージェントの詳細は「AIエージェント一覧60種|8カテゴリで比較」で解説しています。

スポンサーリンク

生成AIの基盤アーキテクチャ(技術一覧)

生成AIを支える代表的なアーキテクチャ・技術を一覧にまとめます。どのサービスがどの技術を使っているかを理解する手がかりになります。

← 横にスクロールできます →

アーキテクチャ名 略称 特徴 主な用途
トランスフォーマー Transformer 2017年登場。自己注意機構(Self-Attention)でテキスト全体の文脈を捉える テキスト・コード生成の基盤
生成的敵対ネットワーク GAN 生成器と識別器を競わせて学習。リアルな画像・映像を生成できる 画像生成・顔変換
変分オートエンコーダ VAE データを潜在空間に圧縮・復元。学習が安定するが画像がぼやけやすい 画像・音楽の変換・補完
拡散モデル Diffusion Model ノイズを徐々に除去して画像を生成。現在の画像生成AIの主流技術 画像・動画・音声生成
フロー整合 Flow Matching 拡散モデルを改良した新技術。より高速・高精度な生成が可能 次世代画像生成(Flux等)
対比学習(クロスモーダル) CLIP テキストと画像を対で学習。「この絵に合うテキスト」の対応付けを学ぶ 画像検索・VLMの基盤
強化学習フィードバック RLHF 人間のフィードバックで出力品質を改善。有害出力の低減に使われる LLMのアライメント調整
LoRA LoRA 大規模モデルの一部パラメータのみ追加学習する効率的な微調整手法 画像スタイル・話者適応
制御付き生成 ControlNet 入力画像(輪郭・ポーズ等)を条件に画像を生成 キャラポーズ・構図制御
検索拡張生成 RAG 外部データベースを検索してから生成。知識の鮮度・正確性を向上 社内文書AI・最新情報応答

まとめ

生成AIは「何を生成するか」によって、テキスト・画像・動画・音声合成・音楽・コード・マルチモーダル・エージェントの8種類に大別されます。現在の主流技術はトランスフォーマー(テキスト)と拡散モデル(画像・動画・音声)で、これらを組み合わせたマルチモーダルAIがさらに進化を続けています。用途・目的に合わせて最適なサービスを選ぶ際の参考にしてみてください。

スポンサーリンク

腕試しクイズ(全5問)

生成AIの基盤技術を学んだら、理解度を確かめてみましょう。

腕試しクイズ(全5問)|生成AIの種類と技術
全5問。「採点する」で正解数と解説が表示されます。
第1問 GAN の正式名称として正しいのはどれですか?

第2問 拡散モデル(Diffusion Model)はどのように画像を生成しますか?

第3問 RAG(検索拡張生成)の正式名称として正しいのはどれですか?

第4問 LoRAはどのような目的で使われる技術ですか?

第5問 2017年に登場し、現在のテキスト生成AI(LLM)の基盤となっているアーキテクチャはどれですか?

(ファクトチェック後に追記予定)

一緒に読まれている人気記事


スポンサーリンク

X でフォローしよう!

おすすめの記事