
テキストを入力するだけで、画像や動画、音楽、コードまで自動生成する——生成AIはここ数年で急速に多様化し、出力できるコンテンツの種類が大きく広がりました。この記事では、2026年時点における生成AIの全種類を出力モダリティ別に整理し、各種類の代表サービスと仕組みを支える基盤技術(アーキテクチャ)まで一覧でまとめます。「テキスト・画像・動画・音声・音楽・コード・マルチモーダル・エージェント」の8分類を網羅した保存版です。
生成AIの種類を出力形式で分類
生成AIとは、学習したデータをもとに新しいコンテンツを「生成」するAIの総称です。何を生成するかによって大きく8種類に分類されます。
← 横にスクロールできます →
| 分類 | 生成するもの | 主な技術 | 代表サービス |
|---|---|---|---|
| テキスト生成AI | 文章・会話・要約 | LLM・Transformer | ChatGPT・Claude・Gemini |
| 画像生成AI | 静止画・イラスト | 拡散モデル・GAN | Midjourney・DALL-E 3・Stable Diffusion |
| 動画生成AI | 動画・アニメーション | 動画拡散モデル | Sora・Veo・Runway |
| 音声合成AI | 音声・ナレーション | ニューラルTTS | ElevenLabs・VOICEVOX |
| 音楽生成AI | 楽曲・BGM | 音楽トークナイザ | Suno・Udio・AIVA |
| コード生成AI | プログラムコード | コードLLM | GitHub Copilot・Cursor |
| マルチモーダルAI | 複数形式の統合処理 | CLIP・VLM | GPT-4o・Gemini 2.5 Pro |
| エージェントAI | タスクの自律実行 | Tool Calling・RAG | Claude Code・Devin |
テキスト生成AI(大規模言語モデル・LLM)
テキスト生成AIは、大量のテキストデータで学習した大規模言語モデル(LLM: Large Language Model)を中心に発展してきました。質問への回答・文章作成・翻訳・要約など、言語に関わるほぼあらゆるタスクに対応します。各技術の詳しい用語解説は「AI・機械学習の用語一覧|基礎から最新LLM用語まで180語まとめ」もあわせてご覧ください。
← 横にスクロールできます →
| モデル名 | 開発元 | 特徴 |
|---|---|---|
| ChatGPT(GPT-4o/GPT-5) | OpenAI | 世界最大のユーザー数。会話・創作・分析に強い |
| Claude(Opus/Sonnet/Haiku) | Anthropic | 長文処理と安全性設計に注力。文脈保持が得意 |
| Gemini 2.5 Pro | Google DeepMind | Googleサービスとの連携。マルチモーダル統合 |
| Llama 3.x | Meta | オープンソースLLM。自社サーバーへの展開が可能 |
| Mistral Large | Mistral AI | 軽量かつ高精度。欧州プライバシー法規制に対応 |
| DeepSeek V3 | 深度求索(中国) | 低コスト・高性能で注目を集めたオープンソースLLM |
| Qwen(通義千問) | Alibaba | 多言語対応の中国発LLM。日本語処理も向上 |
| Command R+ | Cohere | エンタープライズ向けRAG特化LLM |
テキスト生成AIの豆知識:RAGとは
RAG(Retrieval-Augmented Generation=検索拡張生成)は、LLMの弱点である「知識の古さ・ハルシネーション」を補う技術です。ユーザーの質問に対し、外部データベースや社内文書を検索してから回答を生成するため、最新情報や専用知識を扱う企業向けAIに広く採用されています。
画像生成AI
テキストプロンプトから画像を生成する技術は、現在拡散モデル(Diffusion Model)が主流です。2022年のStable Diffusion公開を機に民主化が進み、2026年時点では商用品質の画像が数秒で生成できます。
← 横にスクロールできます →
| サービス名 | 基盤技術 | 特徴 |
|---|---|---|
| Midjourney v7 | 独自拡散モデル | 芸術的・高品質アート生成。コミュニティ利用が活発 |
| DALL-E 3 | 拡散モデル | ChatGPTと統合。自然言語の指示に忠実 |
| Stable Diffusion 3.5 | 拡散モデル | オープンソース。LoRA・ControlNetで高度カスタマイズ可 |
| Adobe Firefly | 独自拡散モデル | 商用利用を前提に設計。著作権リスクを低減 |
| Ideogram 2.0 | 拡散モデル | 画像内テキスト(文字)の精度が高い |
| Flux.1 | フロー整合(Flow Matching) | 高速・高精度。Stable Diffusionの後継として注目 |
| Leonardo.Ai | 拡散モデル | ゲーム・キャラクター向けに特化 |
| Imagen 3 | 拡散モデル | Google製。フォトリアルな品質 |
ControlNet・LoRAとは
- ControlNet:生成画像のポーズ・構図・輪郭を指示画像で制御する技術。「このポーズで生成」「この輪郭に合わせて」といった精密な条件付けが可能です。
- LoRA(Low-Rank Adaptation):大規模モデルの一部パラメータのみを追加学習することで、特定のスタイルや人物の再現を効率的に行う技術。数百枚の画像で特定の絵柄を学習できます。
動画生成AI
動画生成AIは2024〜2026年に急成長した分野です。テキストや静止画から数秒〜数分の動画を生成します。現在も品質・長さ・一貫性の向上が続いており、最も進化が速いカテゴリの一つです。
← 横にスクロールできます →
| サービス名 | 開発元 | 特徴 |
|---|---|---|
| Sora 2 | OpenAI | 物理法則に基づく自然な動きの表現 |
| Veo 3 | Google DeepMind | 音声付き動画生成。口の動きと音声が同期 |
| Runway Gen-4 | Runway | 商用クリエイター向け。高い一貫性制御 |
| Kling AI 2.0 | 快手(中国) | 長尺・高品質。商用利用に対応 |
| Luma Dream Machine | Luma AI | テキスト・画像からの高品質動画生成 |
| Pika 2.2 | Pika Labs | 短尺SNS動画生成に強み |
| HeyGen 3.0 | HeyGen | AIアバター動画。多言語の口パク合成 |
| Synthesia 4 | Synthesia | 企業向けプレゼン・研修動画自動生成 |
音声合成AI(Text-to-Speech・TTS)
テキストを音声に変換するTTS技術は、ニューラルネットワークの導入で自然さが飛躍的に向上しました。現在は感情・話速・声質を細かく制御できるサービスが主流です。
← 横にスクロールできます →
| サービス名 | 開発元 | 特徴 |
|---|---|---|
| ElevenLabs | ElevenLabs | 最高品質の感情表現。声のクローン生成に対応 |
| Google Cloud TTS | 多言語対応・高精度。Wavenet/Standard複数音声 | |
| Azure Speech Services | Microsoft | 企業向けAPI。日本語音声の質が高い |
| VOICEVOX | ヒホ | 無料・日本語特化。感情パラメータ細かく調整可 |
| Fish Audio | Fish Audio | 短い音声サンプルから声クローン生成 |
| Murf AI | Murf | 英語ポッドキャスト・ナレーション向け |
| COEIROINK | シロワニ | VOICEVOX互換。二次創作向け声優音声 |
| NaturalReader | NaturalReader | 長文読み上げ・学習支援向け |
音声合成の技術豆知識
話者適応(Speaker Adaptation)技術により、数秒〜数分の録音サンプルから話者の声の特徴を学習し、その声で任意のテキストを読み上げる「声のクローン」が実現しています。悪用防止のため、多くのサービスで利用規約による制限が設けられています。
音楽生成AI
テキスト(歌詞・ジャンル指定)から楽曲を生成する音楽AIは、2023〜2024年に急速に普及しました。BGM制作・作曲支援・効果音生成など用途は多岐にわたります。
← 横にスクロールできます →
| サービス名 | 特徴 |
|---|---|
| Suno v4 | テキストから歌詞付きフル楽曲を生成。品質・速度が業界最高水準 |
| Udio 2 | 音楽スタイルの細かな指定が可能。高品質なアレンジ生成 |
| AIVA(Artificial Intelligence Virtual Artist) | クラシック・映画音楽系に強い。商用ライセンス付き |
| Stable Audio 2 | Stability AI製。長尺・高品質音楽生成 |
| MusicGen(Meta) | オープンソース。研究・非商用利用向け |
| Google MusicFX | Google製。テキストからBGM即時生成 |
| Jukebox | OpenAI製(旧世代)。音楽生成AIの先駆け |
| Beatoven.ai | BGM・効果音生成に特化。著作権フリー |
コード生成AI
プログラムコードを自動生成・補完するAIは、開発者の生産性を大きく変えています。「プロンプトを書くだけでアプリが作れる」というヴァイブコーディング(Vibe Coding)スタイルも広がりました。
← 横にスクロールできます →
| サービス名 | 特徴 |
|---|---|
| GitHub Copilot | Microsoft/GitHub製。VSCode等に統合されたコード補完 |
| Claude Code | Anthropic製AIエージェント。複雑なタスクの自律実行 |
| Cursor | AI統合型コードエディタ。コードベース全体を理解して補完 |
| Devin | Cognition製。自律型ソフトウェアエンジニアAI |
| Codeium(Windsurf) | 無料・高速なコード補完。多言語対応 |
| Amazon Q Developer | AWS向けクラウド開発・セキュリティ支援 |
| Tabnine | プライバシー重視。ローカル環境での学習に対応 |
| Replit AI | ブラウザIDEに統合。ノーコード寄りの開発 |
マルチモーダルAI・エージェントAI
マルチモーダルAI
1つのモデルがテキスト・画像・音声・動画を統合的に処理できるマルチモーダルAIは、2025〜2026年に実用段階を迎えました。
← 横にスクロールできます →
| 種類 | 代表例 | 特徴 |
|---|---|---|
| 視覚言語モデル(VLM) | GPT-4o・Gemini 2.5・Claude 3.5 | 画像を見て質問に答える・説明する |
| テキスト→画像変換 | DALL-E 3・Ideogram | テキスト指示から画像を生成 |
| 音声←→テキスト | GPT-4o Audio・Gemini Audio | 音声をリアルタイム処理・変換 |
| 動画理解 | Gemini 2.5 Pro・GPT-4V | 動画の内容を解析・質問応答 |
| CLIP | OpenAI | テキストと画像を同一空間で対応付け。画像検索・分類の基盤技術 |
エージェントAI
指示を与えると、計画立案→ツール利用→実行→検証をループして自律的にタスクを完遂するAIを「エージェントAI」と呼びます。
← 横にスクロールできます →
| 種類 | 代表例 | 特徴 |
|---|---|---|
| コーディングエージェント | Claude Code・Devin | コードの自律実行・バグ修正・テスト |
| リサーチエージェント | Perplexity・ChatGPT Deep Research | 複数ソースを検索・要約して回答 |
| RPA型エージェント | OpenAI Operator・Anthropic Computer Use | ブラウザ・PCを自律操作 |
| マルチエージェント | AutoGen・CrewAI | 複数のAIが連携して複雑なタスクを分担 |
エージェントAIの中核技術がTool Calling(ツール呼び出し)です。LLMが「いつ・どのツールを使うか」を判断し、検索・コード実行・API呼び出し・ファイル操作などを自律的に組み合わせます。代表的なエージェントの詳細は「AIエージェント一覧60種|8カテゴリで比較」で解説しています。
生成AIの基盤アーキテクチャ(技術一覧)
生成AIを支える代表的なアーキテクチャ・技術を一覧にまとめます。どのサービスがどの技術を使っているかを理解する手がかりになります。
← 横にスクロールできます →
| アーキテクチャ名 | 略称 | 特徴 | 主な用途 |
|---|---|---|---|
| トランスフォーマー | Transformer | 2017年登場。自己注意機構(Self-Attention)でテキスト全体の文脈を捉える | テキスト・コード生成の基盤 |
| 生成的敵対ネットワーク | GAN | 生成器と識別器を競わせて学習。リアルな画像・映像を生成できる | 画像生成・顔変換 |
| 変分オートエンコーダ | VAE | データを潜在空間に圧縮・復元。学習が安定するが画像がぼやけやすい | 画像・音楽の変換・補完 |
| 拡散モデル | Diffusion Model | ノイズを徐々に除去して画像を生成。現在の画像生成AIの主流技術 | 画像・動画・音声生成 |
| フロー整合 | Flow Matching | 拡散モデルを改良した新技術。より高速・高精度な生成が可能 | 次世代画像生成(Flux等) |
| 対比学習(クロスモーダル) | CLIP | テキストと画像を対で学習。「この絵に合うテキスト」の対応付けを学ぶ | 画像検索・VLMの基盤 |
| 強化学習フィードバック | RLHF | 人間のフィードバックで出力品質を改善。有害出力の低減に使われる | LLMのアライメント調整 |
| LoRA | LoRA | 大規模モデルの一部パラメータのみ追加学習する効率的な微調整手法 | 画像スタイル・話者適応 |
| 制御付き生成 | ControlNet | 入力画像(輪郭・ポーズ等)を条件に画像を生成 | キャラポーズ・構図制御 |
| 検索拡張生成 | RAG | 外部データベースを検索してから生成。知識の鮮度・正確性を向上 | 社内文書AI・最新情報応答 |
まとめ
生成AIは「何を生成するか」によって、テキスト・画像・動画・音声合成・音楽・コード・マルチモーダル・エージェントの8種類に大別されます。現在の主流技術はトランスフォーマー(テキスト)と拡散モデル(画像・動画・音声)で、これらを組み合わせたマルチモーダルAIがさらに進化を続けています。用途・目的に合わせて最適なサービスを選ぶ際の参考にしてみてください。
腕試しクイズ(全5問)
生成AIの基盤技術を学んだら、理解度を確かめてみましょう。
(ファクトチェック後に追記予定)