🤖 AI・データ技術 徹底解説

生成AI/AIガバナンス/RAG・LLM/プライバシー保護技術/MLOps/AI規制

📋 目次

  1. 生成AIの特徴と活用
  2. AIガバナンス・AI利用規程
  3. RAG・LLMの仕組みと評価
  4. プライバシー保護技術
  5. MLOps・モデル監視
  6. AI規制・リスク管理
  7. 試験直前チェック

1. 生成AIの特徴と活用

生成AIとは

生成AI(Generative AI)は、学習したデータから新しいコンテンツ(テキスト・画像・音声・コード等)を生成するAIです。従来の判別型AI(分類・予測)と異なり、入力に対して新たなアウトプットを創造する点が特徴です。

特徴内容
大規模モデル大量データで事前学習したLLM(大規模言語モデル)がベース
汎用性プログラミングなしで多様なタスクに対応
ハルシネーションもっともらしい誤情報を自信を持って生成する問題
プロンプト依存入力の質によって出力品質が大きく変わる

ビジネス利用で注意すべき点

⚠️ 誤答パターン

「生成AIは常に正確な情報を生成する」は完全に誤り。ハルシネーションは生成AIの本質的な問題。「活用=人間のチェック不要」は危険な誤解。

2. AIガバナンス・AI利用規程

AIガバナンスの原則設計

AIガバナンスで最も重要な原則の組み合わせは透明性・説明可能性・公平性・人間によるオーバーサイト(監視)・プライバシー保護です。

AI利用規程の必須項目

📌 試験ポイント

「AI利用規程で法務・情報セキュリティ・人事が連携して盛り込むべき項目」→ 入力禁止情報ルール+ファクトチェック義務+著作権ルール+インシデント対応が4本柱。

AIレッドチーミング

AIシステムに対して攻撃者視点で脆弱性・不適切動作・バイアスを意図的に探索するテスト手法。リリース前にリスクを発見し、安全性・信頼性を高めることが主目的。

XAI(説明可能なAI)

AIの判断根拠を人間が理解できる形で説明する技術。信頼性向上・規制対応・バイアス検出が主目的。金融・医療など高リスク分野で特に重要。

3. RAG・LLMの仕組みと評価

RAG(検索拡張生成)の優位点

RAG(Retrieval-Augmented Generation)は、LLMが回答を生成する際に外部知識ベースをリアルタイムに検索し参照する手法です。

比較ファインチューニングRAG
知識更新再学習が必要(コスト高)検索DB更新だけで対応可(低コスト)
鮮度学習データ時点で固定最新情報をリアルタイム参照可能
出典提示困難参照文書を明示しやすい

LLM評価(Eval)設計

実運用の品質保証に直結するLLM評価には、ゴールデンセット(正解付きテストケース)による自動評価+人間評価の組み合わせが有効です。また、本番入出力からの継続的サンプリング評価(オンライン評価)が品質維持に不可欠。

ハルシネーション対策

社内検索への生成AI展開アーキテクチャ

社内知識検索に生成AIを活用する場合、RAG+ベクターDB(社内文書のembedding検索)の組み合わせが事実性と鮮度を両立する最適構成です。LLMだけに頼ると古い知識や誤情報のリスクが増大します。

4. プライバシー保護技術

差分プライバシー(Differential Privacy)

データ集合に統計的ノイズを加えることで、個人データを特定されることなく統計分析を可能にする技術。「あるデータに1人のレコードを追加/除外しても集計結果がほぼ変わらない」という数学的保証を提供。

連合学習(Federated Learning)

データを中央サーバーに集めずに、各端末でモデルを学習し勾配(更新情報)だけを共有する分散機械学習手法。医療・金融など機密データをクラウドに送れない領域で有効。

準同型暗号(Homomorphic Encryption)

暗号化したままデータを演算でき、復号せずに計算結果を得られる暗号技術。クラウドへのデータ提供なしに第三者が計算サービスを提供できる実務的価値がある。計算コストが高い点が課題。

ゼロ知識証明(ZKP)

証明者が「知っていること」を、その内容を一切開示せずに検証者に証明できる暗号プロトコル。本人確認・ブロックチェーン取引のプライバシー保護などに応用。

合成データ(Synthetic Data)の留意点

合成データは元データの統計的性質を模倣して人工的に生成されたデータ。プライバシー保護に有用ですが、元データの偏りをそのまま引き継ぐリスクがあります。偏り緩和には「元データの偏りを意図的に修正した合成データ生成」と「統計的品質検証」が必要。

5. MLOps・モデル監視

モデルドリフトとは

本番環境でのデータ分布が学習時から変化し、モデルの精度が経時劣化する現象。データドリフト(入力の変化)とコンセプトドリフト(入力と出力の関係自体の変化)がある。

モデルドリフト対処のMLOps実践

SHAP値(説明可能性)

SHAPは各特徴量が予測結果にどれだけ貢献したかを定量化する手法。「この予測値がこの数値になったのは、特徴量Aが+X影響し、特徴量Bが-Y影響したから」という形で解釈できます。個別の予測説明に特に有効。

6. AI規制・リスク管理

リスクベース・アプローチ(EU AI法)

AIをリスクの高さで分類し、高リスクAIには厳格な規制・低リスクには軽い義務を課すアプローチ。EUのAI法(AI Act)が採用。禁止用途(社会スコアリング等)・高リスク(医療・インフラ)・限定リスク・最小リスクの4層。

プロンプトインジェクション対策

悪意ある指示をプロンプトに埋め込みAIの動作を乗っ取る攻撃。対策として入力のサニタイズ・システムプロンプトと外部入力の分離・出力の監視・権限の最小化が有効。

LLM監査(AI Audit)の観点

LLMの最低限の監査項目は①バイアス・公平性(差別的出力がないか)②ハルシネーション率プロンプトインジェクション耐性著作権侵害リスク有害コンテンツ生成リスク

📌 試験ポイント

「XAIの主目的」→ モデルの判断を人間が理解・信頼できるようにすること(ブラックボックス問題の解消)。「性能向上」や「計算速度改善」は誤り。

7. 試験直前チェックポイント

キーワード正解の方向性
生成AIの特徴新コンテンツを生成・汎用性・ハルシネーションのリスクあり
ハルシネーション対策RAG+人間チェック。出典明示。
RAGの優位点ファインチューニング不要・知識の鮮度維持・出典提示
差分プライバシー統計ノイズで個人特定を防ぎながら集計分析
連合学習データ非送信でモデル学習・プライバシー保護
モデルドリフト対処継続監視・自動アラート・定期再学習パイプライン
SHAP値各特徴量の予測貢献度の定量化・個別説明
AIリスクベースリスク高さで規制の重さを変える(EU AI法)
XAI目的判断根拠を人間が理解できるようにする(信頼性・規制対応)
AI利用規程の必須項目入力禁止情報+ファクトチェック義務+著作権ルール

確認問題(時事・応用)

この記事の内容に対応する確認問題です。まず自分で答えを考え、「答えと解説を見る」で正解と解説を確認しましょう。このテーマを含む時事・応用の問題集(全問)や、本番形式(選択・採点つき)のトップページのクイズもご利用ください。

Q1. 『ChatGPT』など生成AIの特徴として最も正しいものはどれか?

答えと解説を見る

正解:自然言語処理により人間のような文章生成が可能

解説:生成AIは文章・画像などを自動生成できる新しいAI技術です。

生成AI(Generative AI)は、膨大なデータを学習して新しい文章・画像・音声などを生成するAI技術です。ChatGPTは大規模言語モデル(LLM)を利用しており、人間のように自然な会話や要約、翻訳、アイデア出しなどを行うことができます。

Q2. 『生成AI』のビジネス利用で特に注意すべき点はどれか?

答えと解説を見る

正解:著作権や情報漏えいなど法的リスクの管理

解説:生成AIは著作権・個人情報・倫理面の配慮が必要です。

生成AIの活用には、著作権侵害リスク、個人情報の混入、企業秘密の漏えい、データバイアスなどのリスクがあります。特に業務利用ではプロンプト(入力)に機密情報を含めない、生成物の権利を確認する、出力結果を検証するなどの管理が不可欠です。

Q3. 生成AI導入におけるガバナンスとして適切なのはどれか?

答えと解説を見る

正解:利用ポリシー整備と人によるレビュー・ログ管理

解説:利用ルール、人的監督、監査可能なログが要諦です。

生成AIの導入には、情報漏えい、著作権、バイアス、説明可能性などのリスクがあります。利用ポリシー、教育、レビュー体制、プロンプト管理、ログ監査が重要で、企業ではAIガバナンス委員会の設置が進む例もあります。

Q4. 『XAI(説明可能なAI)』の主目的として最も適切なのはどれか?

答えと解説を見る

正解:AIの判断根拠を人が理解できる形で示す

解説:説明可能性は信頼・規制対応・改善に不可欠です。

XAI(Explainable AI)は、モデルの意思決定過程を人が理解できる形で提示する技術です。重要度スコア、SHAP値、可視化、ルール抽出などにより、透明性・公平性・検証可能性を高め、金融・医療など規制産業で特に重要視されています。

Q5. 大規模言語モデルの『ハルシネーション』対策として妥当なのはどれか?

答えと解説を見る

正解:出力の検証フローと根拠提示(RAG等)の導入

解説:根拠データを参照する仕組みと人手検証の併用が有効です。

ハルシネーションとは、AIがもっともらしいが誤った情報を生成する現象です。RAG(検索拡張生成)、ガードレール設計、ファクトチェックのワークフロー、出力制御などを組み合わせることでリスクを軽減します。

Q6. AI規制で採用される『リスクベース・アプローチ』の要点として最も適切なのはどれか?

答えと解説を見る

正解:用途のリスク水準に応じて義務や制限を差別化する

解説:高リスク用途ほど厳格な要件を課す考え方です。

EU AI Actなどの規制では、医療・雇用・信用審査などの高リスク用途には説明責任、データ品質、人的監督、記録保持など高度な要件を課し、低リスク用途には軽い規制とする段階付けが採用されています。

Q7. 生成AIの『プロンプトインジェクション』に対する有効な対策はどれか?

答えと解説を見る

正解:入出力の検疫とポリシー分離(コンテンツ制御・ツール権限の最小化)

解説:権限境界の明確化と入出力フィルタで攻撃面を狭めます。

プロンプトインジェクション攻撃対策として、システムプロンプトの保護、入出力フィルタリング、外部ツールのサンドボックス化、権限分離、RAGによる出典検証、ログ監査などを組み合わせることが有効です。

Q8. 『RAG(検索拡張生成)』が従来の微調整(ファインチューニング)に比べて優れる点はどれか?

答えと解説を見る

正解:最新の外部知識を都度参照できる

解説:外部コーパスを参照して事実性と鮮度を高めます。

RAGは検索データベースから最新情報を取得し、生成に反映するため、モデル本体を再学習しなくても領域知識を更新できます。企業向けFAQや専門領域で特に有効です。

Q9. 『差分プライバシー(Differential Privacy)』の核心概念はどれか?

答えと解説を見る

正解:統計出力にノイズを加え、個人の寄与を推測困難にする

解説:適切なノイズ付与で個別の影響を目立たなくします。

差分プライバシーは、統計的集計結果にノイズを加え、個々のデータが出力に与える影響を最小化する技術です。ε(イプシロン)でプライバシー損失を制御し、秘匿性とデータ有用性のバランスを取ります。

Q10. 『連合学習(Federated Learning)』の利点として最も適切なのはどれか?

答えと解説を見る

正解:データを端末に留めたままモデルだけを共有更新できる

解説:ローカル学習・グローバル集約でプライバシーと性能を両立します。

連合学習では、各端末がローカルでモデル更新を行い、学習済みパラメータのみがサーバに共有されるため、センシティブなデータを中央に集める必要がありません。医療・金融などで実装が進んでいます。

Q11. 『準同型暗号(Homomorphic Encryption)』の実務的な価値はどれか?

答えと解説を見る

正解:暗号化状態のまま演算し、秘匿性を維持した計算を可能にする

解説:機密データを開示せずに分析できる基盤技術です。

準同型暗号は、データを暗号化したまま加算・乗算などの演算を可能にする技術で、プライバシー保護計算の中核技術です。完全準同型は計算負荷が高いものの、部分的準同型や最適化により実用化が進んでいます。

Q12. 『ゼロ知識証明(ZKP)』の特徴として適切なのはどれか?

答えと解説を見る

正解:真偽のみを第三者に示し、内実のデータは明かさない

解説:プライバシーを保ちつつ検証可能性を提供します。

ゼロ知識証明は、具体的なデータを公開せずに“ある主張が真である”ことだけを第三者に証明できる技術で、ブロックチェーン、ID管理、コンプライアンス等に応用されています。非対話型(zk-SNARK等)方式も普及しています。

Q13. 『モデルドリフト』に対処するMLOpsの実践として妥当なのはどれか?

答えと解説を見る

正解:データ分布監視と再学習・再評価の継続プロセスを組み込む

解説:入力分布や概念の変化を検知し、モデルを更新します。

モデルドリフトは、時間経過に伴うデータ分布や概念の変化により、モデルの性能が低下する現象です。MLOpsでは、データ分布・特徴量・誤差の監視、異常アラート、再学習パイプライン、A/Bテスト、ロールバック(旧モデルへの切替え)などの仕組みを継続的に運用し、品質を維持します。

Q14. 『説明可能性(XAI)』におけるSHAP値の解釈として正しいのはどれか?

答えと解説を見る

正解:各特徴量の予測への貢献度をゲーム理論に基づき定量化する

解説:Shapley値を拡張し、予測への寄与を測ります。

SHAP(SHapley Additive exPlanations)は、ゲーム理論のShapley値を応用し、各特徴量が“予測結果にどの程度寄与したか”を定量的に評価します。個々の予測に対する寄与度可視化(ローカル解釈)と、全体傾向の分析(グローバル解釈)の両方に使用でき、ブラックボックスモデルの信頼性評価に有効です。

Q15. 『AIガバナンス』の原則設計で最も重要な組合せはどれか?

答えと解説を見る

正解:人による監督・透明性・公平性・安全性を統合的に設計する

解説:価値・リスク・規制を踏まえた包括設計が要諦です。

AIガバナンスの基盤は、透明性(説明可能性)、公平性(バイアス管理)、安全性(事故防止)、プライバシー保護、人による監督など複数要素の統合です。利用ポリシーの策定、影響評価(AIA)、権限管理、ログ監査、インシデント対応計画をセットで構築することが求められます。

Q16. 『合成データ(Synthetic Data)』活用の留意点として最も適切なのはどれか?

答えと解説を見る

正解:統計特性の再現性・バイアス・再識別耐性などを多面的に評価し、利用範囲を適切に定義する

解説:品質・バイアス・秘匿性の検証が不可欠。

合成データはプライバシー保護と有用性を両立させる技術だが、再識別リスク、分布忠実度、偏り、モデルの逸脱などを定量評価する必要があります。また、用途制限と監査証跡を明確化しなければ誤用リスクが高まります。

Q17. 『LLM監査(AI Audit)』で最低限確認すべき観点はどれか?

答えと解説を見る

正解:データ来歴・偏り・評価指標・安全性・ログ管理などを、モデルカード等と照合して体系的に検証する

解説:来歴・偏り・安全性の総合監査が必須。

LLM監査では、データ来歴、PII混入の有無、偏り、評価指標、ログ保持、出力リスク、安全装置(ガードレール)の有効性などを総合的に確認します。単なる速度・コスト監査では不十分です。

Q18. 生成AIを社内検索や知識共有へ展開する際、事実性と鮮度を両立させるためのアーキテクチャとして最適なのはどれか?

答えと解説を見る

正解:RAGを用いて承認済みコンテンツを動的に参照し、出典提示・権限管理・監査ログを統合する

解説:RAG×承認コーパス×ガバナンスが最適解。

企業向けLLMでは、最新情報を逐一学習させるとコスト・リスクが増加します。RAGにより承認済み情報源を検索参照し、出典提示・アクセス制御・監査ログを併用することで事実性・鮮度・安全性を一体で担保できます。

Q19. 企業が『AIレッドチーミング』を導入する主な狙いとして、最も適切なのはどれか?

答えと解説を見る

正解:データ抽出・越権実行・有害出力などの攻撃シナリオを模擬し、脆弱性評価とガードレール強化に役立てる

解説:攻撃模擬で弱点を可視化し対策を更新する手法。

レッドチーミングは、プロンプトインジェクション・情報漏えい・データ抽出・越権操作などを疑似攻撃として試験し、ガードレール・権限制御・ログ強化・インシデント対応を改善するための枠組みです。

Q20. 『合成データ(Synthetic Data)』の利用で、訓練データの偏りを緩和しつつプライバシーリスクを抑えるために重要な検証はどれか?

答えと解説を見る

正解:再識別耐性・分布忠実度・ユースケース適合性の三点検証

Q21. 『LLMの評価(Eval)』において、実運用の品質保証に直結する設計として最も妥当なのはどれか?

答えと解説を見る

正解:自動化評価(タスク別メトリクス)と人手評価(安全性・有用性)の二層を継続運用し、デプロイ前後で回帰を監視する

Q22. 『AI利用規程』を整備する際、企業の法務・情報セキュリティ・人事が連携して盛り込むべき最低項目として最も適切なのはどれか?

答えと解説を見る

正解:利用範囲・禁止事項・機密データ管理・出典とライセンス・個人情報・監査ログ・インシデント対応を包括的に定義するため

Q23. 生成AIの代表的な特徴として最も適切なのはどれか?

答えと解説を見る

正解:学習データをもとに新しい文章や画像などを生成できる

解説:生成AIは文章・画像などを生成するAIです。

生成AIは大規模データを学習し、新しい文章・画像・音声などを生成する技術です。ただし誤情報を出す可能性もあり、利用時の確認が必要です。

Q24. 生成AI(Generative AI)における「ハルシネーション(Hallucination)」とはどのような現象か?

答えと解説を見る

正解:AIが事実と異なる情報を自信満々に生成・提示する現象

解説:ハルシネーション=LLMが事実と異なる情報をもっともらしく生成する現象。

ハルシネーション(Hallucination):大規模言語モデル(LLM)が実際には存在しない情報・引用・統計を自信を持って提示する現象。LLMが「正しい確率の高い次のトークン」を予測する仕組みに起因する。RAG(検索拡張生成)・ファインチューニング・ファクトチェック統合で軽減を試みる。

Q25. AIの「EU AI法(EU Artificial Intelligence Act)」における「高リスクAI」の例として含まれるものはどれか?

答えと解説を見る

正解:採用・信用スコアリング・医療診断・重要インフラ管理に使われるAI

解説:EU AI法の高リスクAI:採用・与信・医療・インフラ等の重要意思決定に使われるAI。

EU AI法(2024年施行):AIをリスクレベル別に規制する世界初の包括的AI規制法。高リスクAI(Annex III):①教育・採用における分類・選考AI、②信用スコアリング・保険評価、③医療診断支援、④重要インフラ管理、⑤法執行・司法など。高リスクAIには適合性評価・文書化・人間による監視義務が課される。

Q26. 「フェデレーテッドラーニング(Federated Learning)」の特徴として正しいものはどれか?

答えと解説を見る

正解:データを中央に集めず各デバイス・サーバーでモデルを学習し集約するプライバシー保護型AI学習

解説:フェデレーテッドラーニング:データを分散したまま各サイトで学習し、モデルのみ集約。

フェデレーテッドラーニング(Federated Learning):各デバイスや組織がローカルデータをサーバーに送らず、自サイトでモデルを学習。モデルの更新情報(パラメータ)のみを集約サーバーが収集し、グローバルモデルを改善する手法。個人情報・センシティブデータの保護とAI学習を両立できる。医療・金融での活用が期待される。

Q27. 「説明可能なAI(XAI:Explainable AI)」が求められる主な理由はどれか?

答えと解説を見る

正解:AIの意思決定プロセスを人間が理解・検証できるようにして信頼性・公平性・規制対応を確保するため

解説:XAI:AIがなぜその判断をしたかを説明できるようにする技術・設計。

XAI(Explainable AI):医療診断・融資審査・採用判断など重要な意思決定にAIを使う場合、「なぜその結果が出たか」を説明できる必要がある。理由:①法的根拠の説明義務(GDPR・EU AI法)、②バイアス発見・公平性確保、③エラー原因の特定・改善。SHAPやLIMEなどの技術が使われる。

Q28. 「データメッシュ(Data Mesh)」アーキテクチャの特徴として正しいものはどれか?

答えと解説を見る

正解:データを各ドメイン(事業部門)が所有・管理し、データプロダクトとして提供する分散型アーキテクチャ

解説:データメッシュ:各ドメインがデータオーナーとなる分散型データ管理。

データメッシュ(Data Mesh):ザマク・デガニが提唱。従来の中央集権型(中央データチームが全データを管理)に代わり、各事業ドメイン(チーム)が自分たちのデータをプロダクトとして所有・管理・提供する分散型アーキテクチャ。大企業での中央データチームのボトルネック解消が目的。

Q29. 生成AIのビジネス活用で「RAG(Retrieval-Augmented Generation)」が有効なユースケースはどれか?

答えと解説を見る

正解:最新の社内文書・データベースをLLMに参照させてハルシネーションを減らしたい場合

解説:RAG:社内ドキュメントを検索してLLMの回答精度・最新性を向上させる。

RAG(Retrieval-Augmented Generation):LLMが生成する際に外部データベース・文書ストアを検索し、関連文書を取得してコンテキストとして与える手法。利点:①最新の社内情報・特定ドメイン知識を反映できる、②ハルシネーション低減、③ファインチューニングよりも低コスト。カスタマーサポートや社内Q&Aに広く使われる。

Q30. 「データガバナンス」において「データオーナー」と「データスチュワード」の役割の違いはどれか?

答えと解説を見る

正解:オーナーはデータの最終責任者(ビジネス側)、スチュワードはデータ品質・定義の管理担当者(技術・業務)

解説:データオーナー=ビジネス責任者、スチュワード=データ品質管理者。

データガバナンスの役割分担:Data Owner(データオーナー)は当該データに関するビジネス上の最終責任者(通常は事業部門の管理職)。Data Steward(データスチュワード)はデータ定義・品質・分類・メタデータ管理の実務担当者(業務・IT双方に精通した人材)。両者の協力でデータ品質と活用が進む。

Q31. AIの「バイアス(偏り)」問題が社会的に重要視される理由はどれか?

答えと解説を見る

正解:偏ったデータで学習したAIが採用・融資・医療等で特定グループに不当な不利益を与えるリスクがあるから

解説:AIバイアス:学習データの偏りが差別・不公平な意思決定を引き起こすリスク。

AIバイアス(Algorithmic Bias):AIモデルが歴史的な偏りを含むデータで学習することで、採用AI(特定の性別・人種を不当に排除)・与信AI(マイノリティを過度に高リスク評価)・顔認識AI(特定人種で精度が低い)など、特定グループへの差別・不公平な結果が生じる問題。EU AI法でも高リスクAIの公平性評価を義務化。

Q32. 2025年に施行されたEUの「AI法(AI Act)」における「高リスクAI」の規制内容として正しいものはどれか?

答えと解説を見る

正解:雇用・信用審査・重要インフラ等に使用するAIシステムには事前適合性評価・透明性確保・人間による監督が義務付けられる

解説:EU AI ActはAIをリスク別に分類し、高リスク用途には適合性評価・透明性・人間監督を義務化。

EU AI Act(2024年成立・2025年段階施行):世界初の包括的AI規制法。AIをリスク別に「容認不能(禁止)」「高リスク」「限定リスク」「最小リスク」に分類。高リスクAI(採用選考・信用スコアリング・重要インフラ・教育評価等)には事前適合性評価・登録・技術文書整備・人間による監督・透明性確保を義務化。違反時の制裁金は最大3,000万ユーロまたは全世界売上高6%。

Q33. 「AIエージェント(Agentic AI)」の特徴として最も正しいものはどれか?

答えと解説を見る

正解:自律的に目標を設定し、ツール使用・Web検索・コード実行などを組み合わせて複数ステップのタスクを自動完了するAIシステム

解説:AIエージェントは自律的に計画・ツール使用・実行を繰り返し複雑なタスクを完遂するAI。

AIエージェント(Agentic AI):LLMを核に「計画→ツール使用→実行→評価→再計画」のループを自律的に回すシステム。Web検索・コード実行・APIコール・ファイル操作などのツールを組み合わせ、人間の介入なしに複数ステップのタスクを完了する。2025年はOpenAI Operator・Google Agentspace・Anthropic Claudeのエージェント機能が実用段階に入り、RPA代替・業務自動化への応用が急拡大している。