PMLE 学習ハブ
📘 基礎 / 🔧 実践 / 🎯 発展

§1 ローコード AI ソリューションの設計

コードを最小限に AI を実装する手段(AutoML / 基盤モデル / API)の使い分けを問う。比重 ~13%

このセクションの結論 既製で済むなら API、SQL で済むなら BigQuery ML、コードレスなら AutoML、生成系なら Model Garden。コードを書くのは最後の手段。

🌳 意思決定ツリー

タスクは「コードを書かずに既存モデルでいけるか?」 ├─ YES → 既製 API(Vision / Document AI / Translate / STT) └─ NO → ├─ 生成系(テキスト/画像/動画)→ Model Garden(Gemini / Imagen / Veo) │ └─ プロンプトで不足 → ファインチューニング(PEFT / LoRA) ├─ 構造化 & データは BigQuery → BigQuery ML ├─ 構造化 & コードレス & 中精度〜高精度 → AutoML Tables / Tabular Workflows ├─ 非構造化(画像/動画/テキスト)& コードレス → AutoML (Image/Video/Text) └─ 上記いずれも不適 → カスタム訓練(§3)

💾 BigQuery ML

BigQuery 内の SQL だけで ML モデルの作成・推論・評価を完結させる。

対応モデル種別

線形 / ロジ

linear_reg / logistic_reg。解釈性◎

Boosted Tree

XGBoost。テーブルデータで高精度

DNN

シンプルな多層

k-means

クラスタリング

ARIMA_PLUS

時系列予測(季節性・トレンド自動)

Matrix Factorization

推薦

AutoML Tables(埋め込み)

BQML から AutoML を呼ぶ

TensorFlow Import

外部 TF モデルをインポート

🆕 Remote Models

Gemini 等を BQ から呼ぶ

主要関数

-- 1. モデル作成
CREATE OR REPLACE MODEL `project.dataset.my_model`
OPTIONS (model_type='logistic_reg', input_label_cols=['target'])
AS SELECT * FROM `project.dataset.train_data`;

-- 2. 予測
SELECT * FROM ML.PREDICT(
  MODEL `project.dataset.my_model`,
  (SELECT * FROM `project.dataset.test_data`)
);

-- 3. Gemini 呼び出し(生成AI)
SELECT ml_generate_text_result FROM ML.GENERATE_TEXT(
  MODEL `project.dataset.gemini_remote_model`,
  (SELECT prompt FROM `project.dataset.prompts`),
  STRUCT(0.2 AS temperature, 256 AS max_output_tokens)
);

-- 4. 🆕 Gemini ファインチューニング(BigQuery 経由)
CREATE MODEL `project.dataset.tuned_gemini`
REMOTE WITH CONNECTION `project.us.vertex_conn`
OPTIONS (
  endpoint = 'gemini-2.0-flash-001',
  training_data = (SELECT prompt, expected_output FROM `project.dataset.train`),
  tuning_method = 'supervised_fine_tuning'
);
いつ BigQuery ML? データが BQ にある + SQL で書ける + データ移動コストを払いたくない → 第一候補。

🤖 Agent Platform AutoML / Tabular Workflows

AutoML

データさえあればモデル自動構築・チューニング・評価・デプロイ。Tables / Image / Edge / Text / Video に対応。

🆕 Tabular Workflows

E2E パイプライン化された AutoML 上位互換。前処理・特徴量化・モデル選定・チューニングを 個別にカスタマイズ可能

観点BigQuery MLAutoML TablesTabular WorkflowsCustom Training
インターフェースSQLUI / SDKPipelinePython
自動チューニング◎ (NAS含む)自分で実装
カスタマイズ××△ ステップ単位
第一候補データが BQコードレス + 中規模AutoML + 細制御フル制御

📡 業界別 API(プリビルト API)

Vision API

一般物体検出 / OCR / 顔・ランドマーク / 不適切コンテンツ

Document AI

請求書・領収書・身分証から 構造化抽出。Invoice / Receipt / W-2 / Custom Extractor

Translation API

100+ 言語、Advanced は Glossary 対応

Speech-to-Text

多言語音声認識

Text-to-Speech

多言語音声合成、複数の声質

Natural Language API

エンティティ抽出・感情分析・構文解析

ひっかけ "請求書 PDF から金額・品目を抽出" → Vision API OCR は不正解、Document AI Invoice Parser が正解。

🌟 基盤モデル & Model Garden

Google 製基盤モデル

Gemini Pro / Flash / Nano

マルチモーダル。Flash = 低レイテンシ低コスト、Nano = オンデバイス

Imagen

画像生成・編集(inpainting / outpainting / 超解像)

Veo

動画生成(短尺)

Chirp

多言語 ASR 基盤

Codey

コード生成(Gemini に統合中)

Embeddings

text-embedding-005 / multimodal-embedding。RAG に

Model Garden(カタログ)

Google 製 + OSS(Llama / Mistral / Stable Diffusion 等)を一元検索・1-click デプロイ。OSS モデルも マネージドエンドポイント として提供される MaaS あり。

⚡ Gemini ベースアプリの最適化(コスト / レイテンシ / 可用性)

戦略効果注意
モデルサイズ選定(Flash 優先)単価 1/10 前後単純タスクで Pro は過剰
プロンプトキャッシング(2048+ トークンのプレフィックス)キャッシュ部分 75% 割引TTL 5〜60 分
コンテキストキャッシング(明示)長文プロンプト再利用保管時間で課金
Batch API(非同期)約 50% 割引レイテンシ要件なしジョブ向け
ファインチューニングFlash + tuning で Pro 近い精度初期コストあり
構造化出力 / temperature 0余分な解説削減 + 再試行不要決定的タスク向け
  • Gemini Flash をデフォルト、必要時のみ Pro へ
  • 同一リージョン にエンドポイントとアプリ配置
  • ストリーミング応答stream_generate_content)でユーザー体感改善
  • プロンプトキャッシング で固定部分の処理スキップ
  • 最小プロンプト(不要な前置きを削る)
  • マルチリージョン展開(us-central1, asia-northeast1 等)+ ルーティング
  • モデルバージョン固定gemini-2.0-flash-001
  • 指数バックオフ + リトライ
  • フォールバックモデル(Pro が混雑なら Flash、または逆)

⚠️ 試験での頻出ひっかけ

問題文の示唆不正解になりがち正解の方向
"コードを書きたくない / ML 専門家がいない"Custom TrainingAutoML or BigQuery ML
"BigQuery に既存、SQL で処理中"Dataflow + Custom TrainingBigQuery ML
"請求書 PDF から品目・金額"Vision API OCRDocument AI Invoice Parser
"多言語 FAQ チャットボット"カスタム NLPGemini + RAG
"プロンプトで頭打ち、低レイテンシ要件"Gemini ProFlash + ファインチューニング
"夜間バッチで OK、コスト最優先"同期 APIBatch API + Flash
"PII を含むテキストを Gemini に"直接送信DLP + VPC SC + Model Armor
"OSS Llama 3 を使う最簡単な方法"自前 GKEModel Garden から 1-click

📝 セルフチェック(5 問)

Q1 サービス選定

BigQuery に既存の購買データから解約予測モデルを最速で構築したい(SQL 得意なチーム)。

正解: C。データが BQ にあり SQL で完結するのが最速・最安。
Q2

PDF 請求書 1 万通から品目・金額・日付を構造化抽出したい。

正解: C。Invoice Parser に事前学習済みプロセッサあり。
Q3 複数選択

Gemini アプリのコスト削減として効果的なもの 2 つ:

正解: A, B。D はレイテンシ改善で、コストは下がらない。
Q4

頻繁に更新される社内 FAQ のチャットボット。鮮度と精度の両立に最適:

正解: B。頻繁な更新には RAG(再チューニング不要)。
Q5 🆕 新ガイド

BigQuery から Gemini をファインチューニングする際の構文の概要:

正解: B。Vertex AI Connection 経由の REMOTE MODEL。
全 20 問の問題集へ →