FDE(Forward Deployed Engineer)を目指す人の多くは、まずRAGやエージェント構築といった「作る技術」を学ぼうとする。だが米国のAIエンジニア向けキャリア解説は、2026年に外せない技術領域として、作る力ではなく「動いているものが正しいかどうかを測る力」を名指しした。作れることは、もう前提でしかない。
何が起きているか
AIエンジニア向けキャリアメディアAIEngineerInsightsに、Lead AI EngineerのGurram Poorna Prudhvi氏が2026年7月29日、Forward-Deployed AI Engineerの役割と報酬・キャリアパスを整理した記事を寄稿した(Gurram Poorna Prudhvi「Forward-Deployed AI Engineer: Role, Pay, and Path (2026)」)。記事はFDEに必要な技術領域を7つ挙げているが、その中で唯一「2026年の非交渉事項(the 2026 non-negotiable)」という強い言葉を添えられているのが、評価工学(evaluation engineering)だ。「ハルシネーション・回帰・グラウンディングのための評価スイートを構築すること」(“Evaluation engineering — building eval suites for hallucinations, regressions, and grounding”)と定義されている。
残る6領域は、RAGパイプライン(チャンク分割・ベクトルDB・埋め込み・リランキング)、エージェント(複数ステップにまたがるツール利用の連鎖)、本番環境の可観測性(レイテンシ・トークン消費量・エラー率・ドリフトの監視)、セキュリティとコンプライアンス(オンプレミス・プライベートクラウド環境での実装)、プロンプト設計(システムプロンプト・構造化出力・ガードレール)、そして顧客とのコミュニケーションである。技術領域の大半が「作る」「動かす」に関わる一方、評価工学だけが「作ったものを疑う」ための技術として別枠で扱われている。
記事はキャリアパスも5段階で示す。①実際に本番稼働するシステムを一つ自分で作りきる、②評価工学を身につける、③オンプレミスやプライベートクラウドのような制約の多い環境でのデプロイ経験を積む、④顧客とのコミュニケーション力を磨く、⑤OpenAI・Anthropic・Google Cloud・Palantirなど実際に採用意欲の高い企業に的を絞って応募する、という順序だ。報酬データも企業別に示されており、Palantirの正式なFDSE職で総報酬$171K〜$295K(中央値約$211K)、OpenAIのFDEで基本給$160K〜$280K(大部分がエクイティ)、Google Cloudで基本給$127K〜$183K+エクイティ、Anthropicは中堅以上で「高い6桁」に達すると報告されている。
背景と構造
なぜ評価工学が「作る技術」の中でも別格の扱いを受けるのか。記事はFDEを「初日に顧客の課題を見つけた人間と、6ヶ月後の深夜3時にシステム障害に対応する人間が、同一人物である」(“the same engineer on day 1 and at 3am six months later”)役割だと定義している。この一文が意味するのは、FDEには作った後の結果まで背負う責任があるということだ。売り切って終わりのソフトウェアなら、動くものを作った時点で仕事は完了する。だがFDEが背負うのは、納品した後も本番環境で動き続けているかどうかという結果そのものである。
ここで問題になるのが、生成AIというソフトウェアの性質だ。従来型のソフトウェアは、一度テストに合格すればその後の挙動はほとんど変わらない。ところが生成AIは、同じ機能でも入力する言葉が変われば出力が変わりうる。「動いた」という一度きりの確認では、本番で起き続ける小さな崩れを検知できない。だからこそ、ハルシネーション(事実と異なる出力)や回帰(新しい変更が既存の挙動を壊すこと)を継続的に見つけ出す評価工学が、作る技術と同格ではなく「非交渉」の前提として扱われている。RAGやエージェントの実装技術は、道具さえ覚えれば一定水準まで誰でも届く。だが「自分が作ったものの欠陥を、自分で発見し続ける」仕組みを設計できるかどうかは、経験の差がそのまま出る領域だ。
日本でFDEを目指す読者にとっての意味
日本でFDEを目指す人にとって、これは学習の優先順位を考え直すきっかけになる。プロンプトの書き方やRAGの構築手順を学ぶ教材は増えているが、「自分が作ったAIが、本番でどこからおかしくなり始めるかを検出する」ための評価の組み方を体系的に学べる場は、まだ少ない。だからこそ、今そこに時間を割く価値がある。
現場に入って何十社ものAI実装に伴走してきた実感としても、経営者から強く求められるのは「動くものを作れるか」より「作ったものが期待どおり動き続けているか、後からどう確認できるか」の方だ。担当者が変わっても、問い合わせの言い回しが変わっても、AIの回答品質が落ちていないかを定点観測できる仕組みを一緒に用意できるかどうかで、現場からの信頼はまったく変わる。
以前の記事で、米国のFDEが使う道具立てはほぼ共通化されていて、差がつくのは「聞く力」だと書いた(FDEの道具立てはもう出来上がっている。差がつくのは『聞く力』だけだ)。今回の分析は、その「聞く力」に加えて「測る力」もまた、道具では埋まらない差になりつつあることを示している。
最初の一歩
今日からできることは、難しい理論を学ぶことではない。自分がこれまでに作った、あるいはこれから作るAIの出力を10件並べて、どれが「正しい」と言えるかを自分の言葉で基準化してみることだ。基準を1つ書き出せたら、それはもう評価工学の入り口に立っている。
自分がAI活用のどの段階にいるかを、1分で確かめたい方は無料のAI活用タイプ診断をどうぞ。
参考記事
- Gurram Poorna Prudhvi「Forward-Deployed AI Engineer: Role, Pay, and Path (2026)」(2026年7月29日公開、AIEngineerInsights) https://aiengineerinsights.com/blog/forward-deployed-ai-engineer/



