Waymo Driver第6世代アーキテクチャの東京都心展開における技術詳細分析レポート
ITmediaオルタナティブブログ 経営者が読むNVIDIAのフィジカルAI / ADAS業界日報 by 今泉大輔 を運営している今泉大輔です。このサイト さっつーのAIエージェント ではリリースするレポートの監修を受け持っています。
こちらの産業調査レポートの姉妹記事に以下があります。Waymo x GO x 日本交通がハードルを潜り抜ける国交省・警察庁・警視庁による都内7区の許認可「特定自動運行」にフォーカスした記事です。

以下は日産が採用した自動運転技術「Wayve」に関するレポートです。日本には類似のレポートが存在しない際立った技術資料です。
こちらの【産業調査】レポートでは、Waymoの自動運転技術そのものを詳細に記述します。購入された方にはPDF版もご提供します。

こちらの【産業調査】レポートの技術的な粒度については、見本として以下のAmazonのレポートをご覧ください。また、自動運転カテゴリーのレポートも揃っています。
1. はじめに(米国商用システムの東京移植が持つ技術的文脈)
自動運転技術の開発および商用展開において世界を牽引してきたWaymoが、2027年を目途に東京都心部での自動運転モビリティサービスの商用展開を公表したことは、自動車産業の先行開発およびADAS/AD(先進運転支援システム/自動運転)開発部門にとって極めて重要な工学的マイルストーンを意味します1。Waymoはこれまで、米国フェニックス、サンフランシスコ、ロサンゼルス、オースティンなどの主要都市において、車内セーフティドライバーを配置しない完全無人(Rider-only)の商用自動運転フリートを大規模に展開してきました1。その走行規模は週当たり50万回以上の有料乗車サービス、公道における累計自律走行距離は3億キロメートル(約2億マイル)以上に達しており、人間のドライバーと比較して傷害を伴う人身事故の発生率を約90パーセント以上低減させているという強固な安全統計データを確立しています1。
しかしながら、碁盤目状の広幅員道路が主体であり、右側通行・右折優先規則に基づいて設計された北米の都市環境から、左側通行かつ道路空間の密度が極めて高い東京都心部(港区、渋谷区、新宿区、千代田区、中央区など)への自律走行スタックの移植は、単なるソフトウェアパラメータの再調整にとどまりません1。東京都心は、歩行者や自転車、特定小型原動機付自転車(電動キックボード)が車道と歩道の境界を縫うように移動し、路上荷捌き停車車両が走行車線を恒常的に狭小化させ、さらに首都高速道路の高架橋が頭上を覆うことでGNSS(全球測位衛星システム)電波が著しく遮蔽・減衰する過酷なマルチパス環境を形成しています1。加えて、歩車分離式信号や多段矢印信号といった日本独自の交通管制ロジックへの適応も不可欠です。
Waymoは、国内タクシー最大手である日本交通および配車プラットフォーム大手のGOとの戦略的アライアンスを締結し、東京都内7区において有人監視下での大規模な検証走行を推進してきました1。この取り組みは、米国で鍛え上げられた第6世代Waymo Driver(Gen 6)のハードウェアプラットフォームと、深層学習基底モデルであるWaymo Foundation Model(WFM)を、世界屈指の複雑性を有する過密都市環境へドメイン適応させる実証プロセスです1。本レポートは、車載アーキテクチャ、センサーフュージョン、AI推論、冗長設計、法制度対応の各観点から、その技術的構造と工学的課題を網羅的に分析し、次世代ADシステム開発に向けた技術的示唆を提示することを目的としています。
2. Waymo自律走行スタックのコア技術概要
第6世代Waymo Driverのハードウェアおよびセンシング構成
第6世代(Gen 6)Waymo Driverは、商用ロボタクシーの抜本的なコスト低減と、降雪や降雨を含む全天候・全環境への対応能力拡大を両立させるために、ハードウェアとソフトウェアが垂直統合で再設計されたプラットフォームです4。第5世代システム(Jaguar I-PACEベース)と比較して、センサー総数を約42パーセント削減しながらも、知覚性能のダイナミックレンジと安全冗長性を高い次元で維持・強化しています9。Gen 6のセンサースイートは、自社開発のLiDAR 4基、高分解能イメージングミリ波レーダー 6基、高解像度車載カメラ 13台、およびルーフ上に統合された外部音響認識センサー(EARs: External Audio Receivers)によって構成されています8。
ビジョンシステムの中核には、車載用途に特化して自社設計された次世代17メガピクセル(17MP)CMOSイメージセンサが採用されています4。従来の車載ADASで多用される5メガピクセルや8メガピクセルのセンサーと比較して極めて高精細な画素密度を誇り、広角レンズと組み合わせることで視野角を維持したまま、数百メートル先の微小な物体や標識の文字・記号を鮮明に解像します4。これにより、全周360度を重複監視するために必要なカメラ台数を劇的に削減することに成功しています4。また、過酷な温度変化に耐える熱安定性と広範なダイナミックレンジを備え、直射日光によるハレーションや夜間対向車のハイビーム下でも白飛びや黒潰れを抑制します4。
LiDARサブシステムにおいては、ルーフ中央のセンシングポッドに配置された長距離360度LiDARと、車両周辺に配置された短距離高解像度LiDARが緊密に連携します4。長距離LiDARは自社設計の光集積回路(PIC)とカスタムシリコンを搭載し、最大500メートル先の物体反射光を微弱な光子レベルで捉え、高密度な三次元点群(Point Cloud)を生成します4。一方、短距離LiDARは車両の直前・直後・側方の死角を完全にカバーし、歩行者の足元や開いたドア、縁石の微小な段差をミリメートル単位の精度で描出します4。
ミリ波レーダーは、従来の単純なドップラー速度計測にとどまらず、電波の反射強度、仰角、方位角を高密度に推定するイメージングレーダーへと進化しています4。大雨や濃霧によって光パルスが減衰・散乱する気象条件下でも、ミリ波は遮蔽物を透過して先行車や障害物までの絶対距離と相対速度を確実に捕捉します4。
外部音響認識センサー(EARs)は、ルーフの知覚ドーム周辺に空力音響シミュレーションに基づいて配置されたマイクロフォンアレイです11。ビームフォーミング技術と周波数解析アルゴリズムを組み合わせることで、車速増加に伴う風切り音ノイズをリアルタイムに相殺しながら、数百メートル先から接近する緊急車両(パトカー、救急車、消防車)のサイレン周波数や踏切警報音を検出し、その音源到来方向を正確に定位します11。これにより、センサーの幾何学的死角から急行する緊急車両に対しても、視覚的に捕捉される数秒前の段階から進路譲渡マニューバの準備を開始することが可能となっています11。
過酷な環境下での連続稼働を保証するため、すべての外部センサーの受光窓には、自動噴射洗浄液、エアブロー、電熱ヒーターからなる統合型クリーニング機構が組み込まれており、雨滴、泥はね、降雪、氷結による知覚機能低下を能動的に防護します4。
これらのセンサー群から出力される膨大な生データ(Raw Data Stream)を処理するため、WaymoはTSMCの5nmプロセスを採用した車載専用カスタムASICを導入しています10。このチップは1,000 TOPS以上の機械学習演算性能を備え、フロントエンドにおける低遅延なセンサーフュージョン前処理を一括してハードウェア処理します10。カメラ画像のMIPIインジェストからLiDAR点群の空間整合、レーダー信号の時間同期に至るパイプラインを並列実行することで、センサーが物理信号を受信してから車両の運動制御指令を生成するまでの遅延(First pixel to action)を極小化しています10。
Waymo Foundation Model(WFM)とハイブリッドAIアーキテクチャ
Waymoの自律走行ソフトウェアスタックは、独立したモジュール(認識、追跡、予測、計画)を直列に繋ぎ合わせる従来のパイプライン構造から、大規模マルチモーダル深層学習モデルを中心とする「Waymo Foundation Model(WFM)」を中核としたアーキテクチャへと進化を遂げています5。ただし、一部の先進運転支援システムが標榜する完全な単一ニューラルネットワークによるブラックボックス型エンドツーエンド(E2E)モデルとは異なり、Waymoは安全性の数学的証明可能性を最優先したハイブリッド構造を堅持しています5。
WFMの基本構造は、人間の認知科学における二重過程理論を応用した「Think Fast, Think Slow(System 1 / System 2)」アーキテクチャに基づいています5。
System 1(Sensor Fusion Encoder / 高速反射層)は、カメラ、LiDAR、レーダーの時系列生データを統合し、高次元の潜在空間表現および明示的な三次元バウンディングボックス、セマンティック占有グリッドを低遅延(数十ミリ秒単位)で連続的に生成します5。これにより、他車両の急な割り込みや歩行者の急な飛び出しに対し、反射的な運動学的応答(緊急ブレーキや操舵回避)を遅滞なく出力します5。
System 2(Driving VLM / 低速推論層)は、Googleの大規模マルチモーダル基底モデル「Gemini」の技術資産を継承し、自動運転の運転タスクにファインチューニングされた視覚言語モデル(VLM)です5。System 2は高解像度カメラの広範なコンテキスト情報を参照し、稀少かつ解釈が困難なエッジケースのセマンティック推論を担当します5。例えば、道路工事現場で複雑なジェスチャーを行う誘導員の手信号、特殊な荷物を積載して異様な外観を呈するトラック、あるいは車道脇で故障して停車している車両のドライバーの振る舞いなど、従来の認識アルゴリズムでは分類が難しいシナリオの意図を正確に解釈します5。
System 1とSystem 2の出力は、統合的な「World Decoder」へと入力されます5。World Decoderは周囲の全交通参加者の将来行動軌道を確率的に予測し、高精度地図(HDマップ)のトポロジー情報と照合した上で、自車の走行軌道候補(Candidate Trajectories)を生成します5。
このアーキテクチャにおける決定的な安全上の防壁が、WFMの後段に物理的・論理的に独立して配置された「決定論的安全検証層(Onboard Deterministic Safety Validation Layer)」です5。この安全層は機械学習モデルではなく、形式手法や運動力学に基づく決定論的なルールベースのアルゴリズムで構成されています5。車両の動的限界(最大加加速度・横加速度)、衝突余裕時間(TTC: Time-to-Collision)、障害物との最小離隔距離マージン、および一方通行や法定速度といった道路交通法規制の遵守を厳密に計算します5。WFMが生成した走行軌道候補がこれらの安全エンベロープをわずかでも逸脱した場合、検証層はその軌道を即座にリジェクトし、決定論的に安全が保証されたフォールバック軌道へと上書きします5。この多層防衛アプローチにより、大規模深層学習モデルが本質的に抱えるハルシネーション(幻覚)や未知データに対する予測不能な出力リスクを物理的に遮断しています5。
SimulationCityと公道走行実績データによる学習フライホイール
車載ECUに搭載可能な推論モデルのパラメータサイズには、消費電力と排熱の観点から厳格な制約が存在します5。この課題を解決するため、Waymoは「Teacher-Student」知識蒸留フレームワークを運用しています5。
クラウド環境では、数十億から数百億パラメータ規模の超巨大なTeacherモデルが構築されます5。Teacherモデルは、過去から未来に至る全センサーフレーム、高精度のオフライントラッキングデータ、および完全なHDマップ情報を無制限の計算資源を用いて参照し、理想的な状況理解と走行計画を学習します5。車載向けStudentモデルは、このTeacherモデルの潜在表現と行動予測分布を模倣するように知識蒸留され、コンパクトなネットワーク規模でありながらTeacherモデルと同等の高精度な推論能力を維持したまま、車載ASIC上でリアルタイムに実行されます5。
この学習サイクルを加速させているのが、独自の仮想シミュレーション環境「SimulationCity」と、フリートが記録した3億キロメートル以上の実走行データです1。Waymoスタックには、運行中の全車両から運転の乱れや急減速、人間の介入事案などのインシデントログを自動抽出する「Critic」モデルが常時稼働しています5。抽出されたエッジケースシナリオは直ちにSimulationCityへ投入されます5。
SimulationCityは、Neural Radiance Fields(NeRF)や3D Gaussian Splattingなどの最新幾何再構成技術を活用し、実走行ログからカメラ画像およびLiDAR点群をフォトリアルかつ物理的に整合した形で再構築します5。さらに、「自車が異なる進路を取っていた場合」や「対向車が予期せぬタイミングで飛び出してきた場合」といった無数の反事実的(Counterfactual)シナリオを自動合成し、閉ループ強化学習を通じてAIモデルの弱点を徹底的に補強します5。実公道で遭遇した1回の稀少事象から数万通りの過酷なストレステストを仮想空間上に展開することで、実車の安全性とロバスト性を指数関数的に高める好循環(Virtuous Flywheel)が成立しています5。
5000円以上のレポートは、当サイトが発行する請求書/インボイスによる銀行振込のお支払いに対応します。お問合せはinfo@sattu-ai-agent.com まで。
決済ツール Codoc による料金お支払いは、初回に Codoc への会員登録(IDとパスワード)が必要になります。インボイス対応の領収書が出ます。お問合せは info@sattu-ai-agent.com まで。




