2026年8月25日

AIは「画面の中」から現実世界へ──Mawari CEO対談から読み解く、Physical AI・DePIN・3Dインターネットの未来

目次

AIは「画面の中」から現実世界へ──Mawari CEO対談から読み解く、Physical AI・DePIN・3Dインターネットの未来

ChatGPTをはじめとする生成AIが急速に広がり、「AIを使うこと」は特別なことではなくなってきました。

文章を書く。画像を作る。情報を検索する。資料をまとめる。今のAIは、主にパソコンやスマートフォンの“画面の中”で私たちを助けています。

でも、次に起きようとしている変化は、もう少し大きいものです。

AIが、現実世界に出てくる。

スマートグラスを通して目の前の空間を理解したり、ロボットが店舗や工場の中を移動したり、ドローンが自律的に荷物を運んだり。AIアバターが私たちと同じ空間に存在し、会話し、仕事を手伝う世界も研究・開発されています。

この流れは「Physical AI(フィジカルAI)」や「Embodied AI」と呼ばれることがあります。

ただし、AIの頭脳が賢くなるだけでは、この未来は実現できません。

AIが現実世界で動くためには、位置を知ること、空間を理解すること、周囲をセンシングすること、大量の計算を瞬時に処理すること、通信すること、異なる会社の機械同士を連携させることなど、膨大な“社会インフラ”が必要になります。

今回紹介するMawariは、まさにその「AIが現実世界へ出てくる時代のインフラ」をつくろうとしている企業の一つです。

2026年、Intercognitive Foundationの創設チェアマンRich Robinson氏と、Mawari共同創業者兼CEOのLuis Oscar Ramirez氏による対談が公開されました。

Mawariがなぜ生まれ、なぜ3Dストリーミングを開発し、なぜ最終的にDePINという分散型インフラへ進んだのか。そして、その先にどんな世界を見ているのか。

単なる企業紹介というより、**「AI時代の次のインターネットは何を必要としているのか」**を考える材料になる対談です。

▶ 対談動画
https://www.youtube.com/watch?v=JFK_VGcN6yk

生成AIの次に来るもの──AIが「現実世界」を理解する時代

現在、多くの人が触れている生成AIは、文章・画像・音声など、主にデジタル情報を扱っています。

一方、ロボットやスマートグラス、自動運転、ドローンなどにAIが搭載されると、求められる能力が一気に増えます。

たとえば、人間なら当たり前にできることでも、機械には仕組みが必要です。

「自分は今どこにいるのか」

「目の前にあるものは何か」

「この部屋の構造はどうなっているのか」

「人や障害物はどちらに動いているのか」

「大量のデータをどこで計算するのか」

「別の会社が作ったロボットやサービスと、どうやって情報交換するのか」

「サービスを利用した機械が、別の機械へ自動で対価を支払うにはどうするのか」

AIモデルそのものだけを高度化しても、これらは解決しません。

たとえるなら、どれだけ高性能な車を作っても、道路も地図も信号も給油・充電設備も交通ルールもなければ、社会全体を走ることはできないのと同じです。

AIについても今、「頭脳をつくる競争」から、その頭脳が現実世界で活動するための基盤をつくる競争へ、領域が広がっています。

Intercognitive Foundationとは?

この課題に対して、オープンな共通基盤や相互運用のルールをつくろうとしているのが、Intercognitive Foundation(インターコグニティブ・ファウンデーション)です。

Foundationは、物理世界をAIがアクセス可能にするためのインフラやプロトコルの開発・普及を掲げています。

重要なのは、特定の1社ですべてを囲い込むのではなく、異なる企業・ロボット・AI・ネットワークが相互に連携できる世界を目指していることです。

その考え方は「AI Accessibilityの9つの柱」として整理されています。

Identity:機械のID・身分証明

Fees:機械同士の取引・決済

Maps:現実世界の地図・空間情報

Sensors:周囲を認識するためのセンサーデータ

Positioning:高精度な位置情報

Compute:AIや3D処理に必要な計算資源

Connectivity:通信・ネットワーク接続

Orchestration:複数の機械・AI・システムの協調

Standards:異なるシステムをつなぐ共通規格

Auki Labs、peaq、GEODNET、Mawariは、Intercognitive Foundationを立ち上げた創設メンバーとして公表されています。

それぞれが同じ技術を開発しているわけではありません。

Aukiは空間認識や共有空間情報、GEODNETは高精度測位、peaqはMachine Economyを支えるブロックチェーン基盤など、それぞれ異なる領域を担っています。

ここで大事なのは、「どの企業が一番すごいか」という比較ではありません。

AIやロボットが現実世界で活動するには、一つの技術だけでは完成しない。

位置、地図、センシング、通信、計算、ID、決済、共通規格。それぞれがつながって、はじめてPhysical AIの社会基盤になります。

Intercognitive Foundation公式サイト
https://www.intercognitive.com/

では、Mawariは何をしている会社なのか?

Mawariを一言で説明するなら、リアルタイム3D・XR・AI体験を世界規模で届けるための「空間コンピューティング向けインフラ」を開発している企業です。

Mawariは、AIモデルそのものを開発する企業というより、AIや3Dコンテンツが私たちの現実空間に出てくるとき、その重い計算処理と配信を支える側に位置しています。

これを理解するには、今回のLuis氏の対談に出てくる「Mawariが生まれた理由」をたどるのが一番わかりやすいと思います。

Mawariの原点は、暗号資産でもDePINでもなかった

Luis Ramirez氏はメキシコ出身で、理論数学を学び、ドイツ、カナダ、アメリカ、韓国などを経て、日本に16年以上暮らしています。

興味深いのは、Mawariの出発点がブロックチェーンでも暗号資産でもなかったことです。

Luis氏は音楽やクリエイティブテクノロジーの世界にも関わり、日本ではデジタルアートフェスティバル「MUTEK.JP」を共同設立しました。

2014〜2015年ごろ、Meta(当時Facebook)によるOculus買収などをきっかけにVR・ARへの注目が高まります。しかし、実際にクリエイターがVRやAR作品を作ろうとすると、技術的なハードルが非常に高かった。

「表現したい人がいるのに、技術やインフラが壁になっている」

この問題意識がMawariの原点になったとLuis氏は語っています。

そしてもう一つ、共同創業者たちは早い段階から、未来のメディアは2Dの画面だけではなく、AIと3D・XRが融合していくと考えていました。

根底にあったのは、「新しいデバイスを売りたい」という話だけではありません。

亡くなった家族に、次の世代がまるでそこにいるかのように出会える。遠く離れた人とも、より存在感を持ってつながれる。クリエイターが現実空間にデジタル表現を持ち込める。

技術を使って、人と人のつながりをどう拡張するか。

Mawariの話を理解するとき、この原点は意外と重要です。

2018年、KDDIとの仕事で見えた「3D配信」の難しさ

大きな転機の一つが、2017〜2018年ごろのKDDIとの取り組みです。

対談によると、KDDIは当時すでに、Unreal Engine 4とWatsonを利用したAIデジタルヒューマンを、スマートフォンやスマートグラスへ配信する構想を持っていました。

ところが、ここで問題が起きます。

デジタルヒューマンを動かす処理は重く、スマートフォンやスマートグラス単体では十分に処理できない。

では、クラウドで処理して映像を送ればいいのでは?と思うかもしれません。

でも、3DはYouTubeやNetflixの動画とは根本的に違います。

2D動画は「同じ映像」を送れる。3Dは一人ひとり違う

通常の動画配信では、基本的に同じ映像データを多くの人へ届けられます。

しかし3D空間では、ユーザーが右を向けば右側が見え、近づけば物体が大きくなり、しゃがめば見える景色も変わります。

つまり、ユーザー一人ひとりの位置や視点に応じて、その瞬間の映像をリアルタイムに計算しなければならない。

AIアバターと会話するなら、さらに状況は複雑です。

相手の言葉を理解し、返答を作り、表情や口の動きを生成し、3Dとして描画し、それを違和感なく目の前に表示する必要があります。

テキストAIなら数秒待つことができても、目の前の人やロボットが数秒止まれば「会話」には感じられません。

Mawariの公式ドキュメントでも、AI・XR・リアルタイム3Dが融合すると、従来のAI推論とは桁の違う計算と、ユーザーの近くに置かれたエッジ処理が必要になると説明しています。

そこで生まれた「Split Compute」

Mawariがたどり着いた考え方が、Split Compute(スプリット・コンピュート)です。

すべてを端末で処理するのでもなく、すべてを遠くのクラウドに投げるのでもない。

重い3Dレンダリングなどはエッジやクラウド側へ任せ、一方で、頭の動きや現実空間への位置合わせなど、遅れが許されない処理は端末側で行います。

対談では、3Dストリーミング全体では往復30ミリ秒未満、空間アンカリングのような処理は端末側で10ミリ秒未満が重要だと説明されています。

理由は、人間の脳です。

頭を動かしたのに仮想空間が少し遅れて動くと、視覚と身体感覚にずれが生まれます。その違和感がVR酔いや吐き気につながります。

つまりMawariが解こうとしている問題は、単純に「映像を速く送る」というものではありません。

人間の感覚が“現実”として受け入れられる速度で、3DとAIを処理すること。

ここに、空間コンピューティング特有の難しさがあります。

なぜMawariはDePINを選んだのか?

技術的にSplit Computeができても、もう一つ大きな問題が残ります。

それは、「世界中のユーザーの近くに、どうやって十分なGPUと計算資源を置くのか」です。

低遅延にするためには、ユーザーから遠く離れた巨大データセンターだけでは不十分です。できるだけ近い場所に計算資源が必要になります。

しかし、自社で世界中にGPUデータセンターを建てるには莫大な先行投資が必要です。しかもGPUは数年で性能競争が進み、設備が陳腐化するリスクもあります。

Luis氏は対談の中で、従来型の大規模設備投資モデルではなく、2021年ごろにHeliumやRender Networkのような分散型ネットワークに注目した経緯を語っています。

世界中に存在する計算資源をネットワーク化し、参加者の協力によってインフラを拡張していく。

そこでDePIN(Decentralized Physical Infrastructure Network)という考え方につながりました。

ここは、Mawariを見るうえで非常に重要です。

「トークンを使いたいからDePINを始めた」のではなく、リアルタイム3Dを世界規模に広げるというインフラ課題を追いかけた結果、分散型という方法に行き着いた。

少なくとも今回の対談からは、その順序がはっきり見えてきます。

DePINは「ノード報酬」だけではない

DePINという言葉を、暗号資産やノード運用から知った人も多いと思います。

そのため、「機械を置くと報酬がもらえるもの」と理解されがちです。

もちろん、ネットワークへの参加を促すインセンティブはDePINの重要な設計要素です。

ただ、本質的にはその先があります。

GPU、通信設備、センサー、位置情報、ストレージなど、世界中に分散して存在する物理的・計算的な資源をネットワーク化し、特定の事業者だけがすべてを所有しなくてもインフラを拡張できる仕組みです。

この視点で見ると、

AI × DePIN × ロボット × XR × 空間コンピューティング

は、別々のブームではありません。

AIが現実世界へ出てくるほど、現実世界側の計算・通信・位置・空間データが必要になり、そのインフラをどう構築するのかという問題が大きくなります。

そこで、複数の技術領域が一つにつながり始めています。

Mawariの立ち位置を「技術スタック」で見る

Mawariを理解するとき、「AI企業か、XR企業か、DePIN企業か」と一つのカテゴリーに入れようとすると分かりにくくなります。

むしろ、未来のサービスが成立するための層として見ると整理しやすくなります。

AI・Physical AIの世界を支えるイメージ

AIモデル・World Models

AIが考える・予測する

空間認識・位置情報・センシング

AIが「今どこにいて、何が周りにあるか」を理解する

Mawariのようなリアルタイム計算・3D配信インフラ

重い3DやAI処理を、低遅延でユーザーの近くへ届ける

スマートグラス・ロボット・ドローン・自動車などのデバイス

現実世界で人間と接する

人間の体験・仕事・生活

この中でMawariが狙っているのは、AIモデルそのものというより、デジタルの知能や3Dコンテンツを、現実世界の体験として成立させるための配信・計算インフラの部分です。

インターネットで言えば、動画サービスそのものではなく、動画やコンテンツが世界中へ届くためのCDNやネットワーク基盤に近い「つるはしとシャベル」の立ち位置とも言えます。

ただし、3Dでは従来のCDNのように完成した同じファイルを配るだけでは足りない。そのため、Mawariは3Dに特化した新しい配信インフラを作ろうとしているわけです。

「不気味の谷」から見える、技術だけでは解けない問題

対談の後半では、少し違う角度の話も出てきます。

人間そっくりのデジタルヒューマンを作れば、ユーザーはより親しみを感じるのか。

Luis氏の答えは、今のところ必ずしもそうではない、というものです。

人間にかなり近いのに、表情や動きがほんの少し不自然だと、逆に強い違和感を覚える「不気味の谷」があります。

そのためMawariは、現段階では完全なフォトリアル人間だけを目指すのではなく、スタイライズされたアバターにも注目しています。

Mawariが開発するクリエイタープラットフォーム「ARAWA」では、VTuberのように人間がアバターを操作して活動できる構想が紹介されています。

興味深いのは、完全自律型のAIデジタルヒューマンと、人間が操作するアバターを比較した際、対談では後者の方がユーザーのエンゲージメントが大きかったと語られている点です。

技術が高度になれば、人間が不要になる。

そんな単純な未来ではないのかもしれません。

むしろ、AIやアバターという新しい身体を通して、人間の存在感、個性、創造性をどう届けるかという方向もあります。

Mawariの出発点が「クリエイターが技術に邪魔されず表現できるようにしたい」だったことを考えると、このARAWAの構想は創業時の思想にもつながっています。

対談時点では、ARAWAはアルファ版で、翌年の正式ローンチを目指す計画が語られています。

そして次のテーマは「World Models」とPhysical AI

対談の最後で、Luis氏は今後について非常に重要な話をしています。

Mawariは、World Modelsと、AIが物理世界を理解することの間にあるギャップを橋渡しすることにも注力している、と語りました。

World Modelとは、AIが単に言葉の続きを予測するだけではなく、「世界がどのように動くのか」を内部的にモデル化し、次に何が起こるかを予測したり、行動を計画したりするための考え方です。

ただし、どれだけ優れたWorld Modelがあっても、現実の位置情報も、空間情報も、センサーデータも、リアルタイムの計算基盤もなければ、現実世界では十分に動けません。

ここで、Intercognitive Foundationの存在がつながります。

AIの知能をつくる研究。

現実世界を機械が理解するための地図・位置・センサー。

その知能や3Dを瞬時に処理する分散コンピュート。

異なる機械同士が連携するためのID・通信・共通規格。

これらを別々の産業として見るのではなく、一つの「Physical AIの社会基盤」としてつなごうとしている。

今回の対談が面白いのは、Mawariという一企業の話を通して、この大きな変化が見えてくるところだと思います。

未来予想Map──私たちの社会はどう変わっていくのか?

ここから先は、MawariやIntercognitive Foundationが描く方向性、現在のAI・ロボティクス・XRの進展を踏まえた「未来の見取り図」です。

未来を断定するものではありません。ただ、現在すでに開発されている技術を並べると、社会がどちらへ進もうとしているのかは少し見えやすくなります。

現在:AIは「画面の中のアシスタント」

今は、スマートフォンやPCを開いてAIに指示する形が中心です。

人間が情報を入力し、AIが文章・画像・分析結果を返す。

これはすでに大きな変化ですが、まだAIと現実世界の間には、人間という“通訳”がいます。

次:AIが「目・耳・位置」を持ち始める

スマートグラス、カメラ、センサー、空間地図などとAIが結びつくと、AIは私たちと同じ場所を見ながら支援できるようになります。

「この機械のどこを修理すればいい?」

「目の前の商品で、この人に合うものは?」

「この倉庫で次に運ぶべき荷物はどこ?」

画面に質問を入力するAIから、その場の状況を理解するAIへ変わっていきます。

その次:AIが「身体」を持つ

ロボット、ドローン、自動運転車、アバターなどを通じて、AIが実際に行動する場面が増えていきます。

工場や物流だけではなく、小売、医療・介護、観光、教育、接客、家庭など、現実空間で行われている仕事へ広がる可能性があります。

ここではAIモデルの性能だけでなく、安全性、位置情報、リアルタイム通信、低遅延処理、機械同士の連携が重要になります。

さらに:機械同士が協力し、サービスを交換する

ロボットが別のネットワークから地図データを取得する。

ドローンが高精度位置情報サービスを利用する。

AIエージェントが必要なGPU処理をネットワークへ依頼する。

その利用料を機械同士で自動精算する。

こうしたMachine Economyが実現すれば、人間が一つひとつ契約・操作しなくても、複数の機械やサービスが自律的に協調する世界が考えられます。

最終的に起こり得る変化:インターネットが「空間」になる

今のインターネットは、ページやアプリを開いてアクセスするものです。

しかし将来は、現実空間そのものにデジタル情報やAIが重なり、場所・物・人・機械がネットワークの一部になっていくかもしれません。

スマートグラスをかければ、街に情報が重なる。

AIアバターが同じ空間にいる。

ロボットと人間が同じ地図を共有する。

現実の店・学校・工場・病院が、デジタル世界とリアルタイムで接続される。

そうなれば、「オンライン」と「オフライン」という分け方自体が、今ほど明確ではなくなる可能性があります。

未来予想Map

生成AI
文章・画像・会話

AIエージェント
目的に沿って考え、複数の作業を実行

World Models / Spatial AI
空間や世界の動きを理解・予測

スマートグラス・アバター・ロボット・ドローン
AIが現実世界に身体・視点を持つ

Physical AI
現実世界で判断し、動き、協力する

Machine Economy
機械同士がサービス・データ・計算資源を交換

Physical × Digitalが融合した社会インフラ
「ネットを見る」から「ネットの中で生活する」へ

そして、その下では常に、

位置情報 / 空間地図 / センサー / GPU / エッジコンピュート / 通信 / ID / 決済 / 共通規格

といったインフラが動いている。

MawariやIntercognitive Foundationの活動は、この“表からは見えにくい基盤”をつくる側の動きとして見ることができます。

では、私たちは今、何を学べばいいのか?

こういう未来の話をすると、「どの銘柄を買えばいい?」「どの会社が勝つ?」という話にすぐ移りがちです。

でも、もっと先に身につけておきたいものがあります。

それは、未来を技術名ではなく、構造で見る力です。

1.生成AIの「その次」を知る

ChatGPTの使い方だけで終わらず、AIエージェント、World Models、Physical AI、ロボティクスなど、AIがどの方向へ広がっているのかを少しずつ知っておく。

専門家になる必要はありません。

「AIは文章を作るもの」から、「AIは現実世界を理解し、行動する方向へ進んでいる」と視野を広げるだけでも十分に違います。

2.クラウドの次に「エッジ」を知る

AIがリアルタイムで動くほど、すべてを遠くの巨大データセンターへ送る方法には限界が出ます。

Cloud、Edge Computing、GPU、ネットワーク、レイテンシー。

これらの言葉を完璧に説明できなくても、「なぜユーザーの近くに計算資源が必要なのか」を理解すると、今後のインフラ市場が見やすくなります。

3.XR・空間コンピューティングを体験する

AR、VR、スマートグラス、3Dアバターなどは、文章で読むより実際に触れた方が圧倒的に理解できます。

未来を予想するとき、ニュースだけを追うより、自分自身で新しいインターフェースに触れてみること。

「便利か」「違和感は何か」「何がまだ足りないか」を体感することが学びになります。

4.DePINを「投資商品」だけで見ない

DePINに触れるなら、報酬率だけではなく、

「何のインフラを作っているのか」

「誰がそのインフラを使うのか」

「なぜ分散型である必要があるのか」

「実際の需要と収益はどこから生まれるのか」

を見る癖をつけたいところです。

トークン価格は変動します。でも、ネットワークが解こうとしている問題や、社会に必要とされるインフラは、もっと長い時間軸で見るものです。

5.データ・ID・プライバシーを学ぶ

AIやロボットが現実世界を見るようになるほど、「誰が何を見ているのか」「空間データは誰のものか」「機械のIDを誰が管理するのか」という問題が重要になります。

便利だから使う、怖いから拒否する、の二択では足りません。

どんなデータを渡しているのか。誰が管理するのか。中央集権と分散型にはそれぞれどんな利点とリスクがあるのか。

利用者側にも判断する力が必要になります。

6.そして最後は「人間に残るもの」を考える

AIが高度になるほど、人間の価値がなくなるという話もあります。

一方、Mawariのアバター実験の話は、違う示唆を与えています。

完全自律AIより、人が動かすアバターの方に強い存在感を感じる人がいる。

つまり、効率化できることが増えるほど、信頼、共感、責任、文脈理解、創造性、関係性といった「誰がそこにいるのか」が逆に価値を持つ可能性があります。

AIを学ぶことと、人間らしい力を育てることは、反対ではありません。

むしろ両方が必要になるのだと思います。

未来を当てるより、「何が足りなくなるか」を見る

未来予測は、当てることが目的になると難しくなります。

どの会社が勝つのか。どのデバイスが普及するのか。どのトークンが残るのか。

これは誰にも断定できません。

でも、社会の方向が変わったとき、何が新しく必要になるのかを見ることはできます。

AIが文章から現実世界へ出るなら、位置情報が必要になる。

ロボットが増えるなら、共通の地図やIDが必要になる。

AIアバターがリアルタイムで動くなら、低遅延のGPUと通信が必要になる。

世界規模で計算資源が必要なら、その設備を誰が持ち、どう拡張するのかという問題が生まれる。

異なる会社の機械が一緒に働くなら、共通規格が必要になる。

未来を見るとき、サービスの表側だけではなく、その裏で必ず必要になるインフラを見る。

これは、インターネット、スマートフォン、クラウドの時代にも繰り返されてきたことです。

今回のLuis Ramirez氏の対談から見えてくるMawariも、その視点で見ると面白くなります。

Mawariが将来必ず成功する、と言いたいわけではありません。Intercognitive Foundationへの参加が、事業や投資成果を保証するものでもありません。

ただ、彼らが約9年かけて向き合ってきた「3Dをどうリアルタイムで届けるか」という課題が、今、AI、World Models、Physical AI、ロボットという大きな流れと重なり始めています。

だからこそ、Mawariそのものだけを見るのではなく、

なぜ今、この技術が必要になっているのか。

社会はどちらへ向かおうとしているのか。

そこから見ていくことが大切なのだと思います。

未来は、ある日突然やってくるものではありません。

今日の研究、実証実験、規格づくり、インフラ整備が少しずつ積み上がり、ある時「当たり前」になります。

だから今できることは、焦って何かに賭けることではなく、変化の背景を知ること。実際に触れてみること。そして、自分の仕事や生活にどう関係してくるのかを考えてみることです。

未来を予言できなくても、未来を読む力は育てられる。

今回の対談は、そのための一つの入り口になると思います。

▶ Intercognitive Foundation × Mawari CEO Luis Ramirez 対談
https://www.youtube.com/watch?v=JFK_VGcN6yk

▶ Intercognitive Foundation
https://www.intercognitive.com/

▶ Mawari Network
https://mawari.net/

▶ Mawari Network Docs
https://docs.mawari.net/

参考情報

Intercognitive Foundation公式サイト「The Pillars of AI Accessibility」
https://www.intercognitive.com/

Auki Labs「Auki Labs Joins Intercognitive Foundation as a Founding Member」
https://www.auki.com/community/news/auki-labs-joins-intercognitive-foundation-as-a-founding-member

Mawari「Mawari: The Who and the How」
https://www.blog.mawari.net/p/mawari-the-who-and-the-how

Mawari Network Docs「Mawari Network Architecture」
https://docs.mawari.net/infrastructure

Mawari日本語ブログ「なぜ大規模なリアルタイムXR体験はまだ実現していないのか?」
https://www.jp.mawari.net/p/real-time-3d-content-streaming

※本記事は、Intercognitive Foundationのポッドキャスト対談内容および各団体・企業の公開情報をもとに、一般向けに背景を補いながら整理したものです。将来予想を含む部分は確定した事実ではなく、現在の技術開発から考えられる方向性を示しています。また、特定の暗号資産・ノード・金融商品の購入や投資を推奨するものではありません。

カウンセリングでは変わらない・認知や思考のクセを修正し、繰り返す問題を断ち切る。

30分で根本問題を理解できる一生使えるスキルを身につけられます。

最新の記事もチェック

© 一般社団法人 FP看護師パートナー協会