RORK LABEN
ENGINE — Rork MaxはClaude CodeとClaude Opus 4.6を基盤に、ネイティブSwiftアプリを直接生成しますCORE ML — Rork MaxからCore MLの端末内推論・HealthKit・HomeKit・NFC・App Clipsといった機能に手が届きますSEED — Rorkは2026年4月にLeft Lane Capital主導で$15Mのシードを調達し、Peak XVやa16z Speedrunが参加しましたM&A — Rorkはアプリビルダー Paperline を買収し、エンジニアリング人材の獲得を目的に買収を継続する方針ですMARKET — Gartnerは2026年末までに新規アプリの75%がローコードまたはノーコードで作られると予測していますGROWTH — ノーコードAI市場は2024年の$4.9Bから2029年に$24.8Bへ、年38.2%の成長が見込まれていますENGINE — Rork MaxはClaude CodeとClaude Opus 4.6を基盤に、ネイティブSwiftアプリを直接生成しますCORE ML — Rork MaxからCore MLの端末内推論・HealthKit・HomeKit・NFC・App Clipsといった機能に手が届きますSEED — Rorkは2026年4月にLeft Lane Capital主導で$15Mのシードを調達し、Peak XVやa16z Speedrunが参加しましたM&A — Rorkはアプリビルダー Paperline を買収し、エンジニアリング人材の獲得を目的に買収を継続する方針ですMARKET — Gartnerは2026年末までに新規アプリの75%がローコードまたはノーコードで作られると予測していますGROWTH — ノーコードAI市場は2024年の$4.9Bから2029年に$24.8Bへ、年38.2%の成長が見込まれています
記事一覧/AIモデル
AIモデル/2026-06-14上級

Rork Max の Swift アプリに Foundation Models の画像入力でオンデバイス・タグ付けを実装する

WWDC26 で Foundation Models のオンデバイスモデルに画像入力が加わりました。Rork Max が生成する Swift アプリに、画像のタグ付け・説明生成をクラウドに出さず実装する具体的な手順を、可用性ゲートとVision併用まで含めて解説します。

Rork Max219Foundation Models4画像入力オンデバイスAI12SwiftUI62

プレミアム記事

写真を1枚渡して「これは何の写真か」「どんなタグを付けるべきか」を返す機能を作るとき、これまでは画像を外部のマルチモーダルAPIに送るのが当たり前でした。私が個人開発で運用している壁紙アプリでも、新しく追加した画像にカテゴリやキーワードを自動で付けたい場面が何度もあり、そのたびに「ユーザーの端末にある画像を、わざわざ自社サーバーやクラウドLLMに送ってよいのか」という線引きに悩んできました。

WWDC26 で、その前提が変わりました。iOS 27 のオンデバイス Foundation Models が画像を読めるようになり、プロンプトに画像を添えて「この写真について答えて」と聞けるようになったのです。Apple は新しい専用パイプラインではなく「既存のプロンプトビルダーの自然な拡張」だと説明しています。つまり iOS 26 で覚えた LanguageModelSession@Generable の作法はそのまま使えて、プロンプトに画像が1枚増えるだけです。

ここからは、Rork Max が生成する Swift アプリを土台に、画像のタグ付け・説明生成をオンデバイスで完結させる実装を、可用性チェックと Vision 併用まで含めて組み立てます。Rork Max は React Native ではなくネイティブ Swift を生成する製品なので、Foundation Models のような Apple ネイティブのフレームワークと素直に噛み合うのが利点です。

なぜ「画像をクラウドに出さない」が効くのか

画像理解をクラウドLLMに任せると、3つのコストが同時に乗ります。1つ目は金銭的なコスト(1画像あたりの推論料金)、2つ目はレイテンシ(往復のネットワーク待ち)、3つ目はプライバシー上の説明責任です。とくに壁紙やヘルスケアのように「端末内の個人的な画像」を扱うアプリでは、3つ目が最も重くのしかかります。

Foundation Models のオンデバイスモデルは、これらをまとめて軽くします。推論は端末内で完結するため、初回ダウンロードが一定規模未満の個人開発アプリにとっては実質的に追加費用ゼロで画像理解を載せられます。ネットワーク往復が消えるのでオフラインでも動き、画像が端末の外に出ないので説明も簡潔になります。

ただし万能ではありません。オンデバイスモデルのコンテキストは4K、Private Cloud Compute(PCC)のサーバーモデルは32Kで、画像はそのトークン予算を消費します。Apple 自身が「大きな画像ほど多くのトークンを消費し、レイテンシも増える」と明言しています。設計の出発点は「まずオンデバイスで測り、足りないときだけサーバーへ逃がす」です。

全体像 — タグ付け機能の3層構造

実装は次の3層で考えると整理できます。

  1. 可用性ゲート: そのデバイスで Apple Intelligence(=オンデバイスモデル)が使えるかを確認し、使えない端末では機能自体を隠すかフォールバックする。
  2. 構造化されたタグ生成: 画像をプロンプトに添え、@Generable で「タグ配列・カテゴリ・1行説明」という決まった形のデータを受け取る。
  3. Vision 併用と段階的エスカレーション: 高速・定型の処理は Vision に任せ、言語的な説明はオンデバイス Foundation Models、長文や複数画像のバッチだけ PCC に逃がす。

順に作っていきます。

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
画像のタグ付けや説明文生成に外部APIを使っていた人が、Rork Max のSwiftアプリ内でオンデバイス完結の実装に切り替えられる
@Generable による構造化出力・Vision併用・可用性ゲートまで、コピーして動かせる Swift コードを手に入れられる
オンデバイス4Kとクラウド32Kのトークン予算を踏まえ、月のAPI費用をかけずに画像理解機能を本番投入できる
Stripe による安全な決済 · いつでもキャンセル可能

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Rork Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • コピー&ペーストで使える実装コード付き
  • 毎日新しい上級ガイドを追加
  • ¥580/月 または ¥1,480 の永久アクセス
メンバーシップを見る →

関連記事

AI モデル2026-06-24
Foundation Models の Guided Generation で、オンデバイスAIの出力を型で受け取る
オンデバイスのFoundation Modelsで、AIの返答を自由文ではなく型付きの構造体として受け取る方法を、Guided GenerationとTool Callingの実装コードとともに整理します。
AI モデル2026-07-01
Rork Max のネイティブ Swift で SpeechAnalyzer を使い、長尺の音声を端末内で文字起こしする
SFSpeechRecognizer では詰まっていた長尺・オフラインの文字起こしを、iOS 26 の SpeechAnalyzer と SpeechTranscriber で作り直す実装メモです。モデル資産のダウンロード、AsyncStream での音声供給、確定前と確定後の結果の扱い分け、Rork Max のネイティブ生成と Expo からの橋渡しの境界設計まで、実際にハマった点を添えてまとめます。
AI モデル2026-06-30
Rork のハイブリッドAIが知らぬ間にクラウドへ偏って課金が膨らんでいたとき — 経路選択を計測して切り分ける運用メモ
オンデバイス・エッジ・クラウドを振り分けるAIルーターは、判断ログが無いと静かにクラウドへ偏り、トラフィックが横ばいでも課金だけが伸びます。経路選択を計測して原因を切り分けた運用メモです。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます
もっと見る →