RORK LABEN
PLAY — Google Play の target API level 36 要件が昨日8月31日に発効しました。今日以降、新規アプリと既存アプリの更新は Android 16 対応が必須ですVISIBILITY — API 35 のままのアプリは掲載こそ続きますが、新しい Android 版のユーザーには表示されなくなります。エラーが出ないまま新規インストールだけが減る点に注意が要りますEXTENSION — 間に合わなかった場合は、Play Console から2026年11月1日までの延長申請が出せます。恒久対応の計画とセットで進めるのが実務的ですAPPLE — Apple 側は9月9日にイベント、iOS 27 の正式リリースは9月14日と報じられています。生成したアプリの iOS 27 実機確認はリリース週の前に済ませておきたいところですEXPO — Expo が expo-paste-input を公開しました(8月28日)。React Native の TextInput に画像・GIF・ステッカーの貼り付けを追加するネイティブモジュールですEAS — EAS Observe が8月20日に GA になりました。クラッシュや性能の観測を、ビルドや配信と同じ EAS 上で持てるようになっていますPLAY — Google Play の target API level 36 要件が昨日8月31日に発効しました。今日以降、新規アプリと既存アプリの更新は Android 16 対応が必須ですVISIBILITY — API 35 のままのアプリは掲載こそ続きますが、新しい Android 版のユーザーには表示されなくなります。エラーが出ないまま新規インストールだけが減る点に注意が要りますEXTENSION — 間に合わなかった場合は、Play Console から2026年11月1日までの延長申請が出せます。恒久対応の計画とセットで進めるのが実務的ですAPPLE — Apple 側は9月9日にイベント、iOS 27 の正式リリースは9月14日と報じられています。生成したアプリの iOS 27 実機確認はリリース週の前に済ませておきたいところですEXPO — Expo が expo-paste-input を公開しました(8月28日)。React Native の TextInput に画像・GIF・ステッカーの貼り付けを追加するネイティブモジュールですEAS — EAS Observe が8月20日に GA になりました。クラッシュや性能の観測を、ビルドや配信と同じ EAS 上で持てるようになっています
記事一覧/AIモデル
AIモデル/2026-04-23上級

Rork + Langfuse で本番 AI アプリのトレース・コスト・品質を計測する運用ガイド

Rorkで作ったAIアプリを本番運用するときに必要になるトレース・コスト計測・品質評価をLangfuseで構築する手順です。最小トレースのセットアップからモデル別コスト集計、Evalsパイプライン、アプリ側からのフィードバック送信、落とし穴まで扱います。

Rork548LangfuseAI ObservabilityLLM コストEvals本番運用10

プレミアム記事

Rork で AI を使ったアプリを作るところまでは、今はそれほど難しくありません。難しいのはリリースした翌週、サーバーログを眺めながら「先月の OpenAI の請求がなぜこんなに膨らんだのか」「どの会話でユーザーが離脱したのか」をひとりで追いかけはじめたときです。

私自身、Rork でリリースした AI チャット系アプリを1ヶ月運用してみて、最初に学んだのは「AI アプリは出してからが本番」でした。推論コストは予測を裏切る形で膨らみ、ユーザーからの「返答がおかしかった」という報告は、どのリクエストのことを指しているのか再現もできありません。ログの grep では間に合わず、可視化ツールが必要だとはっきり感じた瞬間でした。

ここではRork で作った本番 AI アプリに Langfuse を組み込み、(1)リクエスト単位のトレース、(2)モデル別・ユーザー別のコスト計測、(3)プロンプトや出力の品質スコアリング(Evals)を一気通貫で回す運用基盤の作り方をまとめました。Rork で AI を使っているけれど、月次のコストと品質に確信が持てない方に向けた実装ガイドです。

なぜ AI アプリに Observability が「後から」では遅いのか

先に結論から書きます。AI アプリの Observability は、リリースしてから追加するのは技術的には可能ですが、運用上の「判断」が致命的に遅れます。

理由は3つあります。1つ目は、コストの異常が起きたときに原因を特定できないこと。2つ目は、品質問題が起きたときにどのプロンプト・どの入力・どのモデルバージョンだったかを再構成できないこと。3つ目は、改善サイクルが「ユーザー報告」頼みになり、A/B テストやプロンプトの差し替えを自信を持って判断する根拠が揃わないことです。

ここでいう Observability とは、ただログを集めることではありません。リクエストが LLM プロバイダに届くまでの中間処理を全部つなげて1つの「トレース」として見られること、トレースごとにトークン数・コスト・モデル・ユーザー・バージョンが紐づくこと、そして後から人間がスコアを付けたり自動評価(Evals)が走って記録されることです。

Langfuse を選んだ理由(他の選択肢との比較)

AI アプリの Observability には Langfuse のほかにも Helicone、LangSmith、Braintrust、PostHog LLM Analytics、Arize などの選択肢があります。私が Rork アプリで Langfuse を採用した理由は大きく3つあります。

1つ目は、セルフホスト可能で、個人開発のデータを外部に持ち出したくないケースに対応できること。Rork で作った国内向けアプリの場合、ユーザーの会話ログを海外 SaaS に送ることに抵抗がある場面は珍しくありません。Langfuse は Docker で自分の VPS に立てられるため、プライバシー要件の厳しい案件にそのまま持っていけます。

2つ目は、トレース・プロンプト管理・Evals・データセット・アノテーションキューが1つのツールに統合されていることです。他社は「トレースは強いが Evals が弱い」「プロンプト管理は別ツール」という分担になりがちで、運用するほど道具が増えてつらくなります。

3つ目は、SDK の設計が「プロバイダ中立」であること。OpenAI、Anthropic、Google、あるいはオンデバイス推論まで、同じトレース形式で扱えます。Rork のアプリは AI プロバイダを後から乗り換えることがよくあるので、ロックインしない観測基盤は重要でした。

もちろん、これは私の使い方ベースの選択です。フルマネージドだけで済ませたい、チームで大規模に使う予定があるなら LangSmith や Braintrust のほうが向く場面もあります。

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
AI アプリをリリースしたあとに「月額コストが読めない」「どのプロンプトで事故が起きたか追えない」と困っていた状況が、今日から計測可能になります
Langfuse のトレース構造・スコアリング設計を Rork アプリに落とし込む具体的なコードを手に入れ、自前の Evals パイプラインを動かせるようになります
リリース直後に赤字化しやすい AI アプリの運用を、ユーザー体験の質を落とさずに黒字化まで持っていく判断基準が身につきます
Stripe による安全な決済 · いつでもキャンセル可能

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Rork Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • コピー&ペーストで使える実装コード付き
  • 毎日新しい上級ガイドを追加
  • ¥580/月 または ¥2,480 の永久アクセス
メンバーシップを見る →

関連記事

AI モデル2026-04-22
Rork × LiveKit: AI 音声エージェントを本番運用する通話インフラ設計ガイド
LiveKit Agents を Rork 製の React Native アプリに組み込み、AI 音声エージェントを本番で運用するための設計ノートです。Agent サーバーとトークン発行 API、着信や期限切れからの復帰処理、通話時間に紐づく課金、原価と損益分岐、深夜に見ることになる監視指標までを実装込みで扱います。
AI モデル2026-08-07
MCP のツールを減らしても軽くならない — 定義 2,377 バイトと応答 110,298 バイトを測り直した記録
壁紙カタログ用のMCPサーバを依存なしの最小構成で書き直し、ツール定義2,377バイトと応答110,298バイトを実測した記録です。削るべきは応答側であること、ツール統合の本当の理由が見分けやすさにあることを、測定ハーネスと3つの設計ルールとともに示します。
AI モデル2026-07-17
3分の動画だけが失敗する — Rork の動画解析をワーカー経由から端末直送に引き直す
Gemini Files API に動画を渡す経路を、Cloudflare Workers 中継から端末直送へ引き直した記録です。128MB のメモリ上限に当たる仕組み、resumable upload の発行だけをサーバーに残す実装、解像度とフレームレートで請求を決める判断までをまとめます。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます
もっと見る →