Yozora Finance

AIはもう、十分に賢い。 足りないのは、
AIのためのデータ基盤。

Yozora Financeは、約4,000社の開示文書を構造化し、AIが検索できるデータ基盤として自社開発・運用してきました。この技術による文書基盤の構築を、開発支援として提供しています。

自社データ基盤として本番運用中

470万
構造化済みの本文・表
4,000
主要市場の上場企業
1,400件超/月
一次・公式ソースに基づく経済ニュース *

* 2026年7月16日までの直近30日間の実績。

AIのためのデータ基盤を、設計から構築・運用まで

調査報告書、顧客向けレポート、過去の会議資料。会社の知見の多くは、ファイル形式も書き方もばらばらな文書のなかに散らばっています。私たちは、この文書群を、必要なときに知見を取り出せる資産に変えます。

文書構造化パイプラインの開発

PDF・帳票・XBRLなどの非定型文書を、目次・セクション・表の構造を保ったまま、AIが扱えるテキスト・Markdownに変換します。

検索・RAG基盤の構築

キーワード一致と意味検索を組み合わせたハイブリッド検索で、文書群から根拠を返します。出典に戻れる設計で回答を検証可能にし、MCPやAgent Skillsを通じてAIエージェントからも利用できます。

検索精度の評価・改善

お客様のデータで評価セットを作成し、検索・RAGの精度を数字で測定・改善します。「良くなった気がする」で終わらせません。

進め方

  1. 01

    ヒアリング

    対象の文書とAIに任せたい業務を伺い、成功の基準をすり合わせます。

  2. 02

    精度検証PoC

    データの一部で検索基盤を試作し、精度を評価レポートとして納品します。

  3. 03

    本開発

    PoCの結果をふまえ、本番の基盤を構築します。

  4. 04

    運用・改善

    精度の継続測定と改善を行い、必要に応じて内製化を支援します。

本開発に進むかどうかは、PoCで精度の数字をご覧いただいてから判断できます。

データの取り扱い

  • 秘密保持契約(NDA)を締結のうえで、ヒアリング・PoCを実施できます。
  • 検索の中核となる埋め込みモデルは自社開発のため、外部APIに依存しない構成も設計できます。お客様環境(閉域ネットワーク・オンプレミス)での構築もご相談ください。

独自ベンチマークが示す検索精度

汎用の検索ベンチマークで高い点を取るモデルが、開示文書の検索にも強いとは限りません。私たちは約384万件(評価セット構築時点)の本番コーパスから「投資判断に使える根拠を返せるか」を測る独自ベンチマークを構築し、その上で埋め込みモデルを自社開発しました。

1.3億パラメータの自社モデルが、OpenAI・Googleの埋め込みAPIを含むすべての比較モデルを上回りました。

+40.3%
nDCG@10、OpenAI text-embedding-3-large 比
+15.7%
nDCG@10、Gemini Embedding 2(Google)比
130M
パラメータ数 — 1Bクラスの約8分の1のサイズで最高精度
モデル nDCG@10 MRR@10 nDCG@10 (g3)
Yozora Investor Embedding v1 130M 0.5012 0.8424 0.3033
Yozora Investor Embedding v1 70M 0.4668 0.7993 0.2645
Sarashina Embedding v2 1B 0.4560 0.7399 0.2474
Yozora Investor Embedding v1 30M 0.4357 0.7739 0.2349
Gemini Embedding 2 0.4333 0.7220 0.2236
PLaMo Embedding 1B 0.4111 0.7207 0.1977
BM25 0.3920 0.6743 0.1898
Qwen3 Embedding 0.6B 0.3637 0.6035 0.1700
Ruri v3 310M 0.3618 0.6491 0.1698
Jina Embeddings v5 Text Small 0.3609 0.6199 0.1696
Harrier OSS v1 0.6B 0.3576 0.6097 0.1629
OpenAI text-embedding-3-large 0.3573 0.6287 0.1575
Ruri v3 130M(ベースモデル) 0.3312 0.6186 0.1387
参考: RRF(自社130M + BM25) 0.5325 0.8639 0.3329
944
評価用の検索文
43,481
評価対象の文書チャンク
161,808
採点済みペア
0–3
4段階の関連度評価
評価方法の詳細

評価セットは、適時開示・有価証券報告書からなる約384万チャンクの本番コーパスに対し、複数の検索手法で上位候補をプールして構築(TREC方式)。関連度はグレード2以上を「投資判断に使える根拠」と定義しています。採点基準は人手の判定と突き合わせて設計・調整した上で、モデルの学習に関与していない独立のモデル(Qwen 3.7 Plus)により161,808ペア全体に適用しました。グレード境界や定型文の扱いなど判定が難しい事例は人手で検証し、採点品質を確認しています。nDCG@10 (g3)はグレード3のみを正解とする厳格条件です。ベースモデル(Ruri v3 130M)からのファインチューニングにより、nDCG@10は0.3312から0.5012に向上しました。

評価セットの構築からモデルの選定・改善までのこのプロセスは、開発支援でもお客様の文書に対して同じ方法で提供しています。詳細な方法論・追加の評価結果にご関心のある方はお問い合わせください。

モモンガサーチAPI

企業公表資料と経済ニュースを、AIで扱いやすくする検索API

適時開示、IR資料、有価証券報告書、金利・政策・地政学などのニュースを、出典に戻れる形で検索・取得できるREST APIです。PDFやXBRLの取得・整形、目次・セクション抽出をAPI側で行うため、必要な一次情報だけをAIや分析ワークフローに組み込めます。

経営チーム

SNSやメディアでは毎日のように派手なデモを目にするのに、実務ではかゆいところに手が届かない。自分たちでAIを使い込むなかで抱えた、そんな不満から始まった会社です。ボトルネックはデータと、それをAIに渡す仕組み。金融や自然言語処理に強みを持つメンバーが、その地味な部分にとことん向き合っています。

惠良祐太の写真

代表取締役 CEO

惠良 祐太Yuta Era

全日本学生投資連盟(JPSI)代表理事として、学生向け投資カンファレンスや国際投資大会の企画・運営に従事。投資リサーチにおける一次情報の収集・分析の非効率に課題を感じ、Yozora Financeを創業。事業開発・外部連携・プロダクト戦略を担当。

富田悠介の写真

執行役員 CTO

富田 悠介Yusuke Tomita

早稲田大学大学院 田中研究室にて、有価証券報告書や契約書のように定型文の多い産業文書に対する検索・クラスタリング技術を研究。プロダクト開発・事業戦略を担当。

源怜維の写真

執行役員 CRO

源 怜維Rei Minamoto

早稲田大学大学院 河原研究室にて自然言語処理・大規模言語モデルを研究。国立情報学研究所の補助研究員として日本語LLMの研究開発に従事。LLMの安全性と学習データ構築に関する研究が、自然言語処理分野のトップ国際会議ACL 2026(Findings)に採択。研究開発・技術評価を担当。

ニュース

  • プレスリリース

    「モモンガサーチAPI」ベータ提供開始 — 320万超の本文・表を横断検索

    PR TIMESで読む

技術発信

プロダクト開発の過程や検索技術の知見を、開発記録としてZennで公開しています。

Zennですべての記事を見る

会社概要

社名
株式会社Yozora Finance
代表者
代表取締役 惠良 祐太
設立
2026年2月
所在地
東京都調布市
事業内容
金融データ基盤・検索APIの開発および提供、企業向けデータ基盤構築の開発支援

お問い合わせ

データ基盤構築・検索/RAG開発のご相談、モモンガサーチAPIの導入、業務提携に関するお問い合わせは、メールにてご連絡ください。秘密保持契約(NDA)を締結のうえでのご相談も可能です。

info@yozorafinance.com