山田 育矢
株式会社Studio Ousia 共同創業者・チーフサイエンティスト
東京理科大学 創域情報学部 教授
東北大学 言語AI研究センター
特任教授(客員)
名古屋大学
数理・データ科学・人工知能教育研究センター 客員教授
人の高度な知的活動を支える、信頼できるAIの実現に、基礎研究と社会実装の両面から取り組んでいます。現在は、大規模言語モデル(LLM)・AIエージェントが、多様な知識を獲得・探索・統合し、根拠に基づいて推論・応答・行動するための方法を研究しています。
AIに関する国際コンペティションにおいて、6回の優勝を含む多数の上位入賞の実績があります(詳細)。 「大規模言語モデル入門」、「大規模言語モデル入門Ⅱ」の監修・共著を行ったほか、5冊の書籍の出版に携わりました(詳細)。
最新情報
過去のニュース
研究内容
AIによる知識の獲得・活用を軸として、言語モデル、質問応答・AIエージェント、情報抽出・構造化を中心に研究を進めています。論文一覧はGoogle Scholarをご覧ください。
言語モデル
知識を取り入れた言語モデルや、言語の違いを越えて知識を活用する方法を研究しています。知識強化言語モデルLUKE、多言語モデルmLUKE、言語間の知識転移を促すLEIAを提案しました。LUKEの論文は1,000件以上引用され、モデルはHugging Face Transformersにも収録されています。
代表論文
- LUKE: Deep Contextualized Entity Representations with Entity-aware Self-attention(Yamada et al., EMNLP 2020)
- mLUKE: The Power of Entity Representations in Multilingual Pretrained Language Models(Ri et al., ACL 2022)
- LEIA: Facilitating Cross-lingual Knowledge Transfer in Language Models with Entity-based Data Augmentation(Yamada & Ri, Findings of ACL 2024)
関連資料
- 知識拡張型言語モデルLUKE(JLR2023講演スライド)
質問応答・AIエージェント
AIが必要な情報を探索し、根拠に基づいて回答するための方法を研究しています。開発したシステムは、NIPS 2017 Human-Computer QAコンペティションで優勝し、全米クイズ王6人のチームとの対戦でも勝利しました。NeurIPS 2020 EfficientQAコンペティションでは、制約トラックで準優勝、無制約トラックで3位を獲得しました。NeurIPS 2025 MMU-RAGコンペティションでは、開発したAIエージェントがText-to-Textトラックの静的評価で優勝しました。検索モデルに再学習なしで知識を追加するKPRや、文書検索のメモリ使用量を抑えるBPRを提案しました。
代表論文
- Dynamic Injection of Entity Knowledge into Dense Retrievers(Yamada et al., Findings of EMNLP 2025)
- Efficient Passage Retrieval with Hashing for Open-domain Question Answering(Yamada et al., ACL-IJCNLP 2021)
- Trick Me If You Can: Human-in-the-Loop Generation of Adversarial Examples for Question Answering(Wallace et al., TACL 2019)
関連資料
- 最先端の質問応答技術の研究開発と迅速な実用化(情報処理学会NL研講演スライド)
- 強すぎて「会場がシーンと……」 クイズ王を圧倒した“早押しAI”の衝撃(ITmedia)
情報抽出・構造化
文章中の事物・概念やそれらの関係を抽出し、情報を構造化する方法を研究しています。単語と事物に関する知識を統一的に表現するWikipedia2Vecや、文脈に応じて名前が指す事物を特定するエンティティリンキングシステムなどを開発しました。また、WWW 2015 NEEL Challenge、ACL 2015 W-NUT Shared Task、ISWC 2020 SemTabで優勝し、WSDM Cup 2017 Triple Scoring Taskで準優勝しました。
代表論文
- Global Entity Disambiguation with BERT(Yamada et al., NAACL 2022)
- Entity Embedding Completion for Wide-Coverage Entity Disambiguation(Oba et al., Findings of EMNLP 2022)
- Wikipedia2Vec: An Efficient Toolkit for Learning and Visualizing the Embeddings of Words and Entities from Wikipedia(Yamada et al., EMNLP 2020, System Demonstrations)
- Learning Distributed Representations of Texts and Entities from Knowledge Base(Yamada et al., TACL 2017)
- Joint Learning of the Embedding of Words and Entities for Named Entity Disambiguation(Yamada et al., CoNLL 2016)
書籍
自然言語処理の学習においては理論と実装の両方が重要だと考え、両者を結びつけて学べる書籍を執筆・監修しました。
-
大規模言語モデル入門Ⅱ〜生成型LLMの実装と評価
山田育矢(著・監修), 鈴木正敏, 西川荘介, 藤井一喜, 山田康輔, 李凌寒
技術評論社, 2024 -
大規模言語モデル入門
山田育矢(著・監修), 鈴木正敏, 山田康輔, 李凌寒
技術評論社, 2023 -
ディープラーニングによる自然言語処理
山田育矢, 柴田知秀, 進藤裕之, 玉木竜二
共立出版, 2023 -
自然言語処理技術
鈴木潤, 土屋誠司, 本橋和貴, 高橋寛治, 田村晃裕, 山田育矢, 荒木健治, 森信介, 渡邉信一, 原紳, 水本智也, 清水武
情報機構, 2020 -
Pythonによるはじめての機械学習プログラミング
島田達朗, 越水直人, 早川敦士, 山田育矢
技術評論社, 2019
受賞
以下の国際コンペティションで上位入賞しました。
- 1位
- NeurIPS 2025 MMU-RAG Competition(Text-to-Textトラック・静的評価)
- 2位
- NeurIPS 2020 Efficient Open-Domain Question Answering Competition(restricted 6GB track)
- 3位
- NeurIPS 2020 Efficient Open-Domain Question Answering Competition(unrestricted track)
- 1位
- Shared Task in NAACL 2016 Workshop on Human-Computer QA
- 1位
- Shared Task #1 in ACL 2015 Workshop on Noisy User-generated Text (W-NUT 2015)
- 1位
- NEEL Challenge in WWW 2015 Workshop on Making Sense of Microposts
経歴
大学入学時に株式会社ニューロンを起業し、株式会社フラクタリストへの売却を経て、株式会社Studio Ousiaを共同創業しました。現在はStudio Ousiaのチーフサイエンティストと東京理科大学教授を務めるほか、東北大学・名古屋大学でも客員として研究に携わっています。
- 2000年
- 慶應義塾湘南藤沢高等部 卒業
- 2000年
- 株式会社ニューロン 代表取締役
- 2003年
- 株式会社フラクタリスト 取締役技術戦略担当(株式会社ニューロンを売却)
- 2005年
- 慶應義塾大学環境情報学部 卒業
- 2007年
- 株式会社Studio Ousia 代表取締役チーフサイエンティスト
- 2011年
- 慶應義塾大学大学院政策・メディア研究科 修士課程 修了
- 2016年
- 慶應義塾大学大学院政策・メディア研究科 博士課程 修了。博士(学術)
- 2018年
- 理化学研究所 革新知能統合研究センター 客員研究員
- 2023年
- 株式会社Studio Ousia チーフサイエンティスト(現任)
- 2024年
- 名古屋大学 数理・データ科学・人工知能教育研究センター 客員教授(現任)
- 2025年
- 東北大学 言語AI研究センター 特任教授(客員)(現任)
- 2026年
- 東京理科大学 創域情報学部 教授(現任)
主な講演
- LLMを深く知り、上手に育てるー大規模言語モデルの仕組みと研究の最前線ー (2026年1月, Keio-SPRING Ph.D. Seminar)
- LLMを深く知り、上手に育てる (2025年11月, 東京理科大学 ゲーム開発学特論 ゲスト講義)
- 知識を効率的に追加・編集・蓄積できるAIを作る(2025年10月, 東京理科大学TUS Forum)
- Knowledgeable AIプロジェクト: 知識を効率的に追加・編集・蓄積できるAIを作る(2025年10月, 名古屋大学TokAI BOOST)
- 事前学習(上級編)(2025年10月, 東京大学松尾・岩澤研究室 大規模言語モデル講座 基礎編)
- Knowledgeable AIプロジェクト: 知識を効率的に追加・編集・蓄積できるAIを作る(2025年9月, 言語処理若手シンポジウム2025 招待ポスター)
- 大規模言語モデルの技術と最新動向(2024年6月, 情報処理学会DICOMO 2024)
- 言語間転移学習で大規模言語モデルを賢くする(2024年3月, 言語処理学会第30回年次大会ワークショップ「生成AI時代の自然言語処理における産学官の役割と課題」)
- 最先端の質問応答技術の研究開発と迅速な実用化(2023年3月, 情報処理学会 第255回自然言語処理研究会)
- 知識拡張型言語モデルLUKE(2023年3月, 言語処理学会第29回年次大会ワークショップ「日本語言語資源の構築と利用性の向上」)
- Studio Ousiaの技術開発の取り組みとAWSの活用(2021年5月, AWS Summit Online Japan)
- エンティティエンベディングの学習とその活用(2021年4月, 理化学研究所AIP 森羅2021-LinkJPキックオフミーティング)
- オープンドメイン質問応答技術の最新動向(2021年3月, 言語処理学会第27回年次大会ワークショップ「AI王 〜クイズAI日本一決定戦〜」)
- 知識ベースの自然言語処理への活用 (2020年12月, 第22回音声言語シンポジウム兼第7回自然言語処理シンポジウム)
- 実践!AllenNLPによるディープラーニングを用いた自然言語処理 (2020年10月, 言語処理学会 言語処理技術セミナー)
- 自然言語処理の開発現場でのAWS活用術 ーリサーチからデプロイまでー (2019年10月, AWS DevDay Tokyo)
- PythonによるWikipediaを活用した自然言語処理 (2018年10月, PyData.tokyo One-day Conference)
- 自然言語処理にWikipediaを活用する (2018年9月, 国立国語研究所 コーパスとしてのウェブテキスト活用シンポジウム)
- 自然言語処理を使って”賢い”人工知能を作る (2018年5月, 慶應義塾大学SFC 現代技術と社会)
- 全米クイズ王チームに勝利した早押しクイズAIの仕組み (2018年4月, PyData.Tokyo Meetup #18 データ分析コンペティションの勝ち上がり方)
- 知識ベースを活用した自然言語処理の手法とその応用 (2018年3月, ステアラボ人工知能シンポジウム 2018)
- Pythonを使って言語処理のコンペティションにチャレンジ (2015年10月, PyData.Tokyo Meetup #6 データマイニングコンペティション)
- 知識ベースを活用したエンティティリンキング (2015年7月, 人工知能学会 第36回セマンティックウェブとオントロジー研究会)