← Open Source
llm-jp

awesome-japanese-llm

日本語LLMまとめ - Overview of Japanese LLMs

ListsModel collectionsTypeScript
Open on GitHub
Momentum
+0stars in 24 hours0.0%
1.44k
Stars
47
Forks
+5
This week
12
Contributors
Created 2023-07-09 · Updated 2026-10-06 · #9610 today
Top developers
README

日本語LLMまとめ

[ English | Français | 日本語 ]

[!IMPORTANT] 📖 より読みやすいWeb版をご利用ください

このREADMEの内容は、llm-jp.github.io/awesome-japanese-llm でより見やすい形式でご覧いただけます。表の表示崩れやレイアウトの問題を防ぐため、Web版の閲覧を推奨いたします。

この記事は、一般公開されている日本語LLM(日本語を中心に学習されたLLM)および日本語LLM評価ベンチマークに関する情報をまとめたものです。情報は、有志により収集されており、その一部は論文や公開されているリソースなどから引用しています。

::: warning 以下の点について、あらかじめご理解とご了承をお願いいたします

  1. 本記事の内容は、完全性や正確性を保証するものではありません。これらの情報は予告なく変更されることがあり、また最新の情報を常に提供できるとは限りません。
  2. 一部の情報は、推測や個々の利用者の解釈にもとづくものである場合があります。そのため、全ての読者にとって必ずしも正確であるとは限りません。
  3. 本記事に記載されているモデルの多くは、MIT や Apache-2.0 といったオープンソースライセンスが適用されています。しかしながら、一部のモデルには、非営利限定のライセンス(例:CC BY-NC-SA 4.0)や開発元特有のライセンスが適応されており、これらは必ずしもオープンソースとは言えない可能性がある点にご注意ください。
  4. 個人が開発したモデルに関する記述では、作成者の敬称は省略させていただいております。 :::

この記事の管理は GitHub で行っています。記事の間違いを発見した場合、あるいはモデルの追加提案を行いたい場合は、GitHub Issues 経由で報告していただけますと幸いです。

::: details 目次 {open} [[toc]] :::

テキスト生成に主に使うモデル

画像を含むテキスト生成モデルはこちら

スクラッチ学習モデル

汎用

| | 公開年 | アーキテクチャ | 入出力で扱える
トークン数 | 学習テキスト | 開発元 | ライセンス / 利用規約 | |:---|:---:|:---:|:---:|:---:|:---:|:---:| | Sarashina2-8x70B | 2024 | MoE
(8x70b (465b)) | 8,192 | Sarashina2 (70B) に対して Sparse Upcycling で学習 | SB Intuitions | Sarashina Model NonCommercial License | | LLM-jp-3 172B | 2024 | Llama
(172b, 172b-instruct2, 172b-instruct3) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k
DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst | 大規模言語モデル研究開発センター | 事前学習済みモデル: LLM-jp-3 172B Terms of Use
事後学習済みモデル: llm-jp-3-172b-instruct3利用許諾契約 | | LLM-jp-3 172B beta2 | 2024 | Llama
(172b-beta2, 172b-beta2-instruct2) | 4,096 | 事前学習: llm-jp-corpus-v3の一部
(計 1.4T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k | 大規模言語モデル研究開発センター | LLM-jp-3 172B beta2 Terms of Use | | LLM-jp-3 172B beta1 | 2024 | Llama
(172b-beta1, 172b-beta1-instruct) | 4,096 | 事前学習: llm-jp-corpus-v3の一部
(計 0.7T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN | 大規模言語モデル研究開発センター | LLM-jp-3 172B beta1 Terms of Use | | LLM-jp-3 172B alpha | 2024 | Llama
(172b-alpha1, 172b-alpha1-instruct, 172b-alpha2, 172b-alpha2-instruct) | 4,096 | 事前学習: llm-jp-corpus-v3の一部
(alpha1: 計 0.7T トークン, alpha2: 計 1.4T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN | 大規模言語モデル研究開発センター | Apache 2.0 | | Stockmark-2-100B-Instruct-beta | 2025 | Llama
(100B-Instruct-beta, 100B-Instruct-beta-AWQ) | 4,096 | 事前学習: 計 1.5T トークン
Instruction Tuning
DPO | ストックマーク | MIT | | Stockmark-100b | 2024 | Llama
(100b, 100b-instruct-v0.1) | 4,096 | 事前学習: RedPajama, 日本語 Wikipedia, Japanese mC4, Japanese CommonCrawl, 日本語特許, Stockmark Web Corpus
(計 910B トークン)
Instruction Tuning (LoRA): ichikara-instruction | ストックマーク | MIT | | PLaMo-100B-Pretrained | 2024 | Llama[^22]
(100b) | 4,096 | 事前学習: Japanese CommonCrawl, RefinedWeb, 独自のデータセット
(計: 2.0T トークン) | Preferred Elements (Preferred Networks) | PLaMo Non-Commercial License | | LLM-jp-3.1 | 2025 | Llama/MoE
(8x13b (73b), 8x13b (73b)-instruct4, 13b, 13b-instruct4, 1.8b, 1.8b-instruct4) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.5T トークン)
継続事前学習: インストラクション・レスポンスペア
(計 90B トークン)
SFT + DPO | 大規模言語モデル研究開発センター | Apache 2.0 | | LLM-jp-3 MoE | 2025 | MoE
(8x1.8b (9.3b), 8x1.8b (9.3b)-instruct2, 8x1.8b (9.3b)-instruct3, 8x13b (73b), 8x13b (73b)-instruct2, 8x13b (73b)-instruct3) | 4,096 | LLM-jp-3 (1.8b, 13b) に対して Drop-Upcycling で学習 | 大規模言語モデル研究開発センター | Apache 2.0 | | Sarashina2 | 2024 | Llama
(7b, 13b, 70b) | 7b, 13b: 4,096
70b: 8,192 | 事前学習: Japanese Common Crawl, SlimPajama, StarCoder
(計 2.1T トークン) | SB Intuitions | MIT | | Sarashina1 | 2024 | GPT-NeoX
(7b, 13b, 65b) | 2,048 | 事前学習: Japanese Common Crawl
(計 1T トークン) | SB Intuitions | MIT | | Tanuki-8×8B | 2024 | MoE (47b)
(v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF) | 4,096 | 事前学習: 様々な Web 上のデータ, 合成データ(計 1.7T トークン)
SFT, DPO: 様々な合成データ [^19] | 松尾研LLM開発プロジェクト | Apache 2.0 | | LLM-jp-4 33B | 2026 | Llama
(33b-base, 33b-thinking, 33b-thinking-gguf) | 65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO: llm-jp-4-33b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 | | LLM-jp-4.1 33B | 2026 | Llama
(33b-thinking, 33b-thinking-gguf) | 65,536 | LLM-jp-4 33B に対し事後学習
SFT: llm-jp-4.1-thinking-sft-data
DPO: llm-jp-4.1-33b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 | | ELYZA-Thinking-1.0-llm-jp-4-33b | 2026 | Llama
(33b) | 65,536 | llm-jp-4-33b-base に対し中間学習、SFT、RLVR を実施
中間学習: 数学・コード・STEM問題の日本語化、エージェントデータの日本語化
SFT: 思考過程付き合成データ、複雑な指示データ、日本語 Wikipedia・Wikidata からの知識データ
RLVR: 数学・コード・日本語知識・複雑な指示追従・ツール利用の検証可能問題 | ELYZA | Apache 2.0 | | LLM-jp-4 32B-A3B | 2026 | Qwen3 MoE
(32b-a3b-base, 32b-a3b-thinking, 32b-a3b-thinking-gguf) | 65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO: llm-jp-4-32b-a3b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 | | LLM-jp-4.1 32B-A3B | 2026 | Qwen3 MoE
(32b-a3b-thinking, 32b-a3b-thinking-gguf) | 65,536 | LLM-jp-4 32B-A3B に対し事後学習
SFT: llm-jp-4.1-thinking-sft-data
DPO: llm-jp-4.1-32b-a3b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 | | ELYZA-Thinking-1.0-llm-jp-4-32b-a3b | 2026 | Qwen3 MoE
(32b-a3b) | 65,536 | llm-jp-4-32b-a3b-base に対し中間学習、SFT、RLVR を実施
中間学習: 数学・コード・STEM問題の日本語化、エージェントデータの日本語化
SFT: 思考過程付き合成データ、複雑な指示データ、日本語 Wikipedia・Wikidata からの知識データ
RLVR: 数学・コード・日本語知識・複雑な指示追従・ツール利用の検証可能問題 | ELYZA | Apache 2.0 | | llm-jp-4-kappa | 2026 | Qwen3 MoE
(32b-a3b-v0.1) | 65,536 | LLM-jp-4 32B-A3B (thinking) に対して以下を実施
SFT: Nemotron-Cascade-2-SFT-Data, OpenMathReasoning, OpenCodeReasoning, Nemotron-SFT-Competitive-Programming-v2, llm-jp-4-thinking-sft-data など (計 443,747 件)
GRPO (数学): AceReason-Math から選別した 10,999 問
GRPO (コード): SYNTHETIC-2 から選別した約 3.1k 件 | Third Intelligence | Apache 2.0[^29] | | PLaMo 3 | 2025 | Gemma ベースのアーキテクチャ
(2b-base, 8b-base, 31b-base) | 4,096 | 事前学習: 英語、日本語、コード、多言語
(2b: 200B トークン, 8b: 1T トークン, 31b: 3T トークン) | Preferred Networks | PLaMo community license | | Way-PLaMo-3-8b-chat | 2025 | PLaMo 3ベース (8b-chat) | 4,096 | Instruction Following SFT: Alpaca (51.7K), Dolly-15k-ja (15K) | 個人 (WayBob) | PLaMo community license | | CyberAgentLM3 (CALM3) | 2024 | Llama
(22b-chat, 22b-chat-selfimprove-experimental) | 16,384 | 不明
(計 2.0T トークン) | サイバーエージェント | Apache 2.0 | | LLM-jp-3 13B instruct3 | 2025 | Llama
(150m, 150m-instruct2, 150m-instruct3, 440m, 440m-instruct2, 440m-instruct3, 980m, 980m-instruct2, 980m-instruct3, 1.8b-instrcut2, 1.8b-instruct3, 3.7b-instruct2, 3.7b-instruct3, 7.2b-instruct2, 7.2b-instruct3, 13b-instruct2, 13b-instruct3) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, Synthetic-JP-EN-Coding-Dataset-567k
DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst | 大規模言語モデル研究開発センター | Apache 2.0 | | LLM-jp-3 13B | 2024 | Llama
(1.8b, 1.8b-instruct, 3.7b, 3.7b-instruct, 7.2b, 7.2b-instruct, 13b, 13b-instruct) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k | 大規模言語モデル研究開発センター | Apache 2.0 | | llm-jp-3-3.7b-instruct-EZO | 2024 | Llama
(3.7b-instruct-EZO-Common, 3.7b-instruct-EZO-Humanities) | 4,096 | LLM-jp-3 (3.7B) に対して追加学習 | Axcxept | Apache 2.0 | | LLM-jp-13B v2.0 | 2024 | Llama
(13b-v2.0, 13b-instruct-full-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001_16x-dolly-ichikara_004_001_single-oasst-oasst2-v2.0) | 4,096 | 事前学習: llm-jp-corpus-v2
(計 260B トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2 | LLM-jp | Apache 2.0 | | Fugaku-LLM | 2024 | GPT
(13B, 13B-instruct, 13B-instruct-gguf) | 2,048 | 事前学習: 独自
Instruction Tuning: OASST1, Dolly Dataset, GSM8K | 東工大, 東北大, 富士通, 理研, 名大, サイバーエージェント, Kotoba Technologies | Fugaku-LLM Terms of Use | | LLM-jp-13B v1.1 | 2024 | GPT
(13b-instruct-lora-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-instruct-full-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-dpo-lora-hh_rlhf_ja-v1.1) | 2,048 | Instruction Tuning (LoRA or Full-parameter FT): Dolly Dataset, OASST1, ichikara-instruction
DPO (LoRA): HH RLHF | LLM-jp | Apache 2.0 | | LLM-jp-13B | 2023 | GPT
(1.3b-v1.0, 13b-v1.0, 13b-instruct-full-jaster-v1.0, 13b-instruct-full-jaster-dolly-oasst-v1.0, 13b-instruct-full-dolly-oasst-v1.0, 13b-instruct-lora-jaster-v1.0, 13b-instruct-lora-jaster-dolly-oasst-v1.0, 13b-instruct-lora-dolly-oasst-v1.0) | 2,048 | 事前学習: llm-jp-corpus (Wikipedia, Japanese mC4, The Pile, Stack) (計 300B トークン)
Instruction Tuning (Full-parameter FT or LoRA): jaster, Dolly Dataset, OASST1 | LLM-jp | Apache 2.0 | | PLaMo-13B | 2023 | Llama[^1]
(13b, 13b-instruct, 13b-instruct-nc) | base: 4,096
instruct, instruct-nc: 8,192 | 事前学習: C4, Project Gutenberg, RedPajama, 日本語 Wikipedia, Japanese mC4
(計 1.5T トークン)
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1, llm-japanese-datasetのwikinews subset (NCモデルでは商用利用不可の Alpaca Dataset も含めて学習) | Preferred Networks | Apache 2.0
(NC モデルは CC BY-NC 4.0) | | Stockmark-13b | 2023 | Llama
(13b, 13b-instruct) | 2,048 | 事前学習: 日本語 Wikipedia、Japanese CC-100、Japanese mC4、Japanese CommonCrawl、日本語特許、Stockmark Web Corpus
(計 220B トークン)
Instruction Tuning (LoRA): ichikara-instruction | ストックマーク | baseモデル: MIT
instructモデル: CC BY-NC-SA 4.0 | | Weblab-10B | 2023 | GPT-NeoX
(10b, 10b-instruction-sft) | 2,048 | Japanese mC4 + The Pile(計 600B トークン)
*instruction-sft モデルは Alpaca Dataset, FLAN でファインチューニング | 東大 松尾・岩澤研 | CC BY-NC 4.0 | | LLM-jp-4 8B | 2026 | Llama
(8b-base, 8b-instruct, 8b-thinking, 8b-thinking-gguf) | 65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO (thinking のみ): llm-jp-4-8b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 | | LLM-jp-4.1 8B | 2026 | Llama
(8b-thinking, 8b-thinking-gguf) | 65,536 | LLM-jp-4 8B に対し事後学習
SFT: llm-jp-4.1-thinking-sft-data
DPO: llm-jp-4.1-8b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 | | PLaMo 2.1 8B | 2025 | Samba ベースのアーキテクチャ
(8b-cpt) | 32,768 | 訓練詳細不明 | Preferred Networks | PLaMo community license | | PLaMo 2 8B | 2025 | Samba ベースのアーキテクチャ
(8b) | | 日本語、英語等のデータ
(計 6T トークン) | Preferred Networks | PLaMo community license | | Tanuki-8B | 2024 | Tanuki (8b)
(v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF) | 4,096 | 事前学習: 様々な Web 上のデータ, 合成データ(計 1.3T トークン)
SFT, DPO: 様々な合成データ [^19] | 松尾研LLM開発プロジェクト | Apache 2.0 | | Japanese StableLM Alpha | 2023 | GPT-NeoX
(base-alpha-7b, instruct-alpha-7b, instruct-alpha-7b-v2) | 2,048 | Wikipedia, Japanese CC-100, Japanese mC4, Japanese OSCAR, RedPajama
(+ 独自のデータセット)[^2]
(計 750B トークン)
*instruct モデルでは Alpaca Dataset, Dolly Dataset, HH RLHF, llm-japanese-datasetのwikinews subsetでファインチューニング
(v2では商用利用不可の Alpaca Dataset を除外) | Stability AI | baseモデル: Apache 2.0
instruct モデル (v1): 独自のライセンス
instruct モデル (v2): Apache 2.0 | | CyberAgentLM2 (CALM2) | 2023 | Llama
(7b, 7b-chat, 7b-chat-dpo-experimental) | base: 4,096
chat: 32,768 |一般公開されている日本語・英語のデータセット(詳細不明) (計 1.3T トークン)
*dpo モデルは Chatbot Arena Conversations JA (calm2) Dataset を用いて DPO で学習 | サイバーエージェント | Apache 2.0
(dpo モデルのみ CC BY 4.0) | | OpenCALM | 2023 | GPT-NeoX
(small, medium, large, 1b(1.4b), 3b(2.7b), 7b(6.8b)) | 2,048 | 日本語 Wikipedia

ドメイン特化型

公開年 ドメイン アーキテクチャ 学習テキスト 開発元 ライセンス
SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-32k-R0.1 2026 医療 MoE 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
SIP-med-LLM/SIP-jmed-llm-3-8x13b-AC-32k-instruct 2025 医療 MoE 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 PMC-Patients 等を用いた Instruction Tuning 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ SIP-jmed-llm-3-8x13b-AC-32k-instruct Terms of Use[^25]
SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-4k-base 2025 医療 MoE 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
SIP-med-LLM/SIP-jmed-llm-2-8x13b-OP-instruct 2025 医療 MoE 医療系コーパス (44.2B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、その後 Instruction Tuning 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
SIP-med-LLM/SIP-jmed-llm-3-13b-OP-32k-R0.1 2026 医療 Llama 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
SIP-med-LLM/SIP-jmed-llm-3-13b-OP-4k-base 2025 医療 Llama 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
AscleLM-1-10B 2026 医療 Mamba-2 Hybrid
(Nemotron-H ベース) 事前学習: Nemotron-CC v1 (約 6.3T トークン)、オープンソースの日本語・英語・中国語コーパス、コード・数学・推論データ (計 約 8.5T トークン)、および医学論文・医学書籍・診療ガイドライン・試験問題を由来とする合成データ 東大 松尾・岩澤研 AscleLM-1-10B Terms of Use[^27]
日本語対話Transformer 2021 対話 Transformer Twitter 上の日本語リプライのペア NTT 独自のライセンス
日本語ニュースBART 2023 ビジネス BART (base) 日本語ビジネスニュース記事(約2,100万記事 (2.9億文)) ストックマーク MIT
AcademicBART 2023 学術 BART (base) CiNii の日本語論文 愛媛大 人工知能研究室 Apache 2.0

海外モデルに日本語で継続事前学習を行ったモデル

※継続事前学習後に事後学習(SFT, DPO, RLなど)を行ったモデルも含みます

汎用

公開年 ベースのLLM 学習テキスト 開発元 ライセンス / 利用規約
GPT-OSS Swallow 120B
(120B-SFT-v0.1, 120B-RL-v0.1, 120B-RL-v0.1-MXFP4) 2026 GPT-OSS (120b) 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 419.4B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset) Swallowプロジェクト Apache 2.0
Llama 3.3 Swallow 70B
(70B-v0.4, 70B-Instruct-v0.4) 2025 Llama 3.3 (70b) 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1, Swallow-Code-v0.3-Instruct-style Swallowプロジェクト Llama 3.3 Community License & Gemma Terms of Use
Llama 3.1 Swallow 70B
(70B-v0.1, 70B-Instruct-v0.1, 70B-Instruct-v0.3) 2024 Llama 3.1 (70b) 事前学習: The Stack v2, Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus
Instruction Tuning: lmsys-chat-1m-synth-ja-wo-pii-and-template-instructions, lmsys-chat-1m-synth-en-wo-pii-and-template-instructions, filtered-magpie-ultra-ja, filtered-magpie-ultra-en, gemma-magpie Swallowプロジェクト Llama 3.1 Community License
(Instructモデルは Gemma Terms of Use も適用)
cyberagent/Llama-3.1-70B-Japanese-Instruct-2407 2024 Llama 3.1 (70b) 不明 サイバーエージェント Llama 3.1 Community License
Llama 3 Swallow 70B
(70B-v0.1, 70B-Instruct-v0.1) 2024 Llama 3 (70b) 事前学習: Algebraic Stack, Wikipedia, RefinedWeb, Swallow Corpus, Cosmopedia, Laboro ParaCorpus, OpenWebMath
Instruction Tuning: OASST1 [^17] Swallowプロジェクト Llama 3 Community License
turing-motors/Llama-3-heron-brain-70B-v0.3 2024 Llama 3 (70b) Llama 3 Swallow 70B に対して追加学習(詳細不明) Turing Llama 3 Community License
Llama 3 Youko 70B
(70b, 70b-instruct, 70b-gptq, 70b-instruct-gptq) 2024 Llama 3 (70b) 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 5B トークン)
Instruction Tuning: 独自のデータセット[^11] rinna Llama 3 Community License
Swallow 70B
(70b-hf, 70b-instruct-hf, 70b-instruct-v0.1, 70b-NVE-hf, 70b-NVE-instruct-hf) 2023 Llama 2 (70b) 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1
*v0.1モデルでは OASST1, OASST2 を使用 Swallowプロジェクト Llama 2 Community License
KARAKURI LM
(70b-v0.1, 70b-chat-v0.1) 2024 Llama 2 (70b) 事前学習: mC4, CC100, OSCAR, RedPajama, 独自のデータセット
(計 16B トークン)
SteerLM: OASST2, 独自のデータセット カラクリ Llama 2 Community License[^13]
Japanese Stable LM Beta 70B
(base-beta-70b, instruct-beta-70b) 2023 Llama 2 (70b) 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外)
(計 100B トークン)
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1 Stability AI Llama 2 Community License
Fujitsu-LLM-KG
(8x7B_cpt, 8x7B_inst-infer_v1, 8x7B_inst-infer_v2, 8x7B_inst-gen_ja, 8x7B_inst-gen_en) 2025 Mixtral-8x7B-Instruct-v0.1 (46.7b) 事前学習: 知識グラフ並列コーパス(森羅プロジェクト、Wikipedia等から合成) 2.1Bトークンを含む計約300Bトークン
Instruction Tuning: 知識グラフ推論・生成タスク用データセット 富士通 Apache 2.0
Swallow-MX 8x7B
(8x7b-NVE-v0.1) 2024 Mixtral-8x7B-Instruct-v0.1 (46.7b) 事前学習: Algebraic Stack, Japanese Wikipedia, RefinedWeb, Swallow Corpus, The Pile, The Vault Swallowプロジェクト Apache 2.0
KARAKURI LM 8x7B Instruct v0.1
(8x7b-instruct-v0.1) 2024 Mixtral-8x7B-Instruct-v0.1 (46.7b) Swallow-MX 8x7B に対して以下のデータセットで学習: Dolly Dataset, OASST2, HelpSteer, glaive-code-assistant-v3, glaive-function-calling-v2, synthetic_text_to_sql, MetaMathQA, orca-math-word-problems-200k, rag-dataset-12000, rag-hallucination-dataset-1000, 独自のデータセット カラクリ Apache 2.0 (?)[^12]
KARAKURI LM 8x7B Chat v0.1
(8x7b-chat-v0.1) 2024 Mixtral-8x7B-Instruct-v0.1 (46.7b) Swallow-MX 8x7B に対して
SteerLM: OASST2, HelpSteer, 独自のデータセット カラクリ Apache 2.0
ABEJA-Mixtral-8x7B-japanese
(8x7B-v0.1-japanese, 8x7B-Instruct-v0.1-japanese, 8x7B-Instruct-v0.1-japanese-alpha, 8x7B-Instruct-v0.1-japanese-alpha-merged) 2024 Mixtral-8x7B-Instruct-v0.1 (46.7b)
*Instructが名前に付いていないモデルのみ Mixtral-8x7B-v0.1 がベース 事前学習: Japanese CC, Redpajama, 独自
(計 450B トークン) ABEJA Apache 2.0
Qwen3 Swallow 32B
(32B-CPT-v0.2, 32B-SFT-v0.2, 32B-RL-v0.2, 32B-RL-v0.2-AWQ-INT4) 2026 Qwen3 (32b) 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 209.7B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset) Swallowプロジェクト Apache 2.0
ELYZA-Thinking-1.0-Qwen-32B
(32B) 2025 Qwen 2.5 (32b) 事前学習 + SFT (Reasoning) ELYZA Apache 2.0
ELYZA-Shortcut-1.0-Qwen-32B
(32B) 2025 Qwen 2.5 (32b) 事前学習 + SFT ELYZA Apache 2.0
ABEJA-Qwen2.5-32b-Japanese-v1.0
(v1.0) 2025 Qwen2.5-32B-Instruct (32b) 継続事前学習 + SFT + DPO: 約2万件の合成データ・人手アノテーションデータセット(抽出・推論能力に特化) ABEJA Apache 2.0
Qwen2.5 Bakeneko 32B
(qwen2.5-bakeneko-32b, qwen2.5-bakeneko-32b-instruct, deepseek-r1-distill-qwen2.5-bakeneko-32b, qwq-bakeneko-32b) 2025 Qwen 2.5 (32b) rinna Apache 2.0
ABEJA-QwQ32b-Reasoning-Japanese-v1.0
(v1.0) 2025 Qwen 2.5 (32b) ABEJA-Qwen2.5-32b-Japanese-v0.1 に QwQ 32b の Chat Vector をマージした上で追加学習 ABEJA Apache 2.0
ABEJA-Qwen2.5-32b-Japanese-v0.1
(32b-Japanese-v0.1) 2025 Qwen 2.5 (32b) 事前学習: Common Crawl, Cosmopedia, 独自
(計 100B トークン)
  • Chat Vector | ABEJA | Apache 2.0 | | neoAI-JP-QwQ-32B
    (32B) | 2025 | Qwen 2.5 (32b) | 継続事前学習: llm-jp-corpus v3から約4Bトークン
  • QwQ-32BのChat Vector | neoAI | Apache 2.0 | | neoAI-JP-DeepSeek-Qwen-32B
    (32B) | 2025 | Qwen 2.5 (32b) | 継続事前学習: llm-jp-corpus v3から約4Bトークン
  • DeepSeek-R1-Distill-Qwen-32BのChat Vector | neoAI | Apache 2.0 | | Qwen3 Swallow 30B-A3B
    (30B-A3B-CPT-v0.2, 30B-A3B-SFT-v0.2, 30B-A3B-RL-v0.2, 30B-A3B-RL-v0.2-AWQ-INT4) | 2026 | Qwen3 (30b-A3B) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
    (計 209.7B トークン)
    SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
    RL: allenai/Dolci-Think-RL-7B (Math subset) | Swallowプロジェクト | Apache 2.0 | | Gemma-2-Llama Swallow 27B
    (27b-pt-v0.1, 27b-it-v0.1) | 2025 | Gemma 2 (27b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
    Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1 | Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use | | GPT-OSS Swallow 20B
    (20B-SFT-v0.1, 20B-RL-v0.1, 20B-RL-v0.1-MXFP4) | 2026 | GPT-OSS (20b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
    (計 419.4B トークン)
    SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
    RL: allenai/Dolci-Think-RL-7B (Math subset) | Swallowプロジェクト | Apache 2.0 | | ABEJA-Qwen3-14B-Agentic-256k-v0.1
    (v0.1) | 2026 | Qwen3 (14b) | 継続事前学習: 長文合成データ(YaRN によりコンテキスト長を128k→256kに拡張)
  • Agentic 能力強化のための強化学習 | ABEJA | Apache 2.0 | | Nekomata 14B
    (14b, 14b-instruction, 14b-gguf, 14b-instruction-gguf) | 2023 | Qwen (14b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
    (計 66B トークン)
    Instruction Tuning: Dolly Dataset, FLAN, llm-japanese-datasetの一部 | rinna | Tongyi Qianwen LICENSE | | Swallow 13B
    (13b-hf, 13b-instruct-hf, 13b-instruct-v0.1, 13b-NVE-hf) | 2023 | Llama 2 (13b) | 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile
    Instruction Tuning: Dolly Dataset, HH RLHF, OASST1
    *v0.1モデルでは OASST1, OASST2 を使用 | Swallowプロジェクト | Llama 2 Community License | | LEIA-Swallow-13B
    (13b) | 2024 | Llama 2 (13b) | Swallow 13B に対して LEIA で追加学習 | 個人 (山田育矢, 李凌寒) | Llama 2 Community License | | ELYZA-japanese-Llama-2-13b
    (13b, 13b-instruct, 13b-fast, 13b-fast-instruct) | 2023 | Llama 2 (13b) | 事前学翕: 日本語 Wikipedia, Japanese OSCAR, その他クロールデータなど
    (計 18B トークン)
    Instruction Tuning: 独自のデータセット | ELYZA | Llama 2 Community License | | cyberagent/Mistral-Nemo-Japanese-Instruct-2408 | 2024 | Mistral NeMo (12b) | 不明 | サイバーエージェント | Apache 2.0 | | NVIDIA-Nemotron-Nano-9B-v2-Japanese
    (9B) | 2026 | Nemotron-Nano (9b) | 継続事前学習: Wikipedia, fineweb-2 Japanese, aozorabunko, sip3-ja-general-web-corpus, Nemotron-CC-v2.1, Nemotron-Pretraining-Specialized-v1
    SFT: Nemotron-Personas-Japan をシードセットとした Tool Calling データセット, Nemotron-Post-Training-v3 | NVIDIA | NVIDIA Nemotron Open Model License Agreement | | Gemma-2-Llama Swallow 9B
    (9b-pt-v0.1, 9b-it-v0.1) | 2025 | Gemma 2 (9b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
    Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1 | Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use | | Qwen3 Swallow 8B
    (8B-CPT-v0.2, 8B-SFT-v0.2, 8B-RL-v0.2, 8B-RL-v0.2-AWQ-INT4) | 2026 | Qwen3 (8b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
    (計 209.7B トークン)
    SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
    RL: allenai/Dolci-Think-RL-7B (Math subset) | Swallowプロジェクト | Apache 2.0 | | Llama 3.1 Swallow 8B
    (8B-v0.1, 8B-Instruct-v0.1, 8B-v0.2, 8B-Instruct-v0.2, 8B-Instruct-v0.3, 8B-Instruct-v0.5) | 2025 | Llama 3.1 (8b) | 事前学習: The Stack v2, Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus
    Instruction Tuning: lmsys-chat-1m-synth-ja-wo-pii-and-template-instructions, lmsys-chat-1m-synth-en-wo-pii-and-template-instructions, filtered-magpie-ultra-ja, filtered-magpie-ultra-en, gemma-magpie, Gemma-3-LMSYS-Chat-1M-Synth | Swallowプロジェクト | Llama 3.1 Community License
    (Instructモデルは Gemma Terms of Use も適用) | | Llama 3 Swallow 8B
    (8B-v0.1, 8B-Instruct-v0.1) | 2023 | Llama 3 (8b) | 事前学習: Algebraic Stack, Wikipedia, RefinedWeb, Swallow Corpus, Cosmopedia, Laboro ParaCorpus, OpenWebMath
    Instruction Tuning: OASST1 [^17] | Swallowプロジェクト | Llama 3 Community License | | turing-motors/Llama-3-heron-brain-8B-v0.3 | 2024 | Llama 3 (8b) | Llama 3 Swallow 8B に対して追加学習(詳細不明) | Turing | Llama 3 Community License | | Llama 3 Youko 8B
    (8b, 8b-instruct, 8b-gptq, 8b-instruct-gptq) | 2024 | Llama 3 (8b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
    (計 22B トークン)
    Instruction Tuning[^11]: Aya Dataset (Japanese subset), FLAN, Dolly Dataset, HH RLHF, OASST1, OASST2, MetaMathQA, CodeAlpaca Dataset, 独自のデータセット
    DPO: HelpSteer, HelpSteer2, 独自のデータセット | rinna | Llama 3 Community License | | Llama 3 ELYZA JP 8B
    (8B, 8B-GGUF, 8B-AWQ) | 2024 | Llama 3 (8b) | 不明 | ELYZA | Llama 3 Community License | | Llama 3 neoAI 8B Chat v0.1
    (8B-Chat-v0.1) | 2024 | Llama 3 (8b) | 不明 | neoAI | Llama 3 Community License | | Llama 3 tedllm
    (v0) | 2024 | Llama 3 (8b) | 事前学習: 日本語の一般コーパス | 東京エレクトロン デバイス | Llama 3 Community License | | ELYZA-Shortcut-1.0-Qwen-7B
    (7B) | 2025 | Qwen 2.5 (7b) | 事前学習 + SFT | ELYZA | Apache 2.0 | | ELYZA-Diffusion-1.0-Dream-7B
    (Base-7B, Instruct-7B) | 2026 | Dream (7b) | 事前学習: 日本語テキスト (約 62B トークン)
    Instruction Tuning: 日本語の指示データ (約 0.18B トークン) | ELYZA | Apache 2.0 | | Swallow 7B
    (7b-hf, 7b-instruct-hf, 7b-instruct-v0.1, 7b-NVE-hf, 7b-NVE-instruct-hf, 7b-plus-hf) | 2023 | Llama 2 (7b) | 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile
    Instruction Tuning: Dolly Dataset, HH RLHF, OASST1
    *v0.1モデルでは OASST1, OASST2 を使用 | Swallowプロジェクト | Llama 2 Community License | | LEIA-Swallow-7B
    (7b) | 2024 | Llama 2 (7b) | Swallow 7B に対して LEIA で追加学習 | 個人 (山田育矢, 李凌寒) | Llama 2 Community License | | ELYZA-japanese-Llama-2-7b
    (7b, 7b-instruct, 7b-fast, 7b-fast-instruct) | 2023 | Llama 2 (7b) | 事前学習: 日本語 Wikipedia, Japanese OSCAR, その他クロールデータなど
    (計 18B トークン)
    Instruction Tuning: 独自のデータセット | ELYZA | Llama 2 Community License | | Youri 7B
    (7b, 7b-instruction, 7b-chat, 7b-gptq, 7b-instruction-gptq, 7b-chat-gptq) | 2023 | Llama 2 (7b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
    (計 40B トークン)
    Instruction Tuning: Dolly Dataset, FLAN, llm-japanese-datasetの一部 | rinna | Llama 2 Community License | | houou-7b
    (instruction-7b-v1, instruction-7b-v2, instruction-7b-v3) | 2023 | Llama 2 (7b) | Youri 7B (base) に対して Instruction Tuning: ichikara-instruction | マネーフォワード | Llama 2 Community License | | Japanese Stable LM Beta 7B
    (base-beta-7b, base-ja_vocab-beta-7b, instruct-beta-7b, instruct-ja_vocab-beta-7b) | 2023 | Llama 2 (7b) | 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外)
    (計 100B トークン)
    Instruction Tuning: Dolly Dataset, HH RLHF, OASST1 | Stability AI | Llama 2 Community License | | SambaLingo-Japanese
    (Base, Chat) | 2024 | Llama 2 (7b) | 事前学習: CulturaX
    Instruction Tuning: ultrachat_200k
    DPO: ultrafeedback, cai-conversation-harmless | SambaNova Systems | Llama 2 Community License (?)[^12] | | blue-lizard
    (blue-lizard) | 2024 | Llama 2 (7b) | 不明 | Deepreneur | Llama 2 Community License | | Swallow-MS 7B
    (7b-v0.1, 7b-instruct-v0.1) | 2024 | Mistral-7B-v0.1 (7b) | 事前学習: Algebraic Stack, Japanese Wikipedia, RefinedWeb, Swallow Corpus, The Pile
    Instruction Tuning: Dolly Dataset, OASST1 | Swallowプロジェクト | Apache 2.0 | | Rakuten AI 2.0
    (8x7B, 8x7B-instruct) | 2025 | Mistral-7B-v0.1 (7b) | | 楽天 | Apache 2.0 | | RakutenAI-7B
    (7B, 7B-instruct, 7B-chat) | 2024 | Mistral-7B-v0.1 (7b) | 事前学習: 不明
    Instruction Tuning: Dolly Dataset, OASST1, (jasterと同様に)言語理解データセットの訓練データを Instruction Tuning 用に変換したもの, 独自のデータセット | 楽天 | Apache 2.0 | | Japanese Stable LM Gamma 7B
    (base-gamma-7b, instruct-gamma-7b) | 2023 | Mistral-7B-v0.1 (7b) | 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外)
    (計 100B トークン)
    Instruction Tuning: Dolly Dataset, HH RLHF, llm-japanese-dataSetのwikinews subset | Stability AI | Apache 2.0 | | ChatNTQ JA 7B
    (7b-v1.0) | 2024 | Mistral-7B-v0.1 (7b) | Japanese Stable LM Gamma 7B (base) に対して独自のデータセットで Instruction Tuning | NTQ Solution | Apache 2.0 | | Shisa Gamma 7B
    (7b-v1) | 2023 | Mistral-7B-v0.1 (7b) | Japanese Stable LM Gamma 7B (base) に対して ultra-orca-boros-en-ja で Instruction Tuning | AUGMXNT | Apache 2.0 (?)[^12] | | Shisa 7B
    (base-7b-v1, 7b-v1) | 2023 | Mistral-7B-v0.1 (7b) | 事前学習: shisa-pretrain-en-ja-v1 (8B トークン)
    Instruction Tuning & DPO: ultra-orca-boros-en-ja, shisa-en-ja-dpo-v1 | AUGMXNT | Apache 2.0 (?)[^12] | | Karasu
    (7B, 7B-chat, 7B-chat-plus, 7B-chat-plus-unleashed) | 2024 | Mistral-7B-v0.1 (7b) | Shisa 7B (base) に対して以下のデータセットで追加事前学習: 青空文庫, 日本の法律・判例, 日本語 Wikipedia, CulturaX の日本ドメインのデータ, UltraChat 200k (計 7B トークン)
    Instruction Tuning: ultra-orca-boros-en-ja-v1, OASST1, ShareGPT, 独自のデータセット | Lightblue | Apache 2.0 (?)[^12] | | Nekomata 7B
    (7b, 7b-instruction, 7b-gguf, 7b-instruction-gguf) | 2023 | Qwen (7b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
    (計 66B トークン)
    Instruction Tuning: Dolly Dataset, FLAN, llm-japanese-datasetの一部 | rinna | Tongyi Qianwen LICENSE | | lightblue/japanese-mpt-7b | 2023 | MPT (7b) | Japanese mC4 | Lightblue | Apache 2.0 | | Japanese Stable LM 3B-4E1T
    (3b-4e1t-base, 3b-4e1t-instruct) | 2024 | StableLM-3B-4E1T (3b) | 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外)
    (計 100B トークン)
    Instruction Tuning: Dolly Dataset, HH RLHF, llm-japanese-datasetのwikinews subset | Stability AI | Apache 2.0 | | kotomamba-2.8B-CL | 2024 | mamba-2.8b-slimpj
    (2.8b) | 日本語 Wikipedia, Swallow Corpus, SlimPajama | Kotoba Technologies | Apache 2.0 | | Gemma-2-Llama Swallow 2B
    (2b-pt-v0.1, 2b-it-v0.1) | 2025 | Gemma 2 (2b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
    Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1 | Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use | | Gemma 2 Baku 2B
    (2b, 2b-it) | 2024 | Gemma 2 (2b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
    (計 80B トークン)
    OPRO: 独自のデータセット [^20] | rinna | Gemma Terms of Use | | Japanese Stable LM 2 1.6B
    (base, instruct) | 2024 | Stable LM 2 1.6B (1.6b) | 事前学習: Wikipedia, CulturaX
    Instruction Tuning: jaster, ichikara-instruction, alpaca-gpt4-japanese, ultra-orca-boros-en-ja-v1 | Stability AI | STABILITY AI NON-COMMERCIAL RESEARCH COMMUNITY LICENSE | | TinySwallow-1.5B
    (1.5B, 1.5B-Instruct, 1.5B-Instruct-q4f32_1-MLC, 1.5B-Insturct-GGUF) | 2025 | Qwen2.5 (1.5b) | 事前学習: Qwen2.5 (32b) を教師として TAID で学習
    Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, swallow-magpie-ultra-v0.1, swallow-gemma-magpie-v0.1 | Sakana AI, Swallowプロジェクト | Apache 2.0 | | EQUES/OpenRS3-GRPO-ja | 2025 | Qwen2.5 (1.5b) | TinySwallow-1.5B-Instruct に対して kunishou/OpenMathInstruct-1-1.8m-ja でGRPO学習 | EQUES Inc. | ? | | EQUES/TinyDeepSeek-JP-1.5B | 2025 | Qwen2.5 (1.5b) | TinySwallow-1.5B-Instruct に対して EQUES/japanese_ultrachat_6.6k でTAID蒸留 | EQUES Inc. | Apache 2.0 | | EQUES/TinySwallow-Stratos-1.5B | 2025 | Qwen2.5 (1.5b) | TinySwallow-1.5B-Instruct に対して Bespoke-Stratos-35k で推論能力強化 | EQUES Inc. | Apache 2.0 | | karasu-1.1B | 2023 | TinyLlama (1.1b) | 事前学習: Japanese OSCAR, Japanese mC4
    (計 3B トークン) | Lightblue | Apache 2.0 |

ドメイン特化型

公開年 ドメイン ベースのLLM 学習テキスト 開発元 ライセンス
Weblab-MedLLM-GLM-4.7 2026 医療 GLM-4.7 (355b-A32B) 医学論文・医学書籍・診療ガイドライン・試験問題などを由来とする独自の合成データで継続事前学習、その後事後学習 東大 松尾・岩澤研 MIT[^28]
Weblab-MedLLM-Qwen3-235B
(Instruct, Thinking) 2026 医療 Qwen3 (235b-A22B) 医学論文・医学書籍・診療ガイドライン・試験問題などを由来とする独自の合成データで継続事前学習、その後事後学習 東大 松尾・岩澤研 Apache 2.0[^28]
Weblab-MedLLM-gpt-oss-120b 2026 医療 GPT-OSS (120b) 医学論文・医学書籍・診療ガイドライン・試験問題などを由来とする独自の合成データで継続事前学習、その後事後学習 東大 松尾・岩澤研 Apache 2.0[^28]
Medical-GPT-OSS-Swallow-120B 2026 医療 GPT-OSS (120b) 生物医学文献・医療合成データ・医療QA・診療ガイドライン等の医療ドメインテキストを中心とした混合データで GPT-OSS Swallow 120B (RL) に継続事前学習 Swallowプロジェクト Apache 2.0[^25]
pfnet/Preferred-MedLLM-Qwen-72B 2025 医療 Qwen2.5 (72b) 独自の医療関連テキストコーパスで継続事前学習 Preferred Networks Qwen LICENSE
Llama3-Preferred-MedSwallow-70B
(70B) 2024 医療 Llama 3 (70b) 医師国家試験(2017年以前)の解説等からなる PFN 独自の医療データセットで学習 Preferred Networks Llama 3 Community License
AIgroup-CVM-utokyohospital/MedSwallow-70b 2024 医療 Llama 2 (70b) 日本語に翻訳した USMLE データセットで Instruction Tuning 東京大学医学部附属病院 循環器内科 AIグループ CC BY-NC-SA 4.0
Medical-Qwen3-Swallow-32B 2026 医療 Qwen3 (32b) 生物医学文献・医療合成データ・医療QA・診療ガイドライン等の医療ドメインテキストを中心とした混合データで Qwen3 Swallow 32B (RL) に継続事前学習 Swallowプロジェクト Apache 2.0[^25]
Medical-Qwen3-Swallow-30B-A3B 2026 医療 Qwen3 (30b-A3B) 生物医学文献・医療合成データ・医療QA・診療ガイドライン等の医療ドメインテキストを中心とした混合データで Qwen3 Swallow 30B-A3B (RL) に継続事前学習 Swallowプロジェクト Apache 2.0[^25]
gpt-oss-20b-Ja-Fin
(CPT, Thinking) 2026 金融 GPT-OSS (20b) Common Crawl 等の公開ソースから構築した日本語金融コーパス(ドメイン分類・品質フィルタリングを実施)で継続事前学習 野村総合研究所 Apache 2.0
nekomata-14b-pfn-qfin
(qfin, qfin-inst-merge) 2024 金融 Qwen (14b) 中央銀行の会見・政策決定会合要旨、金融機関のレポート・用語集・企業情報、Wikipedia の金融記事等からなる金融特化コーパス(約810万文書・約3.7億トークン)で継続事前学習(qfin-inst-merge は instruct モデルとのマージ) Preferred Networks Tongyi Qianwen LICENSE
Qwen3-14B-Ja-Fin
(CPT, Thinking) 2026 金融 Qwen3 (14b) Common Crawl 等の公開ソースから構築した日本語金融コーパス(ドメイン分類・品質フィルタリングを実施)で継続事前学習 野村総合研究所 Apache 2.0
Watashiha-Llama-2-13B-Ogiri-sft
(sft, sft-neuron) 2024 大喜利 Llama 2 (13b) 事前学習: C4・CC-100・OSCAR の日本語データ、日英 Wikipedia、独自データ(計 650億トークン)
SFT: 大喜利データ わたしは Llama 2 Community License
Medical-Qwen3-Swallow-8B 2026 医療 Qwen3 (8b) 生物医学文献・医療合成データ・医療QA・診療ガイドライン等の医療ドメインテキストを中心とした混合データで Qwen3 Swallow 8B (RL) に継続事前学習 Swallowプロジェクト Apache 2.0[^25]
MedExamDoc-Llama-3.1-Swallow-8B-Instruct-v0.5 2025 医療 Llama 3.1 (8b) JMedBench, KokushiMD-10 を用いて QLoRA でファインチューニング Ingenta Llama 3.1 Community License
からまる
(Karamaru-v1) 2025 江戸時代の古文 Llama 3 (8b) 江戸時代のテキスト約2,500万文字(人間による翻刻 約1,300万字: みんなで翻刻・国文学研究資料館、AI翻刻 約1,200万字: くずし字OCR「RURI」)で継続事前学習 Sakana AI Llama 3 Community License
Llama 3.1 Future Code Ja 8B 2025 コーディング Llama 3.1
(8b) The Stack v2(コード), LLM-jp Corpus v3(日本語の一部)で継続事前学習(コード 204.9B・自然言語 85.7B トークン) フューチャー Llama 3.1 Community License
JPharmatron
(7B-base, 7B) 2025 薬学 Qwen2.5 (7b) 日本語の薬学テキスト(20億トークン)と英語の生物医学テキスト(80億トークン)で継続事前学習 EQUES Inc. CC BY-SA 4.0
ELYZA-japanese-CodeLlama-7b
(7b, 7b-instruct) 2023 コーディング Code Llama
(7b) 事前学習: OSCAR・Wikipedia・独自クロールデータ等の日本語テキスト(180億トークン)
instruct: ELYZA 独自の事後学習(詳細非公開) ELYZA Llama 2 Community License
AIBunCho/japanese-novel-gpt-j-6b 2023 物語生成 GPT-J (6b) 日本語の小説データで追加学習(ベースの日本語 GPT-J は cc100 日本語・Wikipedia・Web データで学習) 個人 (大曽根宏幸) CreativeML OpenRAIL-M License
NovelAI/genji-jp 2022 物語生成 GPT-J (6b) 独自の日本語ストーリーテリングデータセットでファインチューニング NovelAI ?

海外モデルに日本語で事後学習を行ったモデル(継続事前学習なし、または詳細不明)

汎用

公開年 ベースのLLM 学習テキスト 開発元 ライセンス / 利用規約
Rakuten AI 3.0
(RakutenAI-3.0) 2026 DeepSeek-V3 (671b) [^24] 不明 楽天 Apache 2.0
Llama 3.1 Shisa V2 405B
(405b) 2025 Llama 3.1 (405b) 高品質な日本語データセットでSFT/DPO Shisa.AI Llama 3.1 Community License
AXCXEPT/EZO-Qwen2.5-72B-Instruct
AXCXEPT/EZO-AutoCoTRAG-Qwen2.5-72B-Instruct_q4 2024 Qwen2.5 (72b) Axcxept Qwen License
ao-Karasu
(72B) 2024 Qwen1.5 (72b) ultra-orca-boros-en-ja-v1, OASST1, ShareGPT, 日本語の公開技術ブログ, ニュース記事, QAサイトの回答, 独自のデータセット Lightblue Tongyi Qianwen LICENSE (?)[^12]
Shisa V2.1 70B
(70b) 2025 Llama 3.3 (70b) SFT/DPO/強化学習/モデルマージを組み合わせた学習 Shisa.AI Llama 3.3 Community License
shisa-ai/shisa-v2-llama3.3-70b 2025 Llama 3.3 (70b) Shisa.AI Llama 3.3 Community License
AXCXEPT/Llama-3.1-70B-EZO-1.1-it 2024 Llama 3.1 (70b) Axcxept Llama 3.1 Community License
Llama 3 shisa-v1-llama3-70b
(70b) 2024 Llama 3 (70b) ultra-orca-boros-en-ja-v1 Shisa.AI Llama 3 Community License (?)[^12]
AIgroup-CVM-utokyohospital/Llama-2-70b-chat-4bit-japanese 2023 Llama 2 (70b) 東京大学医学部附属病院 循環器内科 AIグループ Llama 2 Community License
doshisha-mil/llama-2-70b-chat-4bit-japanese-v1 2023 Llama 2 (70b) 同志社大学 メディア情報学研究室 ?
cyberagent/DeepSeek-R1-Distill-Qwen-32B-Japanese 2025 DeepSeek-R1-Distill-Qwen (32b) サイバーエージェント MIT
Flux-Japanese-Qwen2.5-32B-Instruct-V1.0
(V1.0) 2025 Qwen2.5-32B-Instruct (32b) Precise-tuning: 日本語の知識・推論・言語回路をピンポイント特定し、パラメータの5%のみに対して調整を実施。3つの専門モデルを作成後、ピンポイントマージで統合 FLUX Apache 2.0
karakuri-ai/karakuri-lm-32b-thinking-2501-exp 2025 QwQ (32b) カラクリ Apache 2.0
shisa-ai/shisa-v2-qwen2.5-32b 2025 Qwen2.5 (32b) Shisa.AI Apache 2.0
AXCXEPT/EZO-Qwen2.5-32B-Instruct
AXCXEPT/EZO-AutoCoTRAG-Qwen2.5-32B-Instruct 2024 Qwen2.5 (32b) Axcxept Apache 2.0
cyberagent/DeepSeek-R1-Distill-Qwen-14B-Japanese 2025 DeepSeek-R1-Distill-Qwen (14b) サイバーエージェント MIT
Shisa V2.1 14B
(14b) 2025 Phi-4 (14b) SFT/DPO/強化学習/モデルマージを組み合わせた学習 Shisa.AI MIT
shisa-ai/shisa-v2-unphi4-14b 2025 Phi-4 (14b) Shisa.AI MIT
EZO-Phi-4
(phi-4-open-R1-Distill-EZOv1, phi-4-deepseek-R1K-RL-EZO) 2025 Phi-4 (14b) Axcxept MIT
Qarasu
(14B-chat-plus-unleashed) 2024 Qwen (14b) ultra-orca-boros-en-ja-v1, OASST1, ShareGPT, 独自のデータセット Lightblue Tongyi Qianwen LICENSE (?)[^12]
Sparticle/llama-2-13b-chat-japanese-lora 2023 Llama 2 (13b) Sparticle ?
izumi-lab/llama-13b-japanese-lora-v0-1ep 2023 Llama (13b) 東大 和泉研 ?
shisa-ai/shisa-v2-mistral-nemo-12b 2025 Mistral NeMo (12b) Shisa.AI Apache 2.0
AXCXEPT/EZO-Common-9B-gemma-2-it 2024 Gemma 2 (9b) Axcxept Gemma Terms of Use
AXCXEPT/EZO-Humanities-9B-gemma-2-it 2024 Gemma 2 (9b) Axcxept Gemma Terms of Use
CAT-Thinking
(8B) 2026 Qwen3 (8b) SFT (gpt-oss-120bで生成しCAT-Translate-7bで日本語化した数学・コーディングデータ) / GRPO サイバーエージェント Apache 2.0
Shisa V2.1 8B
(8b) 2025 Qwen3 (8b) SFT/DPO/強化学習/モデルマージを組み合わせた学習 Shisa.AI Apache 2.0
AXCXEPT/Qwen3-EZO-8B-beta 2025 Qwen3 (8b) Deep-Think技術による高性能推論 Axcxept Apache 2.0
shisa-ai/shisa-v2-llama3.1-8b 2025 Llama 3.1 (8b) Shisa.AI Llama 3.1 Community License
AXCXEPT/Llama-3.1-8B-EZO-1.1-it 2024 Llama 3.1 (8b) Axcxept Llama 3.1 Community License
Llama 3 Suzume 8B
(8B-japanese, 8B-japanese-gguf) 2024 Llama 3 (8b) megagonlabs/instruction_ja, ShareGPT, 独自のデータセット Lightblue Llama 3 Community License (?)[^12]
Llama 3 shisa-v1-llama3-8b
(8b) 2024 Llama 3 (8b) ultra-orca-boros-en-ja-v1 Shisa.AI Llama 3 Community License (?)[^12]
AXCXEPT/Llama-3-EZO-8b-Common-it 2024 Llama 3 (8b) Axcxept Llama 3 Community License
lightblue/DeepSeek-R1-Distill-Qwen-7B-Japanese 2025 DeepSeek-R1-Distill-Qwen (7b) Lightblue Apache 2.0
ABEJA-Qwen2.5-7b-Japanese-v0.1
(v0.1) 2025 Qwen 2.5 (7b) ABEJA Apache 2.0
shisa-ai/shisa-v2-qwen2.5-7b 2025 Qwen 2.5 (7b) Shisa.AI Apache 2.0
Karasu DPO
(7B) 2025 Qwen 2.5 (7b) Lightblue Apache 2.0
ganchengguang/Yoko-7B-Japanese-v1 2023 Llama 2 (7b) 横浜国大 森研 ?
Sparticle/llama-2-7b-chat-japanese-lora 2023 Llama 2 (7b) Sparticle ?
izumi-lab/llama-7b-japanese-lora-v0-5ep 2023 Llama (7b) 東大 和泉研 ?
lightblue/jod 2023 Mistral-7B-SlimOrca (7b) Lightblue Apache 2.0
NTQAI/chatntq-7b-jpntuned 2023 RWKV-4 World (7b) NTQ Solution ?
Qwen3.5-FT-Japanese-CoT-4B 2026 Qwen3.5 (4b) 不明 個人 (Aname-Tommy) MIT
Borea
(Jp, Common, Coding) 2024 Phi-3.5 (3.8b) Axcxept MIT
Shisa V2.1 3B
(3b) 2025 Llama 3.2 (3b) SFT/DPO/強化学習/モデルマージを組み合わせた学習 Shisa.AI Llama 3.2 Community License
AXCXEPT/EZO-Llama-3.2-3B-Instruct-dpoE 2024 Llama 3.2 (3b) Axcxept Llama 3.2 Community License
日本語版 Gemma 2 2B
(2b-jpn-it) 2024 Gemma 2 (2b) Google Gemma Terms of Use
AXCXEPT/EZO-gemma-2-2b-jpn-it 2024 Gemma 2 (2b) Axcxept Gemma Terms of Use
AXCXEPT/EZO-Common-T2-2B-gemma-2-it 2024 Gemma 2 (2b) Axcxept Gemma Terms of Use
Shisa V2.1 1.2B
(1.2b) 2025 LFM2 (1.2b) SFT/DPO/強化学習/モデルマージを組み合わせた学習 Shisa.AI LFM Open License v1.0
LFM2.5-1.2B-JP
(1.2B-JP, 1.2B-JP-202606) 2026 LFM2.5 (1.2b) 不明 Liquid AI LFM Open License v1.0
Qwen3.5-FT-Japanese-CoT-0.8B 2026 Qwen3.5 (0.8b) 不明 個人 (Aname-Tommy) MIT

ドメイン特化型

公開年 ドメイン ベースのLLM 開発元 ライセンス
JMedLoRA
(llama2-jmedlora-30000) 2023 医療 Llama 2 (70b) 東京大学医学部附属病院 循環器内科 AIグループ CC BY-NC 4.0
pfnet/Qwen3-1.7B-pfn-qfin 2025 金融 Qwen3 (1.72b) Preferred Networks PLaMo Community License
pfnet/Qwen2.5-1.5B-pfn-qfin 2025 金融 Qwen2.5 (1.54b) Preferred Networks PLaMo Community License

複数のLLMをマージして作成されたモデル

公開年 マージ元のLLM(太字は日本語LLM) 開発元 ライセンス
EQUES/MedLLama3-JP-v2 2024 Llama 3 Swallow 8B (Instruct), OpenBioLLM-8B, MMed-Llama 3 8B, Llama 3 ELYZA JP 8B EQUES Llama 3 Community License
EvoLLM-JP-A
(v1-7B) 2024 Shisa Gamma 7B (v1), Arithmo2 Mistral 7B, Abel 7B 002 Sakana AI Apache 2.0
EvoLLM-JP
(v1-7B, v1-10B) 2024 Shisa Gamma 7B (v1), WizardMath-7B-V1.1, Abel 7B 002 Sakana AI MICROSOFT RESEARCH LICENSE
EQUES/TinyQwens-Merge-1.5B 2025 SakanaAI/TinySwallow-1.5B-Instruct, EQUES/TinySwallow-Stratos-1.5B, deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B, Qwen/Qwen2.5-1.5B-Instruct EQUES Inc. Apache 2.0

APIとして提供されているモデル

| | 公開年 | 入出力で扱える
トークン数 | 開発元 | プラットフォーム | |:---|:---:|:---:|:---:|:---:| | Sakana Namazu
(sakana-namazu) | 2026 | 262,144 | Sakana AI | 独自 | | Syn
(Syn, Syn Pro) | 2025 | 32,768 | カラクリ, Upstage | AWS Marketplace (SageMaker) | | tsuzumi
(tsuzumi-7b, tsuzumi 2) | 2025 | | NTT | Microsoft Foundry | | PLaMo API | 2024 | 32,768 | Preferred Networks | 独自 | | LHTM-OPT | 2024 | | オルツ | AWS Marketplace (SageMaker) | | AIのべりすと | 2021 | 2,400 ~ 8,192 | Bit192 | 独自 |

入力テキストの処理に主に使うモデル

汎用

公開年 アーキテクチャ 入力で扱えるトークン数 学習テキスト 開発元 ライセンス HuggingFace ですぐ使える? [^4]
ModernBERT-Ja 2025 ModernBERT 8,192 日本語・英語データ SB Intuitions MIT ◯ (30m, 70m, 130m, 310m)
llm-jp-modernbert 2025 ModernBERT 8,192 llm-jp-corpus-v4 の日本語サブセット(約0.69Tトークン) 大規模言語モデル研究開発センター Apache 2.0 ◯
京大BERT 2020 BERT (base, large) 512 日本語 Wikipedia (約1,800万文) 京大 言語メディア研究室 Apache 2.0 △
東北大BERT 2023 BERT (base, large) 512 base (v1):
日本語 Wikipedia 約1,700万文 (2.6GB)
base (v2) & large:
日本語 Wikipedia 約3,000万文 (4.0GB)
base (v3) & large (v2):
日本語 Wikipedia 約3,400万文 (4.9GB)
  • 日本語 CC-100 約3億9,200万文 (74.3GB) | 東北大
    自然言語処理研究グループ | base (v1, v2) & large: CC BY-SA 3.0
    base (v3) & large (v2): Apache 2.0 |◯ (base (v1), base (v1, 文字レベル), base (v2), base (v2, 文字レベル), large, large (文字レベル), base (v3), base (v3, 文字レベル), large (v2), large (v2, 文字レベル)) | | TohokuNLP BERT-alpha 500M | 2024 | Llama ベースのエンコーダ[^23] | 4,096
    または
    8,192 | llm-jp-corpus-v3 の日本語サブセット | 東北大
    自然言語処理研究グループ | Apache 2.0 | ◯ (sq4096-alpha, sq8192-alpha) | | ByBERT-JP | 2025 | Llama ベースのエンコーダ[^23] | 100m, 200m, 400m: 3,072
    v2-100m: 4,096 | llm-jp-corpus-v3 のサブセット
    100m: 623B トークン
    200m: 637B トークン
    400m: 1.23T トークン
    v2-100m: 2.76T トークン | 東北大
    自然言語処理研究グループ | Apache 2.0 | ◯ (100m, 200m, 400m, v2-100m) | | NICT BERT | 2020 | BERT (base) | 512 | 日本語 Wikipedia | NICT | CC BY 4.0 | △ | | Laboro BERT | 2020 | BERT (base, large) | 512 | 日本語 Web コーパス
    (ニュースサイトやブログなど
    計4,307のWebサイト、2,605,280ページ (12GB)) | Laboro.AI | CC BY-NC 4.0 | ✕ | | colorfulscoop BERT | 2021 | BERT (base) | 512 | 日本語 Wikipedia | Colorful Scoop | CC BY-SA 3.0 | ◯ | | 東大BERT | 2021 | BERT (small) | 512 | 日本語 Wikipedia (約2,000万文 (2.9GB)) | 東大 和泉研 | CC BY-SA 4.0 | ◯ | | chiTra (Sudachi Transformers) | 2022 | BERT (base) | 512 | 国語研日本語ウェブコーパス (NWJC) (148GB) | NINJAL, ワークス徳島人工知能NLP研 | Apache 2.0 | △ | | ACCMS BERT | 2023 | BERT (base) | 512 | 日本語 Wikipedia (3.3GB) | 京大 ACCMS | CC BY-SA 4.0 | ◯ | | 日立BERT | 2023 | BERT (base) | 512 | 日本語 Wikipedia
  • Japanese CC-100 | 日立製作所 | CC BY-NC-SA 4.0 | ◯ [^6] | | RetrievaBERT | 2024 | BERT [^5] | 2,048 | Japanese CommonCrawl, RefinedWeb, Chinese Wikipedia, Korean Wikipedia, The Stack | レトリバ | Apache 2.0 | ◯ | | Bandai Namco DistilBERT | 2020 | DistilBERT | 512 | - (東北大BERT(base) を親モデルとして知識蒸留) | Bandai Namco Research | MIT | ◯ | | Laboro DistilBERT | 2020 | DistilBERT | 512 | - (Laboro BERT(base) を親モデルとして知識蒸留)| Laboro.AI | CC BY-NC 4.0 | ◯ | | LINE DistilBERT | 2023 | DistilBERT | 512 | - (LINE社内のBERTを親モデルとして知識蒸留)| LINE | Apache 2.0 | ◯ | | rinna RoBERTa | 2021 | RoBERTa (base) | 512 | 日本語 Wikipedia
  • Japanese CC-100 | rinna | MIT | ◯ | | 早大RoBERTa | 2022 | RoBERTa (base, large) | 512 | 日本語 Wikipedia
  • Japanese CC-100 | 早大 河原研 | CC BY-SA 4.0 | ◯ (base, large, large (seq512)) [^7] | | インフォマティクスRoBERTa | 2022 | RoBERTa (base) | 512 | 日本語 Wikipedia
  • Web 上の記事 (計25GB) | インフォマティクス | Apache 2.0 | △ | | 京大RoBERTa | 2022 | RoBERTa (base, large) | 512 | 日本語 Wikipedia
  • Japanese CC-100 | 京大 言語メディア研究室 | CC BY-SA 4.0 | ◯ (base (文字レベル), large (文字レベル)) | | 横浜国大RoBERTa | 2022 | RoBERTa (base) | 512 | 日本語 Wikipedia (3.45GB) | 横浜国大 森研 | Apache 2.0 | ◯ | | Megagon Labs RoBERTa | 2022 | RoBERTa (base) [^8] | 1,282 | Japanese mC4 (約2億文) | Megagon Labs
    (リクルート) | MIT | ◯ | | ACCMS RoBERTa | 2023 | RoBERTa (base) | 512 | 日本語 Wikipedia (3.3GB) + Japanese CC-100 (70GB) | 京大 ACCMS | CC BY-SA 4.0 | ◯ | | シナモンELECTRA | 2020 | ELECTRA (small) | 512 | 日本語 Wikipedia | シナモン | Apache 2.0 | ◯ | | Megagon Labs ELECTRA | 2021 | ELECTRA (base) | 512 | Japanese mC4 (約2億文) | Megagon Labs
    (リクルート) | MIT | ◯ | | 東大ELECTRA | 2021 | ELECTRA (small, base) | 512 | 日本語 Wikipedia (約2,000万文 (2.9GB)) | 東大 和泉研 | CC BY-SA 4.0 | ◯ (small, base) | | 日本語RoFormer | 2022 | RoFormer (base) | 512 | 日本語 Wikipedia (3.45GB) | 横浜国大 森研 | Apache 2.0 | ◯ | | 日本語LUKE | 2022 | LUKE (base, large) | 512 | 日本語 Wikipedia | Studio Ousia | Apache 2.0 | ◯ (base, large) | | 京大DeBERTaV2 | 2023 | DeBERTaV2 (tiny, base, large) | 512 | 日本語 Wikipedia
  • Japanese CC-100
  • Japanese OSCAR
    (計171GB) | 京大 言語メディア研究室 | CC BY-SA 4.0 | ◯ (tiny, tiny (文字レベル), base, large) | | 京大DeBERTaV3 | 2024 | DeBERTaV3 (base) | 512 | llm-jp-corpus | 京大 言語メディア研究室 | Apache 2.0 | ◯ | | 東大DeBERTaV2 | 2023 | DeBERTaV2 (small, base) | 512 | 日本語 Wikipedia, 日本語 Wikinews, Japanese CC-100, Japanese mC4, Japanese OSCAR | 東大 和泉研 | CC BY-SA 4.0 | ◯ (small, base) | | GLOBIS DeBERTaV3 | 2023 | DeBERTaV3 (xsmall, base, large) | 512 | Wikipedia, WikiBooks, 青空文庫, Japanese CC-100, Japanese mC4, Japanese OSCAR | グロービス | CC BY-SA 4.0 | ◯ (xsmall, base, large) | | 日本語BigBird | 2023 | BigBird (base) | 4,096 | 日本語 Wikipedia
  • Japanese CC-100
  • Japanese OSCAR | 早大 河原研 | CC BY-SA 4.0 | ◯ | | 日本語LayoutLM | 2024 | LayoutLM (base) | 512 | 東北大BERT (base, v2) で重みを初期化した上で、日本語 Wikipedia の文章とレイアウトで事前学習 | 日本総合研究所 | CC BY-SA 3.0 | ◯ | | layoutlmv3-japanese-preview | 2026 | LayoutLMv3 (base) | 512 | 早大RoBERTa (base) で重みを初期化した上で、NDL WARP の日本語Webページ(約2,000万件)と文書画像(PubLayNet, DocLayNet)で事前学習 | 大規模言語モデル研究開発センター | Apache 2.0 | ◯ |

ドメイン特化型

公開年 ドメイン アーキテクチャ 学習テキスト 開発元 ライセンス HuggingFace ですぐ使える?
日本語ブログELECTRA 2022 口語 ELECTRA (small) 日本語ブログコーパス(3億5,400万文) 北見工大 桝井・プタシンスキ研 CC BY-SA 4.0 ◯
日本語話し言葉BERT 2021 話し言葉 BERT (base) 東北大BERTに対して日本語話し言葉コーパス(CSJ)を用いて追加学習
(DAPTモデルでは国会議事録データも使用) レトリバ Apache 2.0 ◯
AcademicRoBERTa 2023 学術 RoBERTa (base) CiNii の日本語論文 (約628万文) 愛媛大 人工知能研究室 Apache 2.0 ◯
local-politics-BERT 2024 政治 BERT (base) Wikipedia, 国会会議録, 地方議会会議録 地方議会会議録コーパスプロジェクト CC BY-SA 4.0 ◯ (SC-min, SC-minwiki, SC-2M-wiki, SC-2M-min, SC-2M-minwiki, FP-min, FP-minwiki) [^18]
UBKE-LUKE 2024 経済 LUKE (base) 日本語 Wikipedia, 有価証券報告書, 経済ニュース記事 ユーザベース CC BY-NC ◯
日本語金融BERT 2022 金融 BERT (small, base) [^9] 日本語 Wikipedia
  • 日本語金融コーパス (約2,700万文 (5.2GB)) | 東大 和泉研 | CC BY-SA 4.0 |◯ (small, base) | | 日本語金融ELECTRA | 2021 | 金融 | ELECTRA (small) | 日本語 Wikipedia (約2,000万文 (2.9GB))
  • 日本語金融コーパス (約2,700万文 (5.2GB)) | 東大 和泉研 | CC BY-SA 4.0 | ◯ | | 日本語ニュースBERT | 2019 | ビジネス | BERT (base) | 日本語ビジネスニュース記事(300万記事) | ストックマーク | CC BY 4.0 | △ | | 日本語ニュースXLNet | 2019 | ビジネス | XLNet (base) | 日本語ビジネスニュース記事(300万記事) | ストックマーク | ? | ※ 非公式の HuggingFace 向けに変換されたモデルが公開されている | | 日本語ニュースALBERT | 2020 | ビジネス | ALBERT (base) | 日本語ビジネスニュース記事(300万記事) | ストックマーク | ? | △ | | みんぱくBERT | 2023 | 文化財 | BERT (base) | 東北大BERTに対して国立民族学博物館の文化財データで追加学習 | 兵庫県立大学 大島研 | MIT | ◯ (minpaku-v1, minpaku-v3, minpaku-v3-no-additional-token) | | JPharmaBERT | 2025 | 薬学 | BERT (base, large) | 日本語薬学文書 (2Bトークン)
  • PubMed英語要旨 (8Bトークン)
  • 薬学関連多言語データ (1.2Bトークン) | EQUES | 不明 | ◯ (base, large) | | medBERTjp | 2020 | 医療 | BERT (base) | 日本語 Wikipedia
  • 日本語医療コーパス(『今日の診療プレミアム』Web版) | 阪大病院
    医療情報学研究室 | CC BY-NC-SA 4.0 | △ | | JMedRoBERTa | 2022 | 医療 | RoBERTa (base) | 日本語医学論文 (約1,100万文 (1.8GB)) | NII 相澤研 | CC BY-NC-SA 4.0 | ◯ (万病WordPiece, SentencePiece) [^10] |

埋め込み (Embeddings) 作成に特化したモデル [^21]

Bi-Encoders

Single-representation bi-encoders

公開年 入力で扱えるトークン数 開発元 ライセンス
Ruri-v3
(v3-30m, v3-70m, v3-130m, v3-310m) 2025 8,192 名大 笹野研 Apache 2.0
PLaMo-Embedding-1B
(1b) 2025 4,096 Preferred Networks Apache 2.0
Sarashina-Embedding-v2
(v2-1b) 2025 8,192 SB Intuitions Sarashina Model NonCommercial License
sbintuitions/sarashina-embedding-v1-1b 2024 8,192 SB Intuitions Sarashina Model NonCommercial License
AMBER
(base, large) 2025 512 レトリバ Apache 2.0
RoSEtta
(base-ja) 2024 1,024 PKSHA Technology Apache 2.0
GLuCoSE v2
(base-ja-v2) 2024 512 PKSHA Technology Apache 2.0
Ruri
(small, base, large, small-v2, base-v2, large-v2) 2024 512 名大 笹野研 Apache 2.0
Japanese SimCSE
(unsup-simcse-ja-base, unsup-simcse-ja-large, sup-simcse-ja-base, sup-simcse-ja-large) 2023 512 名大 笹野研 CC BY-SA 4.0
GLuCoSE
(base-ja) 2023 512 PKSHA Technology Apache 2.0
colorfulscoop/sbert-base-ja 2021 Colorful Scoop CC BY-SA 4.0
MU-Kindai/SBERT-JSNLI-base
MU-Kindai/SBERT-JSNLI-large 2022 近畿大学 (研究室不明) ?
MU-Kindai/Japanese-SimCSE-BERT-base-unsup
MU-Kindai/Japanese-SimCSE-BERT-large-unsup
MU-Kindai/Japanese-SimCSE-RoBERTa-base-unsup
MU-Kindai/Japanese-SimCSE-BERT-base-sup
MU-Kindai/Japanese-SimCSE-BERT-large-sup 2022 近畿大学 (研究室不明) MIT
pkshatech/simcse-ja-bert-base-clcmlp 2022 PKSHA Technology CC BY-SA 4.0
MU-Kindai/Japanese-MixCSE-BERT-base
MU-Kindai/Japanese-MixCSE-BERT-large 2022 近畿大学 (研究室不明) MIT
MU-Kindai/Japanese-DiffCSE-BERT-base 2022 近畿大学 (研究室不明) MIT
bclavie/fio-base-japanese-v0.1 2023 個人 (Benjamin Clavié)
cl-nagoya/shioriha-large-pt 2024 名大 笹野研

Multi-representation bi-encoders

公開年 開発元 ライセンス
JaColBERTv2.5
(JaColBERTv2.4, JaColBERTv2.5) 2024 Answer.AI MIT
JaColBERTv2
(JaColBERTv2) 2024 個人 (Benjamin Clavié) MIT
JaColBERT
(JaColBERT) 2023 個人 (Benjamin Clavié) MIT

Cross-Encoders

公開年 開発元 ライセンス
Ruri-v3 Reranker
(310m) 2025 名大 笹野研 Apache 2.0
Ruri-Reranker
(stage1-small, stage1-base, stage1-large, small, base, large) 2024 名大 笹野研 Apache 2.0
hotchpotch/japanese-reranker-cross-encoder-xsmall-v1
hotchpotch/japanese-reranker-cross-encoder-small-v1
hotchpotch/japanese-reranker-cross-encoder-base-v1
hotchpotch/japanese-reranker-cross-encoder-large-v1
hotchpotch/japanese-bge-reranker-v2-m3-v1 2024 個人 (舘野祐一) MIT

視覚言語モデル (Vision-Language Models)

画像+テキストからのテキスト生成

スクラッチ学習モデル

※LLMと視覚エンコーダを組み合わせて新規に構築されたVLMが該当します (ベースのLLMは国内モデル/海外モデルを問いません)

汎用
公開年 アーキテクチャ 学習画像/テキスト 開発元 ライセンス / 利用規約
Stockmark-2-VL-100B-beta
(100B-beta) 2025 LLaVA-OneVision 3段階学習: アライメント事前学習、キャプション拡張、インストラクション・推論ファインチューニング
合成データ: Qwen2.5-VL-72B から生成 ストックマーク Qwen License
Llama-3.1-70B-Instruct-multimodal-JP-Graph
(v0.1) 2025 LLaVA (Llama-3.1-Swallow-70B-Instruct-v0.3 + Qwen2-VL-7B-Instruct) 図表・グラフ理解特化の600万枚超の合成視覚データ (文字、円グラフ、棒グラフ、フローチャートなど)、実データ (FastLabel 協力) リコー Llama 3.1 Community License & Gemma Terms of Use & Qwen License & MIT & Apache 2.0
KARAKURI VL
(32b-instruct-2507, 32b-thinking-2507-exp) 2025 Vision-Language (Qwen2.5-VL-32B ベース) 日本語コンピュータユース特化のカスタムデータセット: 日本語コンピュータ操作記録、日本語文書画像QA、視覚情報解釈、日本語OCR、フローチャート理解
3段階学習: Supervised Fine-Tuning (SFT) + モデルマージ + 強化学習
*thinking モデルは Chain of Thought (CoT) アプローチによる推論プロセス明示 カラクリ Apache 2.0
Heron-NVILA
(1B, 2B, 15B, 33B) 2025 NVILA 3段階学習: アライメント (558k日本語画像テキストペア + 595k LLaVA-Pretrain)、事前学習 (MOMIJI 13M、日本語画像テキストペア 6M、日本語インターリーブデータ 2M、coyo-700m 6M、mmc4-core 4M、Wikipedia-ja、LLaVA-Pretrain-JA、STAIR captions)、教師ありファインチューニング (LLaVA-instruct-v1.5-en、LLaVA-instruct-ja、日本語写真会話、JA-VG-VQA会話、SynthDog-ja、AI2D、SynthDog-en、Sherlock) Turing Apache 2.0 & OpenAI Terms of Use
NABLA-VL
(15B) 2025 microsoft/phi-4 + HuggingFaceM4/siglip-so400m-14-980-flash-attn2-navit 単一画像