日本語LLMまとめ
[!IMPORTANT] 📖 より読みやすいWeb版をご利用ください
このREADMEの内容は、llm-jp.github.io/awesome-japanese-llm でより見やすい形式でご覧いただけます。表の表示崩れやレイアウトの問題を防ぐため、Web版の閲覧を推奨いたします。
この記事は、一般公開されている日本語LLM(日本語を中心に学習されたLLM)および日本語LLM評価ベンチマークに関する情報をまとめたものです。情報は、有志により収集されており、その一部は論文や公開されているリソースなどから引用しています。
::: warning 以下の点について、あらかじめご理解とご了承をお願いいたします
- 本記事の内容は、完全性や正確性を保証するものではありません。これらの情報は予告なく変更されることがあり、また最新の情報を常に提供できるとは限りません。
- 一部の情報は、推測や個々の利用者の解釈にもとづくものである場合があります。そのため、全ての読者にとって必ずしも正確であるとは限りません。
- 本記事に記載されているモデルの多くは、MIT や Apache-2.0 といったオープンソースライセンスが適用されています。しかしながら、一部のモデルには、非営利限定のライセンス(例:CC BY-NC-SA 4.0)や開発元特有のライセンスが適応されており、これらは必ずしもオープンソースとは言えない可能性がある点にご注意ください。
- 個人が開発したモデルに関する記述では、作成者の敬称は省略させていただいております。 :::
この記事の管理は GitHub で行っています。記事の間違いを発見した場合、あるいはモデルの追加提案を行いたい場合は、GitHub Issues 経由で報告していただけますと幸いです。
::: details 目次 {open} [[toc]] :::
テキスト生成に主に使うモデル
画像を含むテキスト生成モデルはこちら
スクラッチ学習モデル
汎用
| | 公開年 | アーキテクチャ | 入出力で扱える
トークン数 | 学習テキスト | 開発元 | ライセンス / 利用規約 |
|:---|:---:|:---:|:---:|:---:|:---:|:---:|
| Sarashina2-8x70B | 2024 | MoE
(8x70b (465b)) | 8,192 | Sarashina2 (70B) に対して Sparse Upcycling で学習 | SB Intuitions | Sarashina Model NonCommercial License |
| LLM-jp-3 172B | 2024 | Llama
(172b, 172b-instruct2, 172b-instruct3) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k
DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst | 大規模言語モデル研究開発センター | 事前学習済みモデル: LLM-jp-3 172B Terms of Use
事後学習済みモデル: llm-jp-3-172b-instruct3利用許諾契約 |
| LLM-jp-3 172B beta2 | 2024 | Llama
(172b-beta2, 172b-beta2-instruct2) | 4,096 | 事前学習: llm-jp-corpus-v3の一部
(計 1.4T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k | 大規模言語モデル研究開発センター | LLM-jp-3 172B beta2 Terms of Use |
| LLM-jp-3 172B beta1 | 2024 | Llama
(172b-beta1, 172b-beta1-instruct) | 4,096 | 事前学習: llm-jp-corpus-v3の一部
(計 0.7T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN | 大規模言語モデル研究開発センター | LLM-jp-3 172B beta1 Terms of Use |
| LLM-jp-3 172B alpha | 2024 | Llama
(172b-alpha1, 172b-alpha1-instruct, 172b-alpha2, 172b-alpha2-instruct) | 4,096 | 事前学習: llm-jp-corpus-v3の一部
(alpha1: 計 0.7T トークン, alpha2: 計 1.4T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN | 大規模言語モデル研究開発センター | Apache 2.0 |
| Stockmark-2-100B-Instruct-beta | 2025 | Llama
(100B-Instruct-beta, 100B-Instruct-beta-AWQ) | 4,096 | 事前学習: 計 1.5T トークン
Instruction Tuning
DPO | ストックマーク | MIT |
| Stockmark-100b | 2024 | Llama
(100b, 100b-instruct-v0.1) | 4,096 | 事前学習: RedPajama, 日本語 Wikipedia, Japanese mC4, Japanese CommonCrawl, 日本語特許, Stockmark Web Corpus
(計 910B トークン)
Instruction Tuning (LoRA): ichikara-instruction | ストックマーク | MIT |
| PLaMo-100B-Pretrained | 2024 | Llama[^22]
(100b) | 4,096 | 事前学習: Japanese CommonCrawl, RefinedWeb, 独自のデータセット
(計: 2.0T トークン) | Preferred Elements (Preferred Networks) | PLaMo Non-Commercial License |
| LLM-jp-3.1 | 2025 | Llama/MoE
(8x13b (73b), 8x13b (73b)-instruct4, 13b, 13b-instruct4, 1.8b, 1.8b-instruct4) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.5T トークン)
継続事前学習: インストラクション・レスポンスペア
(計 90B トークン)
SFT + DPO | 大規模言語モデル研究開発センター | Apache 2.0 |
| LLM-jp-3 MoE | 2025 | MoE
(8x1.8b (9.3b), 8x1.8b (9.3b)-instruct2, 8x1.8b (9.3b)-instruct3, 8x13b (73b), 8x13b (73b)-instruct2, 8x13b (73b)-instruct3) | 4,096 | LLM-jp-3 (1.8b, 13b) に対して Drop-Upcycling で学習 | 大規模言語モデル研究開発センター | Apache 2.0 |
| Sarashina2 | 2024 | Llama
(7b, 13b, 70b) | 7b, 13b: 4,096
70b: 8,192 | 事前学習: Japanese Common Crawl, SlimPajama, StarCoder
(計 2.1T トークン) | SB Intuitions | MIT |
| Sarashina1 | 2024 | GPT-NeoX
(7b, 13b, 65b) | 2,048 | 事前学習: Japanese Common Crawl
(計 1T トークン) | SB Intuitions | MIT |
| Tanuki-8×8B | 2024 | MoE (47b)
(v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF) | 4,096 | 事前学習: 様々な Web 上のデータ, 合成データ(計 1.7T トークン)
SFT, DPO: 様々な合成データ [^19] | 松尾研LLM開発プロジェクト | Apache 2.0 |
| LLM-jp-4 33B | 2026 | Llama
(33b-base, 33b-thinking, 33b-thinking-gguf) | 65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO: llm-jp-4-33b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 |
| LLM-jp-4.1 33B | 2026 | Llama
(33b-thinking, 33b-thinking-gguf) | 65,536 | LLM-jp-4 33B に対し事後学習
SFT: llm-jp-4.1-thinking-sft-data
DPO: llm-jp-4.1-33b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 |
| ELYZA-Thinking-1.0-llm-jp-4-33b | 2026 | Llama
(33b) | 65,536 | llm-jp-4-33b-base に対し中間学習、SFT、RLVR を実施
中間学習: 数学・コード・STEM問題の日本語化、エージェントデータの日本語化
SFT: 思考過程付き合成データ、複雑な指示データ、日本語 Wikipedia・Wikidata からの知識データ
RLVR: 数学・コード・日本語知識・複雑な指示追従・ツール利用の検証可能問題 | ELYZA | Apache 2.0 |
| LLM-jp-4 32B-A3B | 2026 | Qwen3 MoE
(32b-a3b-base, 32b-a3b-thinking, 32b-a3b-thinking-gguf) | 65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO: llm-jp-4-32b-a3b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 |
| LLM-jp-4.1 32B-A3B | 2026 | Qwen3 MoE
(32b-a3b-thinking, 32b-a3b-thinking-gguf) | 65,536 | LLM-jp-4 32B-A3B に対し事後学習
SFT: llm-jp-4.1-thinking-sft-data
DPO: llm-jp-4.1-32b-a3b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 |
| ELYZA-Thinking-1.0-llm-jp-4-32b-a3b | 2026 | Qwen3 MoE
(32b-a3b) | 65,536 | llm-jp-4-32b-a3b-base に対し中間学習、SFT、RLVR を実施
中間学習: 数学・コード・STEM問題の日本語化、エージェントデータの日本語化
SFT: 思考過程付き合成データ、複雑な指示データ、日本語 Wikipedia・Wikidata からの知識データ
RLVR: 数学・コード・日本語知識・複雑な指示追従・ツール利用の検証可能問題 | ELYZA | Apache 2.0 |
| llm-jp-4-kappa | 2026 | Qwen3 MoE
(32b-a3b-v0.1) | 65,536 | LLM-jp-4 32B-A3B (thinking) に対して以下を実施
SFT: Nemotron-Cascade-2-SFT-Data, OpenMathReasoning, OpenCodeReasoning, Nemotron-SFT-Competitive-Programming-v2, llm-jp-4-thinking-sft-data など (計 443,747 件)
GRPO (数学): AceReason-Math から選別した 10,999 問
GRPO (コード): SYNTHETIC-2 から選別した約 3.1k 件 | Third Intelligence | Apache 2.0[^29] |
| PLaMo 3 | 2025 | Gemma ベースのアーキテクチャ
(2b-base, 8b-base, 31b-base) | 4,096 | 事前学習: 英語、日本語、コード、多言語
(2b: 200B トークン, 8b: 1T トークン, 31b: 3T トークン) | Preferred Networks | PLaMo community license |
| Way-PLaMo-3-8b-chat | 2025 | PLaMo 3ベース (8b-chat) | 4,096 | Instruction Following SFT: Alpaca (51.7K), Dolly-15k-ja (15K) | 個人 (WayBob) | PLaMo community license |
| CyberAgentLM3 (CALM3) | 2024 | Llama
(22b-chat, 22b-chat-selfimprove-experimental) | 16,384 | 不明
(計 2.0T トークン) | サイバーエージェント | Apache 2.0 |
| LLM-jp-3 13B instruct3 | 2025 | Llama
(150m, 150m-instruct2, 150m-instruct3, 440m, 440m-instruct2, 440m-instruct3, 980m, 980m-instruct2, 980m-instruct3, 1.8b-instrcut2, 1.8b-instruct3, 3.7b-instruct2, 3.7b-instruct3, 7.2b-instruct2, 7.2b-instruct3, 13b-instruct2, 13b-instruct3) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, Synthetic-JP-EN-Coding-Dataset-567k
DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst | 大規模言語モデル研究開発センター | Apache 2.0 |
| LLM-jp-3 13B | 2024 | Llama
(1.8b, 1.8b-instruct, 3.7b, 3.7b-instruct, 7.2b, 7.2b-instruct, 13b, 13b-instruct) | 4,096 | 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k | 大規模言語モデル研究開発センター | Apache 2.0 |
| llm-jp-3-3.7b-instruct-EZO | 2024 | Llama
(3.7b-instruct-EZO-Common, 3.7b-instruct-EZO-Humanities) | 4,096 | LLM-jp-3 (3.7B) に対して追加学習 | Axcxept | Apache 2.0 |
| LLM-jp-13B v2.0 | 2024 | Llama
(13b-v2.0, 13b-instruct-full-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001_16x-dolly-ichikara_004_001_single-oasst-oasst2-v2.0) | 4,096 | 事前学習: llm-jp-corpus-v2
(計 260B トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2 | LLM-jp | Apache 2.0 |
| Fugaku-LLM | 2024 | GPT
(13B, 13B-instruct, 13B-instruct-gguf) | 2,048 | 事前学習: 独自
Instruction Tuning: OASST1, Dolly Dataset, GSM8K | 東工大, 東北大, 富士通, 理研, 名大, サイバーエージェント, Kotoba Technologies | Fugaku-LLM Terms of Use |
| LLM-jp-13B v1.1 | 2024 | GPT
(13b-instruct-lora-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-instruct-full-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-dpo-lora-hh_rlhf_ja-v1.1) | 2,048 | Instruction Tuning (LoRA or Full-parameter FT): Dolly Dataset, OASST1, ichikara-instruction
DPO (LoRA): HH RLHF | LLM-jp | Apache 2.0 |
| LLM-jp-13B | 2023 | GPT
(1.3b-v1.0, 13b-v1.0, 13b-instruct-full-jaster-v1.0, 13b-instruct-full-jaster-dolly-oasst-v1.0, 13b-instruct-full-dolly-oasst-v1.0, 13b-instruct-lora-jaster-v1.0, 13b-instruct-lora-jaster-dolly-oasst-v1.0, 13b-instruct-lora-dolly-oasst-v1.0) | 2,048 | 事前学習: llm-jp-corpus (Wikipedia, Japanese mC4, The Pile, Stack) (計 300B トークン)
Instruction Tuning (Full-parameter FT or LoRA): jaster, Dolly Dataset, OASST1 | LLM-jp | Apache 2.0 |
| PLaMo-13B | 2023 | Llama[^1]
(13b, 13b-instruct, 13b-instruct-nc) | base: 4,096
instruct, instruct-nc: 8,192 | 事前学習: C4, Project Gutenberg, RedPajama, 日本語 Wikipedia, Japanese mC4
(計 1.5T トークン)
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1, llm-japanese-datasetのwikinews subset (NCモデルでは商用利用不可の Alpaca Dataset も含めて学習) | Preferred Networks | Apache 2.0
(NC モデルは CC BY-NC 4.0) |
| Stockmark-13b | 2023 | Llama
(13b, 13b-instruct) | 2,048 | 事前学習: 日本語 Wikipedia、Japanese CC-100、Japanese mC4、Japanese CommonCrawl、日本語特許、Stockmark Web Corpus
(計 220B トークン)
Instruction Tuning (LoRA): ichikara-instruction | ストックマーク | baseモデル: MIT
instructモデル: CC BY-NC-SA 4.0 |
| Weblab-10B | 2023 | GPT-NeoX
(10b, 10b-instruction-sft) | 2,048 | Japanese mC4 + The Pile(計 600B トークン)
*instruction-sft モデルは Alpaca Dataset, FLAN でファインチューニング | 東大 松尾・岩澤研 | CC BY-NC 4.0 |
| LLM-jp-4 8B | 2026 | Llama
(8b-base, 8b-instruct, 8b-thinking, 8b-thinking-gguf) | 65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO (thinking のみ): llm-jp-4-8b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 |
| LLM-jp-4.1 8B | 2026 | Llama
(8b-thinking, 8b-thinking-gguf) | 65,536 | LLM-jp-4 8B に対し事後学習
SFT: llm-jp-4.1-thinking-sft-data
DPO: llm-jp-4.1-8b-thinking-dpo-data | 大規模言語モデル研究開発センター | Apache 2.0 |
| PLaMo 2.1 8B | 2025 | Samba ベースのアーキテクチャ
(8b-cpt) | 32,768 | 訓練詳細不明 | Preferred Networks | PLaMo community license |
| PLaMo 2 8B | 2025 | Samba ベースのアーキテクチャ
(8b) | | 日本語、英語等のデータ
(計 6T トークン) | Preferred Networks | PLaMo community license |
| Tanuki-8B | 2024 | Tanuki (8b)
(v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF) | 4,096 | 事前学習: 様々な Web 上のデータ, 合成データ(計 1.3T トークン)
SFT, DPO: 様々な合成データ [^19] | 松尾研LLM開発プロジェクト | Apache 2.0 |
| Japanese StableLM Alpha | 2023 | GPT-NeoX
(base-alpha-7b, instruct-alpha-7b, instruct-alpha-7b-v2) | 2,048 | Wikipedia, Japanese CC-100, Japanese mC4, Japanese OSCAR, RedPajama
(+ 独自のデータセット)[^2]
(計 750B トークン)
*instruct モデルでは Alpaca Dataset, Dolly Dataset, HH RLHF, llm-japanese-datasetのwikinews subsetでファインチューニング
(v2では商用利用不可の Alpaca Dataset を除外) | Stability AI | baseモデル: Apache 2.0
instruct モデル (v1): 独自のライセンス
instruct モデル (v2): Apache 2.0 |
| CyberAgentLM2 (CALM2) | 2023 | Llama
(7b, 7b-chat, 7b-chat-dpo-experimental) | base: 4,096
chat: 32,768 |一般公開されている日本語・英語のデータセット(詳細不明) (計 1.3T トークン)
*dpo モデルは Chatbot Arena Conversations JA (calm2) Dataset を用いて DPO で学習 | サイバーエージェント | Apache 2.0
(dpo モデルのみ CC BY 4.0) |
| OpenCALM | 2023 | GPT-NeoX
(small, medium, large, 1b(1.4b), 3b(2.7b), 7b(6.8b)) | 2,048 | 日本語 Wikipedia
- Jpanese mC4
- Japanese CC-100 | サイバーエージェント | CC BY-SA 4.0 |
| Stormy | 2023 | GPT-NeoX
(7b(6.8b)) | 2,048 | OpenCALM (6.8b) に対して
llm-japanese-dataset v0 のうち翻訳タスクを除いたデータで LoRAチューニング | 東大 和泉研 | CC BY-SA 4.0 | | ByGPT-JP | 2025 | Llama ベース
(multi-lm-head-6.5b-alpha) | 5,760 | llm-jp-corpus-v3 のサブセット (ja_cc, ja_warp_html, ja_warp_pdf, ja_wiki, kaken) | 東北大
自然言語処理研究グループ | Apache 2.0 | | rinna GPT
(英語やコードも含めて学習されたモデル) | 2023 | GPT-NeoX
(4b(3.8b), 4b(3.8b)-8k, 4b(3.8b)-instruction-sft, 4b(3.8b)-instruction-ppo) | 8kモデル: 8,192
他: 2,048 | Wikipedia, Japanese CC-100, Japanese C4, RedPajama, The Pile
(計 524B トークン)
*8k モデルでは 4,000トークンを超える長いトークン列でファインチューニング
*instruction-sft モデルでは HH RLHF、FLAN でファインチューニング
*instruction-ppo モデルでは HH RLHF で PPO ベースの強化学習 | rinna | MIT | | japanese-large-lm | 2023 | GPT-NeoX
(1.7b, 3.6b, 1.7b-instruction-sft, 3.6b-instruction-sft) | 2,048 | 日本語 Wikipedia, Japanese CC-100, Japanese C4, Japanese OSCAR や独自データなど
(計 650GB)
*instruction-sft モデルでは OASST1 でファインチューニング | LINE | Apache 2.0 | | rinna GPT
(日本語のみで学習されたモデル) | 2023 | GPT または GPT-NeoX
(xsmall, small, medium, 1b, neox-small, neox-3.6b-instruction-sft-v2, neox-3.6b-instruction-ppo) | ≤ 2,048 | 日本語 Wikipedia - Japanese CC-100
(1b 以降のモデルでは
さらに Japanese mC4 を追加)
*instruction-sft, sft-v2 モデルでは HH RLHF、FLAN、SHP データセットでさらにファインチューニング
*instruction-ppo モデルでは HH RLHF でさらに PPO ベースの強化学習 | rinna | MIT | | Sarashina2.2 | 2025 | Llama
(0.5b, 0.5b-instruct-v0.1, 1b, 1b-instruct-v0.1, 3b, 3b-instruct-v0.1) | 8,192 || SB Intuitions | MIT | | レトリバT5 | 2023 | T5
(small (short), small (medium), small (long), base (short), base (medium), base (long), large (short), large (medium), large (long), xl(3b)) | | 日本語 Wikipedia + Japanese mC4 | レトリバ | CC BY-SA 4.0 | | Spiral-RetNet-3b-base | 2024 | RetNet
(3b) | 2,048 | Wikipedia, Japanese CC-100, CulturaX | Spiral.AI | MIT | | kotomamba-2.8B | 2024 | Mamba
(2.8B-v1.0) | 2,048 | 日本語 Wikipedia, Swallow Corpus, SlimPajama | Kotoba Technologies | Apache 2.0 | | ABEJA GPT | 2022 | GPT または GPT-NeoX
(large, neox-2.7b) | | 日本語 Wikipedia - Japanese CC-100
- Japanese OSCAR | ABEJA | MIT |
| PLaMo 2.1 2B | 2025 | Causal decoder-only transformer
(2b-cpt) | 32,768 | 訓練詳細不明 | Preferred Networks | PLaMo community license | | Rakuten AI 2.0 mini | 2025 | Mistral
(mini(1.5b), mini(1.5b)-instruct) | 131,072 ||楽天|Apache 2.0| | 早大GPT | 2022 | GPT
(small, xl(1.5b)) | | 日本語 Wikipedia - Japanese CC-100 | 早大 河原研 | CC BY-SA 4.0 |
| ストックマークGPT | 2023 | GPT-NeoX
(1.4b) | | 日本語 Wikipedia (0.88B トークン) - Japanese CC-100 (10.5B トークン)
- 独自のWebデータ (8.6B トークン) | ストックマーク | MIT |
| イエローバックGPT | 2021 | GPT-NeoX
(1.3b) | | 日本語 Wikipedia - Japanese CC-100
- Japanese OSCAR | イエローバック | Apache 2.0 |
| nanochat-jp | 2026 | nanochat (1b)
(v4-sft-hf, v3-sft-hf) | 2,048 | 事前学習: nanochat-jp-pretrain v4 / v3
SFT: nanochat-jp-sft | 東北大
自然言語処理研究グループ | Apache 2.0 | | PLaMo 2 1B | 2025 | Samba ベースのアーキテクチャ
(1b) | | 日本語、英語等のデータ
(計 4T トークン) | Preferred Elements (Preferred Networks) | Apache 2.0 | | Sarashina2.1-1B | 2024 | Llama
(1b) | 8,192 | Web 上などの日本語・英語データ(計 10T トークン) | SB Intuitions | Sarashina Model NonCommercial License | | colorfulscoop GPT | 2021 | GPT
(small) | | 日本語 Wikipedia | Colorful Scoop | CC BY-SA 3.0 | | 東工大GPT | 2023 | GPT
(medium, medium (逆方向)) [^3] | | 日本語 Wikipedia + Japanese CC-100 | 東工大 岡崎研 | CC BY-SA 4.0 | | 京大GPT | 2022 | GPT
(small (文字レベル), medium (文字レベル), large (文字レベル)) | | 日本語 Wikipedia (約2,700万文 (3.2GB)) - Japanese CC-100 (約6億1,900万文 (85GB))
- Japanese OSCAR (約3億2,600万文 (54GB)) | 京大 言語メディア研究室 | CC BY-SA 4.0 |
| 日本語BART | 2023 | BART
(base, large) | | 日本語 Wikipedia (約1,800万文) | 京大 言語メディア研究室 | CC BY-SA 4.0 | | Megagon Labs T5 | 2021 | T5
(base) | | Japanese mC4 (87,425,304 ページ (782 GB)) - Japanese wiki40b (828,236 記事 (2 GB)) | Megagon Labs
(リクルート) | Apache 2.0 |
ドメイン特化型
| 公開年 | ドメイン | アーキテクチャ | 学習テキスト | 開発元 | ライセンス | |
|---|---|---|---|---|---|---|
| SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-32k-R0.1 | 2026 | 医療 | MoE | 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| SIP-med-LLM/SIP-jmed-llm-3-8x13b-AC-32k-instruct | 2025 | 医療 | MoE | 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 PMC-Patients 等を用いた Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | SIP-jmed-llm-3-8x13b-AC-32k-instruct Terms of Use[^25] |
| SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-4k-base | 2025 | 医療 | MoE | 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習 | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| SIP-med-LLM/SIP-jmed-llm-2-8x13b-OP-instruct | 2025 | 医療 | MoE | 医療系コーパス (44.2B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、その後 Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| SIP-med-LLM/SIP-jmed-llm-3-13b-OP-32k-R0.1 | 2026 | 医療 | Llama | 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| SIP-med-LLM/SIP-jmed-llm-3-13b-OP-4k-base | 2025 | 医療 | Llama | 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習 | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| AscleLM-1-10B | 2026 | 医療 | Mamba-2 Hybrid | |||
| (Nemotron-H ベース) | 事前学習: Nemotron-CC v1 (約 6.3T トークン)、オープンソースの日本語・英語・中国語コーパス、コード・数学・推論データ (計 約 8.5T トークン)、および医学論文・医学書籍・診療ガイドライン・試験問題を由来とする合成データ | 東大 松尾・岩澤研 | AscleLM-1-10B Terms of Use[^27] | |||
| 日本語対話Transformer | 2021 | 対話 | Transformer | Twitter 上の日本語リプライのペア | NTT | 独自のライセンス |
| 日本語ニュースBART | 2023 | ビジネス | BART (base) | 日本語ビジネスニュース記事(約2,100万記事 (2.9億文)) | ストックマーク | MIT |
| AcademicBART | 2023 | 学術 | BART (base) | CiNii の日本語論文 | 愛媛大 人工知能研究室 | Apache 2.0 |
海外モデルに日本語で継続事前学習を行ったモデル
※継続事前学習後に事後学習(SFT, DPO, RLなど)を行ったモデルも含みます
汎用
| 公開年 | ベースのLLM | 学習テキスト | 開発元 | ライセンス / 利用規約 | |
|---|---|---|---|---|---|
| GPT-OSS Swallow 120B | |||||
| (120B-SFT-v0.1, 120B-RL-v0.1, 120B-RL-v0.1-MXFP4) | 2026 | GPT-OSS (120b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2 | ||
| (計 419.4B トークン) | |||||
| SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1 | |||||
| RL: allenai/Dolci-Think-RL-7B (Math subset) | Swallowプロジェクト | Apache 2.0 | |||
| Llama 3.3 Swallow 70B | |||||
| (70B-v0.4, 70B-Instruct-v0.4) | 2025 | Llama 3.3 (70b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3 | ||
| Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1, Swallow-Code-v0.3-Instruct-style | Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use | |||
| Llama 3.1 Swallow 70B | |||||
| (70B-v0.1, 70B-Instruct-v0.1, 70B-Instruct-v0.3) | 2024 | Llama 3.1 (70b) | 事前学習: The Stack v2, Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus | ||
| Instruction Tuning: lmsys-chat-1m-synth-ja-wo-pii-and-template-instructions, lmsys-chat-1m-synth-en-wo-pii-and-template-instructions, filtered-magpie-ultra-ja, filtered-magpie-ultra-en, gemma-magpie | Swallowプロジェクト | Llama 3.1 Community License | |||
| (Instructモデルは Gemma Terms of Use も適用) | |||||
| cyberagent/Llama-3.1-70B-Japanese-Instruct-2407 | 2024 | Llama 3.1 (70b) | 不明 | サイバーエージェント | Llama 3.1 Community License |
| Llama 3 Swallow 70B | |||||
| (70B-v0.1, 70B-Instruct-v0.1) | 2024 | Llama 3 (70b) | 事前学習: Algebraic Stack, Wikipedia, RefinedWeb, Swallow Corpus, Cosmopedia, Laboro ParaCorpus, OpenWebMath | ||
| Instruction Tuning: OASST1 [^17] | Swallowプロジェクト | Llama 3 Community License | |||
| turing-motors/Llama-3-heron-brain-70B-v0.3 | 2024 | Llama 3 (70b) | Llama 3 Swallow 70B に対して追加学習(詳細不明) | Turing | Llama 3 Community License |
| Llama 3 Youko 70B | |||||
| (70b, 70b-instruct, 70b-gptq, 70b-instruct-gptq) | 2024 | Llama 3 (70b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット | ||
| (計 5B トークン) | |||||
| Instruction Tuning: 独自のデータセット[^11] | rinna | Llama 3 Community License | |||
| Swallow 70B | |||||
| (70b-hf, 70b-instruct-hf, 70b-instruct-v0.1, 70b-NVE-hf, 70b-NVE-instruct-hf) | 2023 | Llama 2 (70b) | 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile | ||
| Instruction Tuning: Dolly Dataset, HH RLHF, OASST1 | |||||
| *v0.1モデルでは OASST1, OASST2 を使用 | Swallowプロジェクト | Llama 2 Community License | |||
| KARAKURI LM | |||||
| (70b-v0.1, 70b-chat-v0.1) | 2024 | Llama 2 (70b) | 事前学習: mC4, CC100, OSCAR, RedPajama, 独自のデータセット | ||
| (計 16B トークン) | |||||
| SteerLM: OASST2, 独自のデータセット | カラクリ | Llama 2 Community License[^13] | |||
| Japanese Stable LM Beta 70B | |||||
| (base-beta-70b, instruct-beta-70b) | 2023 | Llama 2 (70b) | 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外) | ||
| (計 100B トークン) | |||||
| Instruction Tuning: Dolly Dataset, HH RLHF, OASST1 | Stability AI | Llama 2 Community License | |||
| Fujitsu-LLM-KG | |||||
| (8x7B_cpt, 8x7B_inst-infer_v1, 8x7B_inst-infer_v2, 8x7B_inst-gen_ja, 8x7B_inst-gen_en) | 2025 | Mixtral-8x7B-Instruct-v0.1 (46.7b) | 事前学習: 知識グラフ並列コーパス(森羅プロジェクト、Wikipedia等から合成) 2.1Bトークンを含む計約300Bトークン | ||
| Instruction Tuning: 知識グラフ推論・生成タスク用データセット | 富士通 | Apache 2.0 | |||
| Swallow-MX 8x7B | |||||
| (8x7b-NVE-v0.1) | 2024 | Mixtral-8x7B-Instruct-v0.1 (46.7b) | 事前学習: Algebraic Stack, Japanese Wikipedia, RefinedWeb, Swallow Corpus, The Pile, The Vault | Swallowプロジェクト | Apache 2.0 |
| KARAKURI LM 8x7B Instruct v0.1 | |||||
| (8x7b-instruct-v0.1) | 2024 | Mixtral-8x7B-Instruct-v0.1 (46.7b) | Swallow-MX 8x7B に対して以下のデータセットで学習: Dolly Dataset, OASST2, HelpSteer, glaive-code-assistant-v3, glaive-function-calling-v2, synthetic_text_to_sql, MetaMathQA, orca-math-word-problems-200k, rag-dataset-12000, rag-hallucination-dataset-1000, 独自のデータセット | カラクリ | Apache 2.0 (?)[^12] |
| KARAKURI LM 8x7B Chat v0.1 | |||||
| (8x7b-chat-v0.1) | 2024 | Mixtral-8x7B-Instruct-v0.1 (46.7b) | Swallow-MX 8x7B に対して | ||
| SteerLM: OASST2, HelpSteer, 独自のデータセット | カラクリ | Apache 2.0 | |||
| ABEJA-Mixtral-8x7B-japanese | |||||
| (8x7B-v0.1-japanese, 8x7B-Instruct-v0.1-japanese, 8x7B-Instruct-v0.1-japanese-alpha, 8x7B-Instruct-v0.1-japanese-alpha-merged) | 2024 | Mixtral-8x7B-Instruct-v0.1 (46.7b) | |||
| *Instructが名前に付いていないモデルのみ Mixtral-8x7B-v0.1 がベース | 事前学習: Japanese CC, Redpajama, 独自 | ||||
| (計 450B トークン) | ABEJA | Apache 2.0 | |||
| Qwen3 Swallow 32B | |||||
| (32B-CPT-v0.2, 32B-SFT-v0.2, 32B-RL-v0.2, 32B-RL-v0.2-AWQ-INT4) | 2026 | Qwen3 (32b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2 | ||
| (計 209.7B トークン) | |||||
| SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1 | |||||
| RL: allenai/Dolci-Think-RL-7B (Math subset) | Swallowプロジェクト | Apache 2.0 | |||
| ELYZA-Thinking-1.0-Qwen-32B | |||||
| (32B) | 2025 | Qwen 2.5 (32b) | 事前学習 + SFT (Reasoning) | ELYZA | Apache 2.0 |
| ELYZA-Shortcut-1.0-Qwen-32B | |||||
| (32B) | 2025 | Qwen 2.5 (32b) | 事前学習 + SFT | ELYZA | Apache 2.0 |
| ABEJA-Qwen2.5-32b-Japanese-v1.0 | |||||
| (v1.0) | 2025 | Qwen2.5-32B-Instruct (32b) | 継続事前学習 + SFT + DPO: 約2万件の合成データ・人手アノテーションデータセット(抽出・推論能力に特化) | ABEJA | Apache 2.0 |
| Qwen2.5 Bakeneko 32B | |||||
| (qwen2.5-bakeneko-32b, qwen2.5-bakeneko-32b-instruct, deepseek-r1-distill-qwen2.5-bakeneko-32b, qwq-bakeneko-32b) | 2025 | Qwen 2.5 (32b) | rinna | Apache 2.0 | |
| ABEJA-QwQ32b-Reasoning-Japanese-v1.0 | |||||
| (v1.0) | 2025 | Qwen 2.5 (32b) | ABEJA-Qwen2.5-32b-Japanese-v0.1 に QwQ 32b の Chat Vector をマージした上で追加学習 | ABEJA | Apache 2.0 |
| ABEJA-Qwen2.5-32b-Japanese-v0.1 | |||||
| (32b-Japanese-v0.1) | 2025 | Qwen 2.5 (32b) | 事前学習: Common Crawl, Cosmopedia, 独自 | ||
| (計 100B トークン) |
- Chat Vector | ABEJA | Apache 2.0 |
| neoAI-JP-QwQ-32B
(32B) | 2025 | Qwen 2.5 (32b) | 継続事前学習: llm-jp-corpus v3から約4Bトークン - QwQ-32BのChat Vector | neoAI | Apache 2.0 |
| neoAI-JP-DeepSeek-Qwen-32B
(32B) | 2025 | Qwen 2.5 (32b) | 継続事前学習: llm-jp-corpus v3から約4Bトークン - DeepSeek-R1-Distill-Qwen-32BのChat Vector | neoAI | Apache 2.0 |
| Qwen3 Swallow 30B-A3B
(30B-A3B-CPT-v0.2, 30B-A3B-SFT-v0.2, 30B-A3B-RL-v0.2, 30B-A3B-RL-v0.2-AWQ-INT4) | 2026 | Qwen3 (30b-A3B) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 209.7B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset) | Swallowプロジェクト | Apache 2.0 | | Gemma-2-Llama Swallow 27B
(27b-pt-v0.1, 27b-it-v0.1) | 2025 | Gemma 2 (27b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1 | Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use | | GPT-OSS Swallow 20B
(20B-SFT-v0.1, 20B-RL-v0.1, 20B-RL-v0.1-MXFP4) | 2026 | GPT-OSS (20b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 419.4B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset) | Swallowプロジェクト | Apache 2.0 | | ABEJA-Qwen3-14B-Agentic-256k-v0.1
(v0.1) | 2026 | Qwen3 (14b) | 継続事前学習: 長文合成データ(YaRN によりコンテキスト長を128k→256kに拡張) - Agentic 能力強化のための強化学習 | ABEJA | Apache 2.0 |
| Nekomata 14B
(14b, 14b-instruction, 14b-gguf, 14b-instruction-gguf) | 2023 | Qwen (14b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 66B トークン)
Instruction Tuning: Dolly Dataset, FLAN, llm-japanese-datasetの一部 | rinna | Tongyi Qianwen LICENSE | | Swallow 13B
(13b-hf, 13b-instruct-hf, 13b-instruct-v0.1, 13b-NVE-hf) | 2023 | Llama 2 (13b) | 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1
*v0.1モデルでは OASST1, OASST2 を使用 | Swallowプロジェクト | Llama 2 Community License | | LEIA-Swallow-13B
(13b) | 2024 | Llama 2 (13b) | Swallow 13B に対して LEIA で追加学習 | 個人 (山田育矢, 李凌寒) | Llama 2 Community License | | ELYZA-japanese-Llama-2-13b
(13b, 13b-instruct, 13b-fast, 13b-fast-instruct) | 2023 | Llama 2 (13b) | 事前学翕: 日本語 Wikipedia, Japanese OSCAR, その他クロールデータなど
(計 18B トークン)
Instruction Tuning: 独自のデータセット | ELYZA | Llama 2 Community License | | cyberagent/Mistral-Nemo-Japanese-Instruct-2408 | 2024 | Mistral NeMo (12b) | 不明 | サイバーエージェント | Apache 2.0 | | NVIDIA-Nemotron-Nano-9B-v2-Japanese
(9B) | 2026 | Nemotron-Nano (9b) | 継続事前学習: Wikipedia, fineweb-2 Japanese, aozorabunko, sip3-ja-general-web-corpus, Nemotron-CC-v2.1, Nemotron-Pretraining-Specialized-v1
SFT: Nemotron-Personas-Japan をシードセットとした Tool Calling データセット, Nemotron-Post-Training-v3 | NVIDIA | NVIDIA Nemotron Open Model License Agreement | | Gemma-2-Llama Swallow 9B
(9b-pt-v0.1, 9b-it-v0.1) | 2025 | Gemma 2 (9b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1 | Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use | | Qwen3 Swallow 8B
(8B-CPT-v0.2, 8B-SFT-v0.2, 8B-RL-v0.2, 8B-RL-v0.2-AWQ-INT4) | 2026 | Qwen3 (8b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 209.7B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset) | Swallowプロジェクト | Apache 2.0 | | Llama 3.1 Swallow 8B
(8B-v0.1, 8B-Instruct-v0.1, 8B-v0.2, 8B-Instruct-v0.2, 8B-Instruct-v0.3, 8B-Instruct-v0.5) | 2025 | Llama 3.1 (8b) | 事前学習: The Stack v2, Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus
Instruction Tuning: lmsys-chat-1m-synth-ja-wo-pii-and-template-instructions, lmsys-chat-1m-synth-en-wo-pii-and-template-instructions, filtered-magpie-ultra-ja, filtered-magpie-ultra-en, gemma-magpie, Gemma-3-LMSYS-Chat-1M-Synth | Swallowプロジェクト | Llama 3.1 Community License
(Instructモデルは Gemma Terms of Use も適用) | | Llama 3 Swallow 8B
(8B-v0.1, 8B-Instruct-v0.1) | 2023 | Llama 3 (8b) | 事前学習: Algebraic Stack, Wikipedia, RefinedWeb, Swallow Corpus, Cosmopedia, Laboro ParaCorpus, OpenWebMath
Instruction Tuning: OASST1 [^17] | Swallowプロジェクト | Llama 3 Community License | | turing-motors/Llama-3-heron-brain-8B-v0.3 | 2024 | Llama 3 (8b) | Llama 3 Swallow 8B に対して追加学習(詳細不明) | Turing | Llama 3 Community License | | Llama 3 Youko 8B
(8b, 8b-instruct, 8b-gptq, 8b-instruct-gptq) | 2024 | Llama 3 (8b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 22B トークン)
Instruction Tuning[^11]: Aya Dataset (Japanese subset), FLAN, Dolly Dataset, HH RLHF, OASST1, OASST2, MetaMathQA, CodeAlpaca Dataset, 独自のデータセット
DPO: HelpSteer, HelpSteer2, 独自のデータセット | rinna | Llama 3 Community License | | Llama 3 ELYZA JP 8B
(8B, 8B-GGUF, 8B-AWQ) | 2024 | Llama 3 (8b) | 不明 | ELYZA | Llama 3 Community License | | Llama 3 neoAI 8B Chat v0.1
(8B-Chat-v0.1) | 2024 | Llama 3 (8b) | 不明 | neoAI | Llama 3 Community License | | Llama 3 tedllm
(v0) | 2024 | Llama 3 (8b) | 事前学習: 日本語の一般コーパス | 東京エレクトロン デバイス | Llama 3 Community License | | ELYZA-Shortcut-1.0-Qwen-7B
(7B) | 2025 | Qwen 2.5 (7b) | 事前学習 + SFT | ELYZA | Apache 2.0 | | ELYZA-Diffusion-1.0-Dream-7B
(Base-7B, Instruct-7B) | 2026 | Dream (7b) | 事前学習: 日本語テキスト (約 62B トークン)
Instruction Tuning: 日本語の指示データ (約 0.18B トークン) | ELYZA | Apache 2.0 | | Swallow 7B
(7b-hf, 7b-instruct-hf, 7b-instruct-v0.1, 7b-NVE-hf, 7b-NVE-instruct-hf, 7b-plus-hf) | 2023 | Llama 2 (7b) | 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1
*v0.1モデルでは OASST1, OASST2 を使用 | Swallowプロジェクト | Llama 2 Community License | | LEIA-Swallow-7B
(7b) | 2024 | Llama 2 (7b) | Swallow 7B に対して LEIA で追加学習 | 個人 (山田育矢, 李凌寒) | Llama 2 Community License | | ELYZA-japanese-Llama-2-7b
(7b, 7b-instruct, 7b-fast, 7b-fast-instruct) | 2023 | Llama 2 (7b) | 事前学習: 日本語 Wikipedia, Japanese OSCAR, その他クロールデータなど
(計 18B トークン)
Instruction Tuning: 独自のデータセット | ELYZA | Llama 2 Community License | | Youri 7B
(7b, 7b-instruction, 7b-chat, 7b-gptq, 7b-instruction-gptq, 7b-chat-gptq) | 2023 | Llama 2 (7b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 40B トークン)
Instruction Tuning: Dolly Dataset, FLAN, llm-japanese-datasetの一部 | rinna | Llama 2 Community License | | houou-7b
(instruction-7b-v1, instruction-7b-v2, instruction-7b-v3) | 2023 | Llama 2 (7b) | Youri 7B (base) に対して Instruction Tuning: ichikara-instruction | マネーフォワード | Llama 2 Community License | | Japanese Stable LM Beta 7B
(base-beta-7b, base-ja_vocab-beta-7b, instruct-beta-7b, instruct-ja_vocab-beta-7b) | 2023 | Llama 2 (7b) | 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外)
(計 100B トークン)
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1 | Stability AI | Llama 2 Community License | | SambaLingo-Japanese
(Base, Chat) | 2024 | Llama 2 (7b) | 事前学習: CulturaX
Instruction Tuning: ultrachat_200k
DPO: ultrafeedback, cai-conversation-harmless | SambaNova Systems | Llama 2 Community License (?)[^12] | | blue-lizard
(blue-lizard) | 2024 | Llama 2 (7b) | 不明 | Deepreneur | Llama 2 Community License | | Swallow-MS 7B
(7b-v0.1, 7b-instruct-v0.1) | 2024 | Mistral-7B-v0.1 (7b) | 事前学習: Algebraic Stack, Japanese Wikipedia, RefinedWeb, Swallow Corpus, The Pile
Instruction Tuning: Dolly Dataset, OASST1 | Swallowプロジェクト | Apache 2.0 | | Rakuten AI 2.0
(8x7B, 8x7B-instruct) | 2025 | Mistral-7B-v0.1 (7b) | | 楽天 | Apache 2.0 | | RakutenAI-7B
(7B, 7B-instruct, 7B-chat) | 2024 | Mistral-7B-v0.1 (7b) | 事前学習: 不明
Instruction Tuning: Dolly Dataset, OASST1, (jasterと同様に)言語理解データセットの訓練データを Instruction Tuning 用に変換したもの, 独自のデータセット | 楽天 | Apache 2.0 | | Japanese Stable LM Gamma 7B
(base-gamma-7b, instruct-gamma-7b) | 2023 | Mistral-7B-v0.1 (7b) | 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外)
(計 100B トークン)
Instruction Tuning: Dolly Dataset, HH RLHF, llm-japanese-dataSetのwikinews subset | Stability AI | Apache 2.0 | | ChatNTQ JA 7B
(7b-v1.0) | 2024 | Mistral-7B-v0.1 (7b) | Japanese Stable LM Gamma 7B (base) に対して独自のデータセットで Instruction Tuning | NTQ Solution | Apache 2.0 | | Shisa Gamma 7B
(7b-v1) | 2023 | Mistral-7B-v0.1 (7b) | Japanese Stable LM Gamma 7B (base) に対して ultra-orca-boros-en-ja で Instruction Tuning | AUGMXNT | Apache 2.0 (?)[^12] | | Shisa 7B
(base-7b-v1, 7b-v1) | 2023 | Mistral-7B-v0.1 (7b) | 事前学習: shisa-pretrain-en-ja-v1 (8B トークン)
Instruction Tuning & DPO: ultra-orca-boros-en-ja, shisa-en-ja-dpo-v1 | AUGMXNT | Apache 2.0 (?)[^12] | | Karasu
(7B, 7B-chat, 7B-chat-plus, 7B-chat-plus-unleashed) | 2024 | Mistral-7B-v0.1 (7b) | Shisa 7B (base) に対して以下のデータセットで追加事前学習: 青空文庫, 日本の法律・判例, 日本語 Wikipedia, CulturaX の日本ドメインのデータ, UltraChat 200k (計 7B トークン)
Instruction Tuning: ultra-orca-boros-en-ja-v1, OASST1, ShareGPT, 独自のデータセット | Lightblue | Apache 2.0 (?)[^12] | | Nekomata 7B
(7b, 7b-instruction, 7b-gguf, 7b-instruction-gguf) | 2023 | Qwen (7b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 66B トークン)
Instruction Tuning: Dolly Dataset, FLAN, llm-japanese-datasetの一部 | rinna | Tongyi Qianwen LICENSE | | lightblue/japanese-mpt-7b | 2023 | MPT (7b) | Japanese mC4 | Lightblue | Apache 2.0 | | Japanese Stable LM 3B-4E1T
(3b-4e1t-base, 3b-4e1t-instruct) | 2024 | StableLM-3B-4E1T (3b) | 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外)
(計 100B トークン)
Instruction Tuning: Dolly Dataset, HH RLHF, llm-japanese-datasetのwikinews subset | Stability AI | Apache 2.0 | | kotomamba-2.8B-CL | 2024 | mamba-2.8b-slimpj
(2.8b) | 日本語 Wikipedia, Swallow Corpus, SlimPajama | Kotoba Technologies | Apache 2.0 | | Gemma-2-Llama Swallow 2B
(2b-pt-v0.1, 2b-it-v0.1) | 2025 | Gemma 2 (2b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1 | Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use | | Gemma 2 Baku 2B
(2b, 2b-it) | 2024 | Gemma 2 (2b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 80B トークン)
OPRO: 独自のデータセット [^20] | rinna | Gemma Terms of Use | | Japanese Stable LM 2 1.6B
(base, instruct) | 2024 | Stable LM 2 1.6B (1.6b) | 事前学習: Wikipedia, CulturaX
Instruction Tuning: jaster, ichikara-instruction, alpaca-gpt4-japanese, ultra-orca-boros-en-ja-v1 | Stability AI | STABILITY AI NON-COMMERCIAL RESEARCH COMMUNITY LICENSE | | TinySwallow-1.5B
(1.5B, 1.5B-Instruct, 1.5B-Instruct-q4f32_1-MLC, 1.5B-Insturct-GGUF) | 2025 | Qwen2.5 (1.5b) | 事前学習: Qwen2.5 (32b) を教師として TAID で学習
Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, swallow-magpie-ultra-v0.1, swallow-gemma-magpie-v0.1 | Sakana AI, Swallowプロジェクト | Apache 2.0 | | EQUES/OpenRS3-GRPO-ja | 2025 | Qwen2.5 (1.5b) | TinySwallow-1.5B-Instruct に対して kunishou/OpenMathInstruct-1-1.8m-ja でGRPO学習 | EQUES Inc. | ? | | EQUES/TinyDeepSeek-JP-1.5B | 2025 | Qwen2.5 (1.5b) | TinySwallow-1.5B-Instruct に対して EQUES/japanese_ultrachat_6.6k でTAID蒸留 | EQUES Inc. | Apache 2.0 | | EQUES/TinySwallow-Stratos-1.5B | 2025 | Qwen2.5 (1.5b) | TinySwallow-1.5B-Instruct に対して Bespoke-Stratos-35k で推論能力強化 | EQUES Inc. | Apache 2.0 | | karasu-1.1B | 2023 | TinyLlama (1.1b) | 事前学習: Japanese OSCAR, Japanese mC4
(計 3B トークン) | Lightblue | Apache 2.0 |
ドメイン特化型
| 公開年 | ドメイン | ベースのLLM | 学習テキスト | 開発元 | ライセンス | |
|---|---|---|---|---|---|---|
| Weblab-MedLLM-GLM-4.7 | 2026 | 医療 | GLM-4.7 (355b-A32B) | 医学論文・医学書籍・診療ガイドライン・試験問題などを由来とする独自の合成データで継続事前学習、その後事後学習 | 東大 松尾・岩澤研 | MIT[^28] |
| Weblab-MedLLM-Qwen3-235B | ||||||
| (Instruct, Thinking) | 2026 | 医療 | Qwen3 (235b-A22B) | 医学論文・医学書籍・診療ガイドライン・試験問題などを由来とする独自の合成データで継続事前学習、その後事後学習 | 東大 松尾・岩澤研 | Apache 2.0[^28] |
| Weblab-MedLLM-gpt-oss-120b | 2026 | 医療 | GPT-OSS (120b) | 医学論文・医学書籍・診療ガイドライン・試験問題などを由来とする独自の合成データで継続事前学習、その後事後学習 | 東大 松尾・岩澤研 | Apache 2.0[^28] |
| Medical-GPT-OSS-Swallow-120B | 2026 | 医療 | GPT-OSS (120b) | 生物医学文献・医療合成データ・医療QA・診療ガイドライン等の医療ドメインテキストを中心とした混合データで GPT-OSS Swallow 120B (RL) に継続事前学習 | Swallowプロジェクト | Apache 2.0[^25] |
| pfnet/Preferred-MedLLM-Qwen-72B | 2025 | 医療 | Qwen2.5 (72b) | 独自の医療関連テキストコーパスで継続事前学習 | Preferred Networks | Qwen LICENSE |
| Llama3-Preferred-MedSwallow-70B | ||||||
| (70B) | 2024 | 医療 | Llama 3 (70b) | 医師国家試験(2017年以前)の解説等からなる PFN 独自の医療データセットで学習 | Preferred Networks | Llama 3 Community License |
| AIgroup-CVM-utokyohospital/MedSwallow-70b | 2024 | 医療 | Llama 2 (70b) | 日本語に翻訳した USMLE データセットで Instruction Tuning | 東京大学医学部附属病院 循環器内科 AIグループ | CC BY-NC-SA 4.0 |
| Medical-Qwen3-Swallow-32B | 2026 | 医療 | Qwen3 (32b) | 生物医学文献・医療合成データ・医療QA・診療ガイドライン等の医療ドメインテキストを中心とした混合データで Qwen3 Swallow 32B (RL) に継続事前学習 | Swallowプロジェクト | Apache 2.0[^25] |
| Medical-Qwen3-Swallow-30B-A3B | 2026 | 医療 | Qwen3 (30b-A3B) | 生物医学文献・医療合成データ・医療QA・診療ガイドライン等の医療ドメインテキストを中心とした混合データで Qwen3 Swallow 30B-A3B (RL) に継続事前学習 | Swallowプロジェクト | Apache 2.0[^25] |
| gpt-oss-20b-Ja-Fin | ||||||
| (CPT, Thinking) | 2026 | 金融 | GPT-OSS (20b) | Common Crawl 等の公開ソースから構築した日本語金融コーパス(ドメイン分類・品質フィルタリングを実施)で継続事前学習 | 野村総合研究所 | Apache 2.0 |
| nekomata-14b-pfn-qfin | ||||||
| (qfin, qfin-inst-merge) | 2024 | 金融 | Qwen (14b) | 中央銀行の会見・政策決定会合要旨、金融機関のレポート・用語集・企業情報、Wikipedia の金融記事等からなる金融特化コーパス(約810万文書・約3.7億トークン)で継続事前学習(qfin-inst-merge は instruct モデルとのマージ) | Preferred Networks | Tongyi Qianwen LICENSE |
| Qwen3-14B-Ja-Fin | ||||||
| (CPT, Thinking) | 2026 | 金融 | Qwen3 (14b) | Common Crawl 等の公開ソースから構築した日本語金融コーパス(ドメイン分類・品質フィルタリングを実施)で継続事前学習 | 野村総合研究所 | Apache 2.0 |
| Watashiha-Llama-2-13B-Ogiri-sft | ||||||
| (sft, sft-neuron) | 2024 | 大喜利 | Llama 2 (13b) | 事前学習: C4・CC-100・OSCAR の日本語データ、日英 Wikipedia、独自データ(計 650億トークン) | ||
| SFT: 大喜利データ | わたしは | Llama 2 Community License | ||||
| Medical-Qwen3-Swallow-8B | 2026 | 医療 | Qwen3 (8b) | 生物医学文献・医療合成データ・医療QA・診療ガイドライン等の医療ドメインテキストを中心とした混合データで Qwen3 Swallow 8B (RL) に継続事前学習 | Swallowプロジェクト | Apache 2.0[^25] |
| MedExamDoc-Llama-3.1-Swallow-8B-Instruct-v0.5 | 2025 | 医療 | Llama 3.1 (8b) | JMedBench, KokushiMD-10 を用いて QLoRA でファインチューニング | Ingenta | Llama 3.1 Community License |
| からまる | ||||||
| (Karamaru-v1) | 2025 | 江戸時代の古文 | Llama 3 (8b) | 江戸時代のテキスト約2,500万文字(人間による翻刻 約1,300万字: みんなで翻刻・国文学研究資料館、AI翻刻 約1,200万字: くずし字OCR「RURI」)で継続事前学習 | Sakana AI | Llama 3 Community License |
| Llama 3.1 Future Code Ja 8B | 2025 | コーディング | Llama 3.1 | |||
| (8b) | The Stack v2(コード), LLM-jp Corpus v3(日本語の一部)で継続事前学習(コード 204.9B・自然言語 85.7B トークン) | フューチャー | Llama 3.1 Community License | |||
| JPharmatron | ||||||
| (7B-base, 7B) | 2025 | 薬学 | Qwen2.5 (7b) | 日本語の薬学テキスト(20億トークン)と英語の生物医学テキスト(80億トークン)で継続事前学習 | EQUES Inc. | CC BY-SA 4.0 |
| ELYZA-japanese-CodeLlama-7b | ||||||
| (7b, 7b-instruct) | 2023 | コーディング | Code Llama | |||
| (7b) | 事前学習: OSCAR・Wikipedia・独自クロールデータ等の日本語テキスト(180億トークン) | |||||
| instruct: ELYZA 独自の事後学習(詳細非公開) | ELYZA | Llama 2 Community License | ||||
| AIBunCho/japanese-novel-gpt-j-6b | 2023 | 物語生成 | GPT-J (6b) | 日本語の小説データで追加学習(ベースの日本語 GPT-J は cc100 日本語・Wikipedia・Web データで学習) | 個人 (大曽根宏幸) | CreativeML OpenRAIL-M License |
| NovelAI/genji-jp | 2022 | 物語生成 | GPT-J (6b) | 独自の日本語ストーリーテリングデータセットでファインチューニング | NovelAI | ? |
海外モデルに日本語で事後学習を行ったモデル(継続事前学習なし、または詳細不明)
汎用
| 公開年 | ベースのLLM | 学習テキスト | 開発元 | ライセンス / 利用規約 | |
|---|---|---|---|---|---|
| Rakuten AI 3.0 | |||||
| (RakutenAI-3.0) | 2026 | DeepSeek-V3 (671b) [^24] | 不明 | 楽天 | Apache 2.0 |
| Llama 3.1 Shisa V2 405B | |||||
| (405b) | 2025 | Llama 3.1 (405b) | 高品質な日本語データセットでSFT/DPO | Shisa.AI | Llama 3.1 Community License |
| AXCXEPT/EZO-Qwen2.5-72B-Instruct | |||||
| AXCXEPT/EZO-AutoCoTRAG-Qwen2.5-72B-Instruct_q4 | 2024 | Qwen2.5 (72b) | Axcxept | Qwen License | |
| ao-Karasu | |||||
| (72B) | 2024 | Qwen1.5 (72b) | ultra-orca-boros-en-ja-v1, OASST1, ShareGPT, 日本語の公開技術ブログ, ニュース記事, QAサイトの回答, 独自のデータセット | Lightblue | Tongyi Qianwen LICENSE (?)[^12] |
| Shisa V2.1 70B | |||||
| (70b) | 2025 | Llama 3.3 (70b) | SFT/DPO/強化学習/モデルマージを組み合わせた学習 | Shisa.AI | Llama 3.3 Community License |
| shisa-ai/shisa-v2-llama3.3-70b | 2025 | Llama 3.3 (70b) | Shisa.AI | Llama 3.3 Community License | |
| AXCXEPT/Llama-3.1-70B-EZO-1.1-it | 2024 | Llama 3.1 (70b) | Axcxept | Llama 3.1 Community License | |
| Llama 3 shisa-v1-llama3-70b | |||||
| (70b) | 2024 | Llama 3 (70b) | ultra-orca-boros-en-ja-v1 | Shisa.AI | Llama 3 Community License (?)[^12] |
| AIgroup-CVM-utokyohospital/Llama-2-70b-chat-4bit-japanese | 2023 | Llama 2 (70b) | 東京大学医学部附属病院 循環器内科 AIグループ | Llama 2 Community License | |
| doshisha-mil/llama-2-70b-chat-4bit-japanese-v1 | 2023 | Llama 2 (70b) | 同志社大学 メディア情報学研究室 | ? | |
| cyberagent/DeepSeek-R1-Distill-Qwen-32B-Japanese | 2025 | DeepSeek-R1-Distill-Qwen (32b) | サイバーエージェント | MIT | |
| Flux-Japanese-Qwen2.5-32B-Instruct-V1.0 | |||||
| (V1.0) | 2025 | Qwen2.5-32B-Instruct (32b) | Precise-tuning: 日本語の知識・推論・言語回路をピンポイント特定し、パラメータの5%のみに対して調整を実施。3つの専門モデルを作成後、ピンポイントマージで統合 | FLUX | Apache 2.0 |
| karakuri-ai/karakuri-lm-32b-thinking-2501-exp | 2025 | QwQ (32b) | カラクリ | Apache 2.0 | |
| shisa-ai/shisa-v2-qwen2.5-32b | 2025 | Qwen2.5 (32b) | Shisa.AI | Apache 2.0 | |
| AXCXEPT/EZO-Qwen2.5-32B-Instruct | |||||
| AXCXEPT/EZO-AutoCoTRAG-Qwen2.5-32B-Instruct | 2024 | Qwen2.5 (32b) | Axcxept | Apache 2.0 | |
| cyberagent/DeepSeek-R1-Distill-Qwen-14B-Japanese | 2025 | DeepSeek-R1-Distill-Qwen (14b) | サイバーエージェント | MIT | |
| Shisa V2.1 14B | |||||
| (14b) | 2025 | Phi-4 (14b) | SFT/DPO/強化学習/モデルマージを組み合わせた学習 | Shisa.AI | MIT |
| shisa-ai/shisa-v2-unphi4-14b | 2025 | Phi-4 (14b) | Shisa.AI | MIT | |
| EZO-Phi-4 | |||||
| (phi-4-open-R1-Distill-EZOv1, phi-4-deepseek-R1K-RL-EZO) | 2025 | Phi-4 (14b) | Axcxept | MIT | |
| Qarasu | |||||
| (14B-chat-plus-unleashed) | 2024 | Qwen (14b) | ultra-orca-boros-en-ja-v1, OASST1, ShareGPT, 独自のデータセット | Lightblue | Tongyi Qianwen LICENSE (?)[^12] |
| Sparticle/llama-2-13b-chat-japanese-lora | 2023 | Llama 2 (13b) | Sparticle | ? | |
| izumi-lab/llama-13b-japanese-lora-v0-1ep | 2023 | Llama (13b) | 東大 和泉研 | ? | |
| shisa-ai/shisa-v2-mistral-nemo-12b | 2025 | Mistral NeMo (12b) | Shisa.AI | Apache 2.0 | |
| AXCXEPT/EZO-Common-9B-gemma-2-it | 2024 | Gemma 2 (9b) | Axcxept | Gemma Terms of Use | |
| AXCXEPT/EZO-Humanities-9B-gemma-2-it | 2024 | Gemma 2 (9b) | Axcxept | Gemma Terms of Use | |
| CAT-Thinking | |||||
| (8B) | 2026 | Qwen3 (8b) | SFT (gpt-oss-120bで生成しCAT-Translate-7bで日本語化した数学・コーディングデータ) / GRPO | サイバーエージェント | Apache 2.0 |
| Shisa V2.1 8B | |||||
| (8b) | 2025 | Qwen3 (8b) | SFT/DPO/強化学習/モデルマージを組み合わせた学習 | Shisa.AI | Apache 2.0 |
| AXCXEPT/Qwen3-EZO-8B-beta | 2025 | Qwen3 (8b) | Deep-Think技術による高性能推論 | Axcxept | Apache 2.0 |
| shisa-ai/shisa-v2-llama3.1-8b | 2025 | Llama 3.1 (8b) | Shisa.AI | Llama 3.1 Community License | |
| AXCXEPT/Llama-3.1-8B-EZO-1.1-it | 2024 | Llama 3.1 (8b) | Axcxept | Llama 3.1 Community License | |
| Llama 3 Suzume 8B | |||||
| (8B-japanese, 8B-japanese-gguf) | 2024 | Llama 3 (8b) | megagonlabs/instruction_ja, ShareGPT, 独自のデータセット | Lightblue | Llama 3 Community License (?)[^12] |
| Llama 3 shisa-v1-llama3-8b | |||||
| (8b) | 2024 | Llama 3 (8b) | ultra-orca-boros-en-ja-v1 | Shisa.AI | Llama 3 Community License (?)[^12] |
| AXCXEPT/Llama-3-EZO-8b-Common-it | 2024 | Llama 3 (8b) | Axcxept | Llama 3 Community License | |
| lightblue/DeepSeek-R1-Distill-Qwen-7B-Japanese | 2025 | DeepSeek-R1-Distill-Qwen (7b) | Lightblue | Apache 2.0 | |
| ABEJA-Qwen2.5-7b-Japanese-v0.1 | |||||
| (v0.1) | 2025 | Qwen 2.5 (7b) | ABEJA | Apache 2.0 | |
| shisa-ai/shisa-v2-qwen2.5-7b | 2025 | Qwen 2.5 (7b) | Shisa.AI | Apache 2.0 | |
| Karasu DPO | |||||
| (7B) | 2025 | Qwen 2.5 (7b) | Lightblue | Apache 2.0 | |
| ganchengguang/Yoko-7B-Japanese-v1 | 2023 | Llama 2 (7b) | 横浜国大 森研 | ? | |
| Sparticle/llama-2-7b-chat-japanese-lora | 2023 | Llama 2 (7b) | Sparticle | ? | |
| izumi-lab/llama-7b-japanese-lora-v0-5ep | 2023 | Llama (7b) | 東大 和泉研 | ? | |
| lightblue/jod | 2023 | Mistral-7B-SlimOrca (7b) | Lightblue | Apache 2.0 | |
| NTQAI/chatntq-7b-jpntuned | 2023 | RWKV-4 World (7b) | NTQ Solution | ? | |
| Qwen3.5-FT-Japanese-CoT-4B | 2026 | Qwen3.5 (4b) | 不明 | 個人 (Aname-Tommy) | MIT |
| Borea | |||||
| (Jp, Common, Coding) | 2024 | Phi-3.5 (3.8b) | Axcxept | MIT | |
| Shisa V2.1 3B | |||||
| (3b) | 2025 | Llama 3.2 (3b) | SFT/DPO/強化学習/モデルマージを組み合わせた学習 | Shisa.AI | Llama 3.2 Community License |
| AXCXEPT/EZO-Llama-3.2-3B-Instruct-dpoE | 2024 | Llama 3.2 (3b) | Axcxept | Llama 3.2 Community License | |
| 日本語版 Gemma 2 2B | |||||
| (2b-jpn-it) | 2024 | Gemma 2 (2b) | Gemma Terms of Use | ||
| AXCXEPT/EZO-gemma-2-2b-jpn-it | 2024 | Gemma 2 (2b) | Axcxept | Gemma Terms of Use | |
| AXCXEPT/EZO-Common-T2-2B-gemma-2-it | 2024 | Gemma 2 (2b) | Axcxept | Gemma Terms of Use | |
| Shisa V2.1 1.2B | |||||
| (1.2b) | 2025 | LFM2 (1.2b) | SFT/DPO/強化学習/モデルマージを組み合わせた学習 | Shisa.AI | LFM Open License v1.0 |
| LFM2.5-1.2B-JP | |||||
| (1.2B-JP, 1.2B-JP-202606) | 2026 | LFM2.5 (1.2b) | 不明 | Liquid AI | LFM Open License v1.0 |
| Qwen3.5-FT-Japanese-CoT-0.8B | 2026 | Qwen3.5 (0.8b) | 不明 | 個人 (Aname-Tommy) | MIT |
ドメイン特化型
| 公開年 | ドメイン | ベースのLLM | 開発元 | ライセンス | |
|---|---|---|---|---|---|
| JMedLoRA | |||||
| (llama2-jmedlora-30000) | 2023 | 医療 | Llama 2 (70b) | 東京大学医学部附属病院 循環器内科 AIグループ | CC BY-NC 4.0 |
| pfnet/Qwen3-1.7B-pfn-qfin | 2025 | 金融 | Qwen3 (1.72b) | Preferred Networks | PLaMo Community License |
| pfnet/Qwen2.5-1.5B-pfn-qfin | 2025 | 金融 | Qwen2.5 (1.54b) | Preferred Networks | PLaMo Community License |
複数のLLMをマージして作成されたモデル
| 公開年 | マージ元のLLM(太字は日本語LLM) | 開発元 | ライセンス | |
|---|---|---|---|---|
| EQUES/MedLLama3-JP-v2 | 2024 | Llama 3 Swallow 8B (Instruct), OpenBioLLM-8B, MMed-Llama 3 8B, Llama 3 ELYZA JP 8B | EQUES | Llama 3 Community License |
| EvoLLM-JP-A | ||||
| (v1-7B) | 2024 | Shisa Gamma 7B (v1), Arithmo2 Mistral 7B, Abel 7B 002 | Sakana AI | Apache 2.0 |
| EvoLLM-JP | ||||
| (v1-7B, v1-10B) | 2024 | Shisa Gamma 7B (v1), WizardMath-7B-V1.1, Abel 7B 002 | Sakana AI | MICROSOFT RESEARCH LICENSE |
| EQUES/TinyQwens-Merge-1.5B | 2025 | SakanaAI/TinySwallow-1.5B-Instruct, EQUES/TinySwallow-Stratos-1.5B, deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B, Qwen/Qwen2.5-1.5B-Instruct | EQUES Inc. | Apache 2.0 |
APIとして提供されているモデル
| | 公開年 | 入出力で扱える
トークン数 | 開発元 | プラットフォーム |
|:---|:---:|:---:|:---:|:---:|
| Sakana Namazu
(sakana-namazu) | 2026 | 262,144 | Sakana AI | 独自 |
| Syn
(Syn, Syn Pro) | 2025 | 32,768 | カラクリ, Upstage | AWS Marketplace (SageMaker) |
| tsuzumi
(tsuzumi-7b, tsuzumi 2) | 2025 | | NTT | Microsoft Foundry |
| PLaMo API | 2024 | 32,768 | Preferred Networks | 独自 |
| LHTM-OPT | 2024 | | オルツ | AWS Marketplace (SageMaker) |
| AIのべりすと | 2021 | 2,400 ~ 8,192 | Bit192 | 独自 |
入力テキストの処理に主に使うモデル
汎用
| 公開年 | アーキテクチャ | 入力で扱えるトークン数 | 学習テキスト | 開発元 | ライセンス | HuggingFace ですぐ使える? [^4] | |
|---|---|---|---|---|---|---|---|
| ModernBERT-Ja | 2025 | ModernBERT | 8,192 | 日本語・英語データ | SB Intuitions | MIT | ◯ (30m, 70m, 130m, 310m) |
| llm-jp-modernbert | 2025 | ModernBERT | 8,192 | llm-jp-corpus-v4 の日本語サブセット(約0.69Tトークン) | 大規模言語モデル研究開発センター | Apache 2.0 | ◯ |
| 京大BERT | 2020 | BERT (base, large) | 512 | 日本語 Wikipedia (約1,800万文) | 京大 言語メディア研究室 | Apache 2.0 | △ |
| 東北大BERT | 2023 | BERT (base, large) | 512 | base (v1): | |||
| 日本語 Wikipedia 約1,700万文 (2.6GB) | |||||||
| base (v2) & large: | |||||||
| 日本語 Wikipedia 約3,000万文 (4.0GB) | |||||||
| base (v3) & large (v2): | |||||||
| 日本語 Wikipedia 約3,400万文 (4.9GB) |
- 日本語 CC-100 約3億9,200万文 (74.3GB) | 東北大
自然言語処理研究グループ | base (v1, v2) & large: CC BY-SA 3.0
base (v3) & large (v2): Apache 2.0 |◯ (base (v1), base (v1, 文字レベル), base (v2), base (v2, 文字レベル), large, large (文字レベル), base (v3), base (v3, 文字レベル), large (v2), large (v2, 文字レベル)) | | TohokuNLP BERT-alpha 500M | 2024 | Llama ベースのエンコーダ[^23] | 4,096
または
8,192 | llm-jp-corpus-v3 の日本語サブセット | 東北大
自然言語処理研究グループ | Apache 2.0 | ◯ (sq4096-alpha, sq8192-alpha) | | ByBERT-JP | 2025 | Llama ベースのエンコーダ[^23] | 100m, 200m, 400m: 3,072
v2-100m: 4,096 | llm-jp-corpus-v3 のサブセット
100m: 623B トークン
200m: 637B トークン
400m: 1.23T トークン
v2-100m: 2.76T トークン | 東北大
自然言語処理研究グループ | Apache 2.0 | ◯ (100m, 200m, 400m, v2-100m) | | NICT BERT | 2020 | BERT (base) | 512 | 日本語 Wikipedia | NICT | CC BY 4.0 | △ | | Laboro BERT | 2020 | BERT (base, large) | 512 | 日本語 Web コーパス
(ニュースサイトやブログなど
計4,307のWebサイト、2,605,280ページ (12GB)) | Laboro.AI | CC BY-NC 4.0 | ✕ | | colorfulscoop BERT | 2021 | BERT (base) | 512 | 日本語 Wikipedia | Colorful Scoop | CC BY-SA 3.0 | ◯ | | 東大BERT | 2021 | BERT (small) | 512 | 日本語 Wikipedia (約2,000万文 (2.9GB)) | 東大 和泉研 | CC BY-SA 4.0 | ◯ | | chiTra (Sudachi Transformers) | 2022 | BERT (base) | 512 | 国語研日本語ウェブコーパス (NWJC) (148GB) | NINJAL, ワークス徳島人工知能NLP研 | Apache 2.0 | △ | | ACCMS BERT | 2023 | BERT (base) | 512 | 日本語 Wikipedia (3.3GB) | 京大 ACCMS | CC BY-SA 4.0 | ◯ | | 日立BERT | 2023 | BERT (base) | 512 | 日本語 Wikipedia - Japanese CC-100 | 日立製作所 | CC BY-NC-SA 4.0 | ◯ [^6] | | RetrievaBERT | 2024 | BERT [^5] | 2,048 | Japanese CommonCrawl, RefinedWeb, Chinese Wikipedia, Korean Wikipedia, The Stack | レトリバ | Apache 2.0 | ◯ | | Bandai Namco DistilBERT | 2020 | DistilBERT | 512 | - (東北大BERT(base) を親モデルとして知識蒸留) | Bandai Namco Research | MIT | ◯ | | Laboro DistilBERT | 2020 | DistilBERT | 512 | - (Laboro BERT(base) を親モデルとして知識蒸留)| Laboro.AI | CC BY-NC 4.0 | ◯ | | LINE DistilBERT | 2023 | DistilBERT | 512 | - (LINE社内のBERTを親モデルとして知識蒸留)| LINE | Apache 2.0 | ◯ | | rinna RoBERTa | 2021 | RoBERTa (base) | 512 | 日本語 Wikipedia
- Japanese CC-100 | rinna | MIT | ◯ | | 早大RoBERTa | 2022 | RoBERTa (base, large) | 512 | 日本語 Wikipedia
- Japanese CC-100 | 早大 河原研 | CC BY-SA 4.0 | ◯ (base, large, large (seq512)) [^7] | | インフォマティクスRoBERTa | 2022 | RoBERTa (base) | 512 | 日本語 Wikipedia
- Web 上の記事 (計25GB) | インフォマティクス | Apache 2.0 | △ | | 京大RoBERTa | 2022 | RoBERTa (base, large) | 512 | 日本語 Wikipedia
- Japanese CC-100 | 京大 言語メディア研究室 | CC BY-SA 4.0 | ◯ (base (文字レベル), large (文字レベル)) |
| 横浜国大RoBERTa | 2022 | RoBERTa (base) | 512 | 日本語 Wikipedia (3.45GB) | 横浜国大 森研 | Apache 2.0 | ◯ |
| Megagon Labs RoBERTa | 2022 | RoBERTa (base) [^8] | 1,282 | Japanese mC4 (約2億文) | Megagon Labs
(リクルート) | MIT | ◯ | | ACCMS RoBERTa | 2023 | RoBERTa (base) | 512 | 日本語 Wikipedia (3.3GB) + Japanese CC-100 (70GB) | 京大 ACCMS | CC BY-SA 4.0 | ◯ | | シナモンELECTRA | 2020 | ELECTRA (small) | 512 | 日本語 Wikipedia | シナモン | Apache 2.0 | ◯ | | Megagon Labs ELECTRA | 2021 | ELECTRA (base) | 512 | Japanese mC4 (約2億文) | Megagon Labs
(リクルート) | MIT | ◯ | | 東大ELECTRA | 2021 | ELECTRA (small, base) | 512 | 日本語 Wikipedia (約2,000万文 (2.9GB)) | 東大 和泉研 | CC BY-SA 4.0 | ◯ (small, base) | | 日本語RoFormer | 2022 | RoFormer (base) | 512 | 日本語 Wikipedia (3.45GB) | 横浜国大 森研 | Apache 2.0 | ◯ | | 日本語LUKE | 2022 | LUKE (base, large) | 512 | 日本語 Wikipedia | Studio Ousia | Apache 2.0 | ◯ (base, large) | | 京大DeBERTaV2 | 2023 | DeBERTaV2 (tiny, base, large) | 512 | 日本語 Wikipedia - Japanese CC-100
- Japanese OSCAR
(計171GB) | 京大 言語メディア研究室 | CC BY-SA 4.0 | ◯ (tiny, tiny (文字レベル), base, large) | | 京大DeBERTaV3 | 2024 | DeBERTaV3 (base) | 512 | llm-jp-corpus | 京大 言語メディア研究室 | Apache 2.0 | ◯ | | 東大DeBERTaV2 | 2023 | DeBERTaV2 (small, base) | 512 | 日本語 Wikipedia, 日本語 Wikinews, Japanese CC-100, Japanese mC4, Japanese OSCAR | 東大 和泉研 | CC BY-SA 4.0 | ◯ (small, base) | | GLOBIS DeBERTaV3 | 2023 | DeBERTaV3 (xsmall, base, large) | 512 | Wikipedia, WikiBooks, 青空文庫, Japanese CC-100, Japanese mC4, Japanese OSCAR | グロービス | CC BY-SA 4.0 | ◯ (xsmall, base, large) | | 日本語BigBird | 2023 | BigBird (base) | 4,096 | 日本語 Wikipedia - Japanese CC-100
- Japanese OSCAR | 早大 河原研 | CC BY-SA 4.0 | ◯ | | 日本語LayoutLM | 2024 | LayoutLM (base) | 512 | 東北大BERT (base, v2) で重みを初期化した上で、日本語 Wikipedia の文章とレイアウトで事前学習 | 日本総合研究所 | CC BY-SA 3.0 | ◯ | | layoutlmv3-japanese-preview | 2026 | LayoutLMv3 (base) | 512 | 早大RoBERTa (base) で重みを初期化した上で、NDL WARP の日本語Webページ(約2,000万件)と文書画像(PubLayNet, DocLayNet)で事前学習 | 大規模言語モデル研究開発センター | Apache 2.0 | ◯ |
ドメイン特化型
| 公開年 | ドメイン | アーキテクチャ | 学習テキスト | 開発元 | ライセンス | HuggingFace ですぐ使える? | |
|---|---|---|---|---|---|---|---|
| 日本語ブログELECTRA | 2022 | 口語 | ELECTRA (small) | 日本語ブログコーパス(3億5,400万文) | 北見工大 桝井・プタシンスキ研 | CC BY-SA 4.0 | ◯ |
| 日本語話し言葉BERT | 2021 | 話し言葉 | BERT (base) | 東北大BERTに対して日本語話し言葉コーパス(CSJ)を用いて追加学習 | |||
| (DAPTモデルでは国会議事録データも使用) | レトリバ | Apache 2.0 | ◯ | ||||
| AcademicRoBERTa | 2023 | 学術 | RoBERTa (base) | CiNii の日本語論文 (約628万文) | 愛媛大 人工知能研究室 | Apache 2.0 | ◯ |
| local-politics-BERT | 2024 | 政治 | BERT (base) | Wikipedia, 国会会議録, 地方議会会議録 | 地方議会会議録コーパスプロジェクト | CC BY-SA 4.0 | ◯ (SC-min, SC-minwiki, SC-2M-wiki, SC-2M-min, SC-2M-minwiki, FP-min, FP-minwiki) [^18] |
| UBKE-LUKE | 2024 | 経済 | LUKE (base) | 日本語 Wikipedia, 有価証券報告書, 経済ニュース記事 | ユーザベース | CC BY-NC | ◯ |
| 日本語金融BERT | 2022 | 金融 | BERT (small, base) [^9] | 日本語 Wikipedia |
- 日本語金融コーパス (約2,700万文 (5.2GB)) | 東大 和泉研 | CC BY-SA 4.0 |◯ (small, base) | | 日本語金融ELECTRA | 2021 | 金融 | ELECTRA (small) | 日本語 Wikipedia (約2,000万文 (2.9GB))
- 日本語金融コーパス (約2,700万文 (5.2GB)) | 東大 和泉研 | CC BY-SA 4.0 | ◯ | | 日本語ニュースBERT | 2019 | ビジネス | BERT (base) | 日本語ビジネスニュース記事(300万記事) | ストックマーク | CC BY 4.0 | △ | | 日本語ニュースXLNet | 2019 | ビジネス | XLNet (base) | 日本語ビジネスニュース記事(300万記事) | ストックマーク | ? | ※ 非公式の HuggingFace 向けに変換されたモデルが公開されている | | 日本語ニュースALBERT | 2020 | ビジネス | ALBERT (base) | 日本語ビジネスニュース記事(300万記事) | ストックマーク | ? | △ | | みんぱくBERT | 2023 | 文化財 | BERT (base) | 東北大BERTに対して国立民族学博物館の文化財データで追加学習 | 兵庫県立大学 大島研 | MIT | ◯ (minpaku-v1, minpaku-v3, minpaku-v3-no-additional-token) | | JPharmaBERT | 2025 | 薬学 | BERT (base, large) | 日本語薬学文書 (2Bトークン)
- PubMed英語要旨 (8Bトークン)
- 薬学関連多言語データ (1.2Bトークン) | EQUES | 不明 | ◯ (base, large) | | medBERTjp | 2020 | 医療 | BERT (base) | 日本語 Wikipedia
- 日本語医療コーパス(『今日の診療プレミアム』Web版) | 阪大病院
医療情報学研究室 | CC BY-NC-SA 4.0 | △ | | JMedRoBERTa | 2022 | 医療 | RoBERTa (base) | 日本語医学論文 (約1,100万文 (1.8GB)) | NII 相澤研 | CC BY-NC-SA 4.0 | ◯ (万病WordPiece, SentencePiece) [^10] |
埋め込み (Embeddings) 作成に特化したモデル [^21]
Bi-Encoders
Single-representation bi-encoders
Multi-representation bi-encoders
| 公開年 | 開発元 | ライセンス | |
|---|---|---|---|
| JaColBERTv2.5 | |||
| (JaColBERTv2.4, JaColBERTv2.5) | 2024 | Answer.AI | MIT |
| JaColBERTv2 | |||
| (JaColBERTv2) | 2024 | 個人 (Benjamin Clavié) | MIT |
| JaColBERT | |||
| (JaColBERT) | 2023 | 個人 (Benjamin Clavié) | MIT |
Cross-Encoders
| 公開年 | 開発元 | ライセンス | |
|---|---|---|---|
| Ruri-v3 Reranker | |||
| (310m) | 2025 | 名大 笹野研 | Apache 2.0 |
| Ruri-Reranker | |||
| (stage1-small, stage1-base, stage1-large, small, base, large) | 2024 | 名大 笹野研 | Apache 2.0 |
| hotchpotch/japanese-reranker-cross-encoder-xsmall-v1 | |||
| hotchpotch/japanese-reranker-cross-encoder-small-v1 | |||
| hotchpotch/japanese-reranker-cross-encoder-base-v1 | |||
| hotchpotch/japanese-reranker-cross-encoder-large-v1 | |||
| hotchpotch/japanese-bge-reranker-v2-m3-v1 | 2024 | 個人 (舘野祐一) | MIT |
視覚言語モデル (Vision-Language Models)
画像+テキストからのテキスト生成
スクラッチ学習モデル
※LLMと視覚エンコーダを組み合わせて新規に構築されたVLMが該当します (ベースのLLMは国内モデル/海外モデルを問いません)
汎用
| 公開年 | アーキテクチャ | 学習画像/テキスト | 開発元 | ライセンス / 利用規約 | |
|---|---|---|---|---|---|
| Stockmark-2-VL-100B-beta | |||||
| (100B-beta) | 2025 | LLaVA-OneVision | 3段階学習: アライメント事前学習、キャプション拡張、インストラクション・推論ファインチューニング | ||
| 合成データ: Qwen2.5-VL-72B から生成 | ストックマーク | Qwen License | |||
| Llama-3.1-70B-Instruct-multimodal-JP-Graph | |||||
| (v0.1) | 2025 | LLaVA (Llama-3.1-Swallow-70B-Instruct-v0.3 + Qwen2-VL-7B-Instruct) | 図表・グラフ理解特化の600万枚超の合成視覚データ (文字、円グラフ、棒グラフ、フローチャートなど)、実データ (FastLabel 協力) | リコー | Llama 3.1 Community License & Gemma Terms of Use & Qwen License & MIT & Apache 2.0 |
| KARAKURI VL | |||||
| (32b-instruct-2507, 32b-thinking-2507-exp) | 2025 | Vision-Language (Qwen2.5-VL-32B ベース) | 日本語コンピュータユース特化のカスタムデータセット: 日本語コンピュータ操作記録、日本語文書画像QA、視覚情報解釈、日本語OCR、フローチャート理解 | ||
| 3段階学習: Supervised Fine-Tuning (SFT) + モデルマージ + 強化学習 | |||||
| *thinking モデルは Chain of Thought (CoT) アプローチによる推論プロセス明示 | カラクリ | Apache 2.0 | |||
| Heron-NVILA | |||||
| (1B, 2B, 15B, 33B) | 2025 | NVILA | 3段階学習: アライメント (558k日本語画像テキストペア + 595k LLaVA-Pretrain)、事前学習 (MOMIJI 13M、日本語画像テキストペア 6M、日本語インターリーブデータ 2M、coyo-700m 6M、mmc4-core 4M、Wikipedia-ja、LLaVA-Pretrain-JA、STAIR captions)、教師ありファインチューニング (LLaVA-instruct-v1.5-en、LLaVA-instruct-ja、日本語写真会話、JA-VG-VQA会話、SynthDog-ja、AI2D、SynthDog-en、Sherlock) | Turing | Apache 2.0 & OpenAI Terms of Use |
| NABLA-VL | |||||
| (15B) | 2025 | microsoft/phi-4 + HuggingFaceM4/siglip-so400m-14-980-flash-attn2-navit | 単一画像 |