Skip to content

Commit 7356963

Browse files
committed
update
1 parent 6c3799f commit 7356963

10 files changed

Lines changed: 91 additions & 178 deletions

File tree

swift/llm/model/constant.py

Lines changed: 0 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -41,8 +41,6 @@ class LLMModelType:
4141
glm4 = 'glm4'
4242
glm4_0414 = 'glm4_0414'
4343
glm4_5 = 'glm4_5'
44-
glm4_7 = 'glm4_7'
45-
glm4_z1_rumination = 'glm4_z1_rumination'
4644

4745
glm_edge = 'glm_edge'
4846
codefuse_codegeex2 = 'codefuse_codegeex2'

swift/llm/model/model/bert.py

Lines changed: 1 addition & 4 deletions
Original file line numberDiff line numberDiff line change
@@ -27,7 +27,6 @@ def get_model_tokenizer_modern_bert(model_dir, *args, **kwargs):
2727
Model('answerdotai/ModernBERT-large', 'answerdotai/ModernBERT-large'),
2828
])
2929
],
30-
None,
3130
get_model_tokenizer_modern_bert,
3231
requires=['transformers>=4.48'],
3332
tags=['bert']))
@@ -52,7 +51,6 @@ def _normalizer_hook(module, input, output):
5251
[ModelGroup([
5352
Model('iic/gte-modernbert-base', 'Alibaba-NLP/gte-modernbert-base'),
5453
])],
55-
None,
5654
get_model_tokenizer_gte_bert,
5755
requires=['transformers>=4.48'],
5856
tags=['bert', 'embedding']))
@@ -69,8 +67,8 @@ def get_model_tokenizer_gte_bert_reranker(*args, **kwargs):
6967
[ModelGroup([
7068
Model('iic/gte-reranker-modernbert-base', 'Alibaba-NLP/gte-reranker-modernbert-base'),
7169
])],
72-
TemplateType.bert,
7370
get_model_tokenizer_gte_bert_reranker,
71+
template=TemplateType.bert,
7472
requires=['transformers>=4.48'],
7573
tags=['bert', 'reranker']))
7674

@@ -79,6 +77,5 @@ def get_model_tokenizer_gte_bert_reranker(*args, **kwargs):
7977
BertModelType.bert, [ModelGroup([
8078
Model('iic/nlp_structbert_backbone_base_std'),
8179
])],
82-
None,
8380
get_model_tokenizer_from_local,
8481
tags=['bert']))

swift/llm/model/model/codefuse.py

Lines changed: 3 additions & 3 deletions
Original file line numberDiff line numberDiff line change
@@ -18,8 +18,8 @@
1818
Model('codefuse-ai/CodeFuse-QWen-14B', 'codefuse-ai/CodeFuse-QWen-14B'),
1919
]),
2020
],
21-
TemplateType.codefuse,
2221
get_model_tokenizer_qwen,
22+
template=TemplateType.codefuse,
2323
architectures=['QWenLMHeadModel'],
2424
model_arch=ModelArch.qwen,
2525
tags=['coding']))
@@ -30,8 +30,8 @@
3030
[
3131
ModelGroup([Model('codefuse-ai/CodeFuse-CodeGeeX2-6B', 'codefuse-ai/CodeFuse-CodeGeeX2-6B')], ),
3232
],
33-
TemplateType.codefuse,
3433
get_model_tokenizer_chatglm,
34+
template=TemplateType.codefuse,
3535
architectures=['ChatGLMModel', 'ChatGLMForConditionalGeneration'],
3636
model_arch=ModelArch.chatglm,
3737
tags=['coding'],
@@ -60,8 +60,8 @@ def get_model_tokenizer_codellama(model_dir: str,
6060
tags=['coding'],
6161
),
6262
],
63-
TemplateType.codefuse_codellama,
6463
get_model_tokenizer_codellama,
64+
template=TemplateType.codefuse_codellama,
6565
model_arch=ModelArch.llama,
6666
architectures=['LlamaForCausalLM'],
6767
))

swift/llm/model/model/deepseek.py

Lines changed: 44 additions & 58 deletions
Original file line numberDiff line numberDiff line change
@@ -38,8 +38,8 @@
3838
tags=['coding'],
3939
),
4040
],
41-
TemplateType.deepseek,
4241
get_model_tokenizer_with_flash_attn,
42+
template=TemplateType.deepseek,
4343
architectures=['LlamaForCausalLM'],
4444
model_arch=ModelArch.llama))
4545

@@ -69,8 +69,8 @@ def get_model_tokenizer_deepseek_moe(model_dir: str,
6969
Model('deepseek-ai/deepseek-moe-16b-base', 'deepseek-ai/deepseek-moe-16b-base'),
7070
], ),
7171
],
72-
TemplateType.deepseek,
7372
get_model_tokenizer_deepseek_moe,
73+
template=TemplateType.deepseek,
7474
architectures=['DeepseekForCausalLM'],
7575
))
7676

@@ -87,9 +87,12 @@ def get_model_tokenizer_deepseek_moe(model_dir: str,
8787
Model('deepseek-ai/DeepSeek-V2-Lite-Chat', 'deepseek-ai/DeepSeek-V2-Lite-Chat'),
8888
Model('deepseek-ai/DeepSeek-V2', 'deepseek-ai/DeepSeek-V2'),
8989
Model('deepseek-ai/DeepSeek-V2-Chat', 'deepseek-ai/DeepSeek-V2-Chat'),
90-
]),
90+
], TemplateType.deepseek),
91+
ModelGroup([
92+
Model('deepseek-ai/DeepSeek-V2.5', 'deepseek-ai/DeepSeek-V2.5'),
93+
Model('deepseek-ai/DeepSeek-V2.5-1210', 'deepseek-ai/DeepSeek-V2.5-1210')
94+
], TemplateType.deepseek_v2_5)
9195
],
92-
TemplateType.deepseek,
9396
get_model_tokenizer_deepseek_moe,
9497
architectures=['DeepseekV2ForCausalLM'],
9598
model_arch=ModelArch.deepseek_v2,
@@ -98,47 +101,56 @@ def get_model_tokenizer_deepseek_moe(model_dir: str,
98101

99102
register_model(
100103
ModelMeta(
101-
LLMModelType.deepseek_v2_5,
104+
LLMModelType.deepseek_v3,
102105
[
103106
ModelGroup([
104-
Model('deepseek-ai/DeepSeek-V2.5', 'deepseek-ai/DeepSeek-V2.5'),
105-
Model('deepseek-ai/DeepSeek-V2.5-1210', 'deepseek-ai/DeepSeek-V2.5-1210'),
106107
Model('deepseek-ai/DeepSeek-V3-Base', 'deepseek-ai/DeepSeek-V3-Base'),
107108
Model('deepseek-ai/DeepSeek-V3', 'deepseek-ai/DeepSeek-V3'),
108109
Model('deepseek-ai/DeepSeek-V3-0324', 'deepseek-ai/DeepSeek-V3-0324'),
109-
]),
110+
], TemplateType.deepseek_v2_5),
110111
ModelGroup([
111112
Model('cognitivecomputations/DeepSeek-V3-awq', 'cognitivecomputations/DeepSeek-V3-AWQ'),
112113
Model('cognitivecomputations/DeepSeek-V3-0324-AWQ', 'cognitivecomputations/DeepSeek-V3-0324-AWQ')
113-
]),
114+
], TemplateType.deepseek_v2_5),
114115
ModelGroup([
115116
Model('deepseek-ai/DeepSeek-Prover-V2-7B', 'deepseek-ai/DeepSeek-Prover-V2-7B'),
116117
Model('deepseek-ai/DeepSeek-Prover-V2-671B', 'deepseek-ai/DeepSeek-Prover-V2-671B'),
117-
]),
118+
], TemplateType.deepseek_v2_5),
118119
ModelGroup([
119120
Model('unsloth/DeepSeek-V3-bf16', 'unsloth/DeepSeek-V3-bf16'),
120121
Model('unsloth/DeepSeek-V3-0324-BF16', 'unsloth/DeepSeek-V3-0324-BF16'),
121122
Model('unsloth/DeepSeek-Prover-V2-671B-BF16', 'unsloth/DeepSeek-Prover-V2-671B-BF16'),
122-
])
123-
],
124-
TemplateType.deepseek_v2_5,
125-
get_model_tokenizer_deepseek_moe,
126-
architectures=['DeepseekV2ForCausalLM', 'DeepseekV3ForCausalLM'],
127-
model_arch=ModelArch.deepseek_v2,
128-
requires=['transformers>=4.39.3'],
129-
))
130-
131-
register_model(
132-
ModelMeta(
133-
LLMModelType.deepseek_v3_1,
134-
[
123+
], TemplateType.deepseek_v2_5),
124+
ModelGroup([
125+
Model('deepseek-ai/DeepSeek-R1', 'deepseek-ai/DeepSeek-R1'),
126+
Model('deepseek-ai/DeepSeek-R1-Zero', 'deepseek-ai/DeepSeek-R1-Zero'),
127+
Model('deepseek-ai/DeepSeek-R1-0528', 'deepseek-ai/DeepSeek-R1-0528'),
128+
], TemplateType.deepseek_r1),
129+
ModelGroup([
130+
Model('cognitivecomputations/DeepSeek-R1-awq', 'cognitivecomputations/DeepSeek-R1-AWQ'),
131+
Model('cognitivecomputations/DeepSeek-R1-0528-AWQ', 'cognitivecomputations/DeepSeek-R1-0528-AWQ'),
132+
], TemplateType.deepseek_r1),
133+
ModelGroup([
134+
Model('unsloth/DeepSeek-R1-BF16', 'unsloth/DeepSeek-R1-BF16'),
135+
Model('unsloth/DeepSeek-R1-Zero-BF16', 'unsloth/DeepSeek-R1-Zero-BF16'),
136+
Model('unsloth/DeepSeek-R1-0528-BF16', 'unsloth/DeepSeek-R1-0528-BF16'),
137+
], TemplateType.deepseek_r1),
138+
ModelGroup([
139+
Model('moonshotai/Moonlight-16B-A3B', 'moonshotai/Moonlight-16B-A3B'),
140+
Model('moonshotai/Moonlight-16B-A3B-Instruct', 'moonshotai/Moonlight-16B-A3B-Instruct'),
141+
], TemplateType.moonlight),
142+
ModelGroup([
143+
Model('moonshotai/Kimi-K2-Base', 'moonshotai/Kimi-K2-Base'),
144+
Model('moonshotai/Kimi-K2-Instruct', 'moonshotai/Kimi-K2-Instruct'),
145+
Model('moonshotai/Kimi-K2-Instruct-0905', 'moonshotai/Kimi-K2-Instruct-0905'),
146+
Model('moonshotai/Kimi-K2-Thinking', 'moonshotai/Kimi-K2-Thinking'),
147+
], TemplateType.kimi_k2),
135148
ModelGroup([
136149
Model('deepseek-ai/DeepSeek-V3.1-Base', 'deepseek-ai/DeepSeek-V3.1-Base'),
137150
Model('deepseek-ai/DeepSeek-V3.1', 'deepseek-ai/DeepSeek-V3.1'),
138151
Model('deepseek-ai/DeepSeek-V3.1-Terminus', 'deepseek-ai/DeepSeek-V3.1-Terminus'),
139-
]),
152+
], TemplateType.deepseek_v3_1),
140153
],
141-
TemplateType.deepseek_v3_1,
142154
get_model_tokenizer_deepseek_moe,
143155
architectures=['DeepseekV3ForCausalLM'],
144156
model_arch=ModelArch.deepseek_v2,
@@ -180,8 +192,8 @@ def get_model_tokenizer_deepseek_v3_2(model_dir: str,
180192
Model('deepseek-ai/DeepSeek-Math-V2', 'deepseek-ai/DeepSeek-Math-V2'),
181193
]),
182194
],
183-
TemplateType.deepseek_v3_1,
184195
get_model_tokenizer_deepseek_v3_2,
196+
template=TemplateType.deepseek_v3_1,
185197
architectures=['DeepseekV32ForCausalLM'],
186198
))
187199

@@ -223,8 +235,8 @@ def get_model_tokenizer_deepseek_vl(model_dir: str, *args, **kwargs):
223235
Model('deepseek-ai/deepseek-vl-7b-chat', 'deepseek-ai/deepseek-vl-7b-chat'),
224236
], ),
225237
],
226-
TemplateType.deepseek_vl,
227238
get_model_tokenizer_deepseek_vl,
239+
template=TemplateType.deepseek_vl,
228240
architectures=['MultiModalityCausalLM'],
229241
model_arch=ModelArch.deepseek_vl,
230242
tags=['vision'],
@@ -250,8 +262,8 @@ def get_model_tokenizer_deepseek_janus(model_dir: str, *args, **kwargs):
250262
Model('deepseek-ai/Janus-1.3B', 'deepseek-ai/Janus-1.3B'),
251263
]),
252264
],
253-
TemplateType.deepseek_janus,
254265
get_model_tokenizer_deepseek_janus,
266+
template=TemplateType.deepseek_janus,
255267
model_arch=ModelArch.deepseek_janus,
256268
tags=['vision'],
257269
))
@@ -265,8 +277,8 @@ def get_model_tokenizer_deepseek_janus(model_dir: str, *args, **kwargs):
265277
Model('deepseek-ai/Janus-Pro-7B', 'deepseek-ai/Janus-Pro-7B'),
266278
]),
267279
],
268-
TemplateType.deepseek_janus_pro,
269280
get_model_tokenizer_deepseek_janus,
281+
template=TemplateType.deepseek_janus_pro,
270282
model_arch=ModelArch.deepseek_janus,
271283
tags=['vision'],
272284
))
@@ -298,40 +310,14 @@ def get_model_tokenizer_deepseek_vl2(model_dir: str, *args, **kwargs):
298310
Model('deepseek-ai/deepseek-vl2', 'deepseek-ai/deepseek-vl2'),
299311
]),
300312
],
301-
TemplateType.deepseek_vl2,
302313
get_model_tokenizer_deepseek_vl2,
314+
template=TemplateType.deepseek_vl2,
303315
model_arch=ModelArch.deepseek_vl2,
304316
requires=['transformers<4.42'],
305317
architectures=['DeepseekV2ForCausalLM'],
306318
tags=['vision'],
307319
))
308320

309-
register_model(
310-
ModelMeta(
311-
LLMModelType.deepseek_r1,
312-
[
313-
ModelGroup([
314-
Model('deepseek-ai/DeepSeek-R1', 'deepseek-ai/DeepSeek-R1'),
315-
Model('deepseek-ai/DeepSeek-R1-Zero', 'deepseek-ai/DeepSeek-R1-Zero'),
316-
Model('deepseek-ai/DeepSeek-R1-0528', 'deepseek-ai/DeepSeek-R1-0528'),
317-
]),
318-
ModelGroup([
319-
Model('cognitivecomputations/DeepSeek-R1-awq', 'cognitivecomputations/DeepSeek-R1-AWQ'),
320-
Model('cognitivecomputations/DeepSeek-R1-0528-AWQ', 'cognitivecomputations/DeepSeek-R1-0528-AWQ'),
321-
]),
322-
ModelGroup([
323-
Model('unsloth/DeepSeek-R1-BF16', 'unsloth/DeepSeek-R1-BF16'),
324-
Model('unsloth/DeepSeek-R1-Zero-BF16', 'unsloth/DeepSeek-R1-Zero-BF16'),
325-
Model('unsloth/DeepSeek-R1-0528-BF16', 'unsloth/DeepSeek-R1-0528-BF16'),
326-
]),
327-
],
328-
TemplateType.deepseek_r1,
329-
get_model_tokenizer_deepseek_moe,
330-
architectures=['DeepseekV3ForCausalLM'],
331-
model_arch=ModelArch.deepseek_v2,
332-
requires=['transformers>=4.39.3'],
333-
))
334-
335321
register_model(
336322
ModelMeta(
337323
LLMModelType.deepseek_r1_distill,
@@ -352,8 +338,8 @@ def get_model_tokenizer_deepseek_vl2(model_dir: str, *args, **kwargs):
352338
Model('deepseek-ai/DeepSeek-R1-0528-Qwen3-8B', 'deepseek-ai/DeepSeek-R1-0528-Qwen3-8B'),
353339
]),
354340
],
355-
TemplateType.deepseek_r1,
356341
get_model_tokenizer_with_flash_attn,
342+
template=TemplateType.deepseek_r1,
357343
architectures=['Qwen2ForCausalLM', 'LlamaForCausalLM', 'Qwen3ForCausalLM'],
358344
model_arch=ModelArch.llama,
359345
))
@@ -379,8 +365,8 @@ def get_model_tokenizer_deepseek_ocr(*args, **kwargs):
379365
Model('deepseek-ai/DeepSeek-OCR', 'deepseek-ai/DeepSeek-OCR'),
380366
]),
381367
],
382-
TemplateType.deepseek_ocr,
383368
get_model_tokenizer_deepseek_ocr,
369+
template=TemplateType.deepseek_ocr,
384370
model_arch=ModelArch.deepseek_ocr,
385371
requires=['transformers==4.46.3', 'easydict'],
386372
tags=['vision'],

swift/llm/model/model/gemma.py

Lines changed: 6 additions & 7 deletions
Original file line numberDiff line numberDiff line change
@@ -50,8 +50,8 @@ def get_model_tokenizer_paligemma_vision(model_dir: str,
5050
Model('AI-ModelScope/paligemma2-10b-ft-docci-448', 'google/paligemma2-10b-ft-docci-448'),
5151
]),
5252
],
53-
TemplateType.paligemma,
5453
get_model_tokenizer_paligemma_vision,
54+
template=TemplateType.paligemma,
5555
architectures=['PaliGemmaForConditionalGeneration'],
5656
model_arch=ModelArch.llava_hf,
5757
requires=['transformers>=4.41'],
@@ -69,8 +69,8 @@ def get_model_tokenizer_paligemma_vision(model_dir: str,
6969
Model('AI-ModelScope/gemma-7b-it', 'google/gemma-7b-it'),
7070
], ),
7171
],
72-
TemplateType.gemma,
7372
get_model_tokenizer_with_flash_attn,
73+
template=TemplateType.gemma,
7474
architectures=['GemmaForCausalLM'],
7575
model_arch=ModelArch.llama,
7676
requires=['transformers>=4.38'],
@@ -89,8 +89,8 @@ def get_model_tokenizer_paligemma_vision(model_dir: str,
8989
Model('LLM-Research/gemma-2-27b-it', 'google/gemma-2-27b-it'),
9090
], ),
9191
],
92-
TemplateType.gemma,
9392
get_model_tokenizer_with_flash_attn,
93+
template=TemplateType.gemma,
9494
architectures=['Gemma2ForCausalLM'],
9595
model_arch=ModelArch.llama,
9696
requires=['transformers>=4.42'],
@@ -120,8 +120,8 @@ def get_model_tokenizer_gemma3_text(model_dir: str,
120120
Model('google/gemma-3-270m-it', 'google/gemma-3-270m-it'),
121121
], ),
122122
],
123-
TemplateType.gemma3_text,
124123
get_model_tokenizer_gemma3_text,
124+
template=TemplateType.gemma3_text,
125125
architectures=['Gemma3ForCausalLM'],
126126
model_arch=ModelArch.llama,
127127
requires=['transformers>=4.49'],
@@ -160,8 +160,8 @@ def get_model_tokenizer_gemma3_vision(model_dir: str,
160160
Model('LLM-Research/gemma-3-27b-it', 'google/gemma-3-27b-it'),
161161
], ),
162162
],
163-
TemplateType.gemma3_vision,
164163
get_model_tokenizer_gemma3_vision,
164+
template=TemplateType.gemma3_vision,
165165
architectures=['Gemma3ForConditionalGeneration'],
166166
model_arch=ModelArch.llava_hf,
167167
requires=['transformers>=4.49'],
@@ -195,8 +195,8 @@ def get_model_tokenizer_gemma3n(model_dir: str,
195195
Model('google/gemma-3n-E4B-it', 'google/gemma-3n-E4B-it'),
196196
], ),
197197
],
198-
TemplateType.gemma3n,
199198
get_model_tokenizer_gemma3n,
199+
template=TemplateType.gemma3n,
200200
architectures=['Gemma3nForConditionalGeneration'],
201201
model_arch=ModelArch.gemma3n,
202202
requires=['transformers>=4.53.1'],
@@ -210,7 +210,6 @@ def get_model_tokenizer_gemma3n(model_dir: str,
210210
Model('google/embeddinggemma-300m', 'google/embeddinggemma-300m'),
211211
], ),
212212
],
213-
None,
214213
get_model_tokenizer_sentence_transformers,
215214
architectures=['Gemma3TextModel'],
216215
))

0 commit comments

Comments
 (0)