nicoboss
diff --git a/‎.gitignore‎
Lines changed: 1 addition & 0 deletions b/‎.gitignore‎
Lines changed: 1 addition & 0 deletions
diff --git a/‎convert_hf_to_gguf.py‎
Lines changed: 71 additions & 5 deletions b/‎convert_hf_to_gguf.py‎
Lines changed: 71 additions & 5 deletions
diff --git a/‎docs/multimodal.md‎
Lines changed: 3 additions & 0 deletions b/‎docs/multimodal.md‎
Lines changed: 3 additions & 0 deletions
diff --git a/‎ggml/src/ggml-cuda/fattn-vec-f16.cuh‎
Lines changed: 4 additions & 5 deletions b/‎ggml/src/ggml-cuda/fattn-vec-f16.cuh‎
Lines changed: 4 additions & 5 deletions
diff --git a/‎ggml/src/ggml-cuda/fattn-vec-f32.cuh‎
Lines changed: 4 additions & 5 deletions b/‎ggml/src/ggml-cuda/fattn-vec-f32.cuh‎
Lines changed: 4 additions & 5 deletions
diff --git a/‎gguf-py/gguf/constants.py‎
Lines changed: 1 addition & 0 deletions b/‎gguf-py/gguf/constants.py‎
Lines changed: 1 addition & 0 deletions
@@ -82,6 +82,7 @@ models/*
 models-mnt
 !models/.editorconfig
 !models/ggml-vocab-*.gguf*
+!models/templates
 
 # Zig
 zig-out/
 
@@ -1900,6 +1900,7 @@ def prepare_tensors(self):
     "MixtralForCausalLM",
     "VLlama3ForCausalLM",
     "LlavaForConditionalGeneration",
+    "VoxtralForConditionalGeneration",
     "LlamaModel")
 class LlamaModel(TextModel):
     model_arch = gguf.MODEL_ARCH.LLAMA
@@ -1912,6 +1913,11 @@ def __init__(self, *args, **kwargs):
             self.hparams["num_attention_heads"] = self.hparams.get("num_attention_heads", 32)
 
     def set_vocab(self):
+        path_tekken_json = self.dir_model / "tekken.json"
+        path_tokenizer_json = self.dir_model / "tokenizer.json"
+        if path_tekken_json.is_file() and not path_tokenizer_json.is_file():
+            return self.set_vocab_tekken()
+
         try:
             self._set_vocab_sentencepiece()
         except FileNotFoundError:
@@ -1944,6 +1950,52 @@ def set_vocab(self):
         if self.hparams.get("vocab_size", 32000) == 49152:
             self.gguf_writer.add_add_bos_token(False)
 
+    def set_vocab_tekken(self):
+        vocab = gguf.vocab.MistralVocab(self.dir_model)
+        self.gguf_writer.add_tokenizer_model(vocab.gguf_tokenizer_model)
+
+        tokens = []
+        scores = []
+        toktypes = []
+
+        for text, score, toktype in vocab.all_tokens():
+            tokens.append(text)
+            scores.append(score)
+            toktypes.append(toktype)
+
+        assert len(tokens) == vocab.vocab_size, (
+            f"token count ({len(tokens)}) != vocab size ({vocab.vocab_size})"
+        )
+
+        if vocab.tokenizer_type == gguf.vocab.MistralTokenizerType.tekken:
+            self.gguf_writer.add_tokenizer_pre("tekken")
+            self.gguf_writer.add_token_merges(
+                vocab.extract_vocab_merges_from_model()
+            )
+
+        logger.info(
+            f"Setting bos, eos, unk and pad token IDs to {vocab.bos_id}, {vocab.eos_id}, {vocab.unk_id}, {vocab.pad_id}."
+        )
+
+        self.gguf_writer.add_bos_token_id(vocab.bos_id)
+        self.gguf_writer.add_eos_token_id(vocab.eos_id)
+        self.gguf_writer.add_unk_token_id(vocab.unk_id)
+        self.gguf_writer.add_pad_token_id(vocab.pad_id)
+
+        self.gguf_writer.add_token_list(tokens)
+        self.gguf_writer.add_token_scores(scores)
+        self.gguf_writer.add_token_types(toktypes)
+        self.gguf_writer.add_vocab_size(vocab.vocab_size)
+
+        self.gguf_writer.add_add_bos_token(True)
+        self.gguf_writer.add_add_eos_token(False)
+
+        script_dir = Path(__file__).parent
+        template_path = script_dir / "models/templates/unsloth-mistral-Devstral-Small-2507.jinja"
+        with open(template_path, "r", encoding="utf-8") as f:
+            template = f.read()
+            self.gguf_writer.add_chat_template(template)
+
     def set_gguf_parameters(self):
         super().set_gguf_parameters()
         hparams = self.hparams
@@ -1971,12 +2023,13 @@ def permute(weights: Tensor, n_head: int, n_head_kv: int | None):
     def modify_tensors(self, data_torch: Tensor, name: str, bid: int | None) -> Iterable[tuple[str, Tensor]]:
         n_head = self.hparams["num_attention_heads"]
         n_kv_head = self.hparams.get("num_key_value_heads")
-        is_vision_tensor = "vision_tower" in name \
+        is_multimodal_tensor = "vision_tower" in name \
             or "vision_model" in name \
+            or "audio_tower" in name \
             or "model.connector" in name \
             or "multi_modal_projector" in name
 
-        if is_vision_tensor:
+        if is_multimodal_tensor:
             return [] # skip vision tensors
         elif self.hf_arch == "LlamaModel":
             name = "model." + name
@@ -7231,9 +7284,10 @@ class WhisperEncoderModel(MmprojModel):
 
     def __init__(self, *args, **kwargs):
         super().__init__(*args, **kwargs)
-        self.hparams["hidden_size"] = self.hparams["d_model"]
-        self.hparams["intermediate_size"] = self.hparams["encoder_ffn_dim"]
-        self.hparams["num_attention_heads"] = self.hparams["encoder_attention_heads"]
+        if "hidden_size" not in self.hparams and "intermediate_size" not in self.hparams:
+            self.hparams["hidden_size"] = self.hparams["d_model"]
+            self.hparams["intermediate_size"] = self.hparams["encoder_ffn_dim"]
+            self.hparams["num_attention_heads"] = self.hparams["encoder_attention_heads"]
 
     def set_gguf_parameters(self):
         super().set_gguf_parameters()
@@ -7272,9 +7326,21 @@ class UltravoxWhisperEncoderModel(WhisperEncoderModel):
 
     def set_gguf_parameters(self):
         super().set_gguf_parameters()
+        self.gguf_writer.add_clip_projector_type(gguf.VisionProjectorType.ULTRAVOX)
         self.gguf_writer.add_audio_stack_factor(self.global_config["stack_factor"])
 
 
+@ModelBase.register("VoxtralForConditionalGeneration")
+class VoxtralWhisperEncoderModel(WhisperEncoderModel):
+    has_vision_encoder = False # no vision encoder
+    has_audio_encoder = True
+
+    def set_gguf_parameters(self):
+        super().set_gguf_parameters()
+        self.gguf_writer.add_clip_projector_type(gguf.VisionProjectorType.VOXTRAL)
+        self.gguf_writer.add_audio_stack_factor(4) # == intermediate_size // hidden_size
+
+
 @ModelBase.register("FalconH1ForCausalLM")
 class FalconH1Model(Mamba2Model):
     model_arch = gguf.MODEL_ARCH.FALCON_H1
 
@@ -97,6 +97,9 @@ NOTE: some models may require large context window, for example: `-c 8192`
 # Qwen2-Audio and SeaLLM-Audio
 # note: no pre-quantized GGUF this model, as they have very poor result
 # ref: https://github.com/ggml-org/llama.cpp/pull/13760
+
+# Mistral's Voxtral
+(tool_name) -hf ggml-org/Voxtral-Mini-3B-2507-GGUF
 ```
 
 **Mixed modalities**:
 
@@ -174,7 +174,10 @@ static __global__ void flash_attn_vec_ext_f16(
     K     += blockIdx.y*D * nb11;
     V     += blockIdx.y*D * nb21;
     maskh += blockIdx.y*D;
-    for (int k_VKQ_0 = blockIdx.y*D; k_VKQ_0 < ne11; k_VKQ_0 += gridDim.y*D) {
+    for (int k_VKQ_0 = blockIdx.y*D; k_VKQ_0 < ne11; k_VKQ_0 += gridDim.y*D,
+             // Increment pointers after each loop:
+             K += gridDim.y*D*nb11, V += gridDim.y*D*nb21, maskh += gridDim.y*D) {
+
         // Calculate KQ tile and keep track of new maximum KQ values:
 
         if (mask) {
@@ -291,10 +294,6 @@ static __global__ void flash_attn_vec_ext_f16(
             }
         }
 
-        K     += gridDim.y*D * nb11;
-        V     += gridDim.y*D * nb21;
-        maskh += gridDim.y*D;
-
         __syncthreads();
     }
 
 
@@ -180,7 +180,10 @@ static __global__ void flash_attn_vec_ext_f32(
     K     += blockIdx.y*D * nb11;
     V     += blockIdx.y*D * nb21;
     maskh += blockIdx.y*D;
-    for (int k_VKQ_0 = blockIdx.y*D; k_VKQ_0 < ne11; k_VKQ_0 += gridDim.y*D) {
+    for (int k_VKQ_0 = blockIdx.y*D; k_VKQ_0 < ne11; k_VKQ_0 += gridDim.y*D,
+             // Increment pointers after each loop:
+             K += gridDim.y*D*nb11, V += gridDim.y*D*nb21, maskh += gridDim.y*D) {
+
         // Calculate KQ tile and keep track of new maximum KQ values:
 
         if (mask) {
@@ -286,10 +289,6 @@ static __global__ void flash_attn_vec_ext_f32(
             }
         }
 
-        K     += gridDim.y*D * nb11;
-        V     += gridDim.y*D * nb21;
-        maskh += gridDim.y*D;
-
         __syncthreads();
     }
 
 
@@ -2724,6 +2724,7 @@ class VisionProjectorType:
     INTERNVL = "internvl"
     QWEN2A = "qwen2a" # audio
     QWEN25O = "qwen2.5o" # omni
+    VOXTRAL = "voxtral"
 
 
 # Items here are (block size, type size)
Original file line number	Diff line number	Diff line change
`@@ -174,7 +174,10 @@ static __global__ void flash_attn_vec_ext_f16(`
`174`	`174`	`K += blockIdx.yD nb11;`
`175`	`175`	`V += blockIdx.yD nb21;`
`176`	`176`	`maskh += blockIdx.y*D;`
`177`		`- for (int k_VKQ_0 = blockIdx.yD; k_VKQ_0 < ne11; k_VKQ_0 += gridDim.yD) {`
	`177`	`+ for (int k_VKQ_0 = blockIdx.yD; k_VKQ_0 < ne11; k_VKQ_0 += gridDim.yD,`
	`178`	`+ // Increment pointers after each loop:`
	`179`	`+ K += gridDim.yDnb11, V += gridDim.yDnb21, maskh += gridDim.y*D) {`
	`180`	`+`
`178`	`181`	`// Calculate KQ tile and keep track of new maximum KQ values:`
`179`	`182`
`180`	`183`	`if (mask) {`
`@@ -291,10 +294,6 @@ static __global__ void flash_attn_vec_ext_f16(`
`291`	`294`	`}`
`292`	`295`	`}`
`293`	`296`
`294`		`- K += gridDim.yD nb11;`
`295`		`- V += gridDim.yD nb21;`
`296`		`- maskh += gridDim.y*D;`
`297`		`-`
`298`	`297`	`__syncthreads();`
`299`	`298`	`}`
`300`	`299`
Original file line number	Diff line number	Diff line change
`@@ -180,7 +180,10 @@ static __global__ void flash_attn_vec_ext_f32(`
`180`	`180`	`K += blockIdx.yD nb11;`
`181`	`181`	`V += blockIdx.yD nb21;`
`182`	`182`	`maskh += blockIdx.y*D;`
`183`		`- for (int k_VKQ_0 = blockIdx.yD; k_VKQ_0 < ne11; k_VKQ_0 += gridDim.yD) {`
	`183`	`+ for (int k_VKQ_0 = blockIdx.yD; k_VKQ_0 < ne11; k_VKQ_0 += gridDim.yD,`
	`184`	`+ // Increment pointers after each loop:`
	`185`	`+ K += gridDim.yDnb11, V += gridDim.yDnb21, maskh += gridDim.y*D) {`
	`186`	`+`
`184`	`187`	`// Calculate KQ tile and keep track of new maximum KQ values:`
`185`	`188`
`186`	`189`	`if (mask) {`
`@@ -286,10 +289,6 @@ static __global__ void flash_attn_vec_ext_f32(`
`286`	`289`	`}`
`287`	`290`	`}`
`288`	`291`
`289`		`- K += gridDim.yD nb11;`
`290`		`- V += gridDim.yD nb21;`
`291`		`- maskh += gridDim.y*D;`
`292`		`-`
`293`	`292`	`__syncthreads();`
`294`	`293`	`}`
`295`	`294`