Ollama v0.17.1-rc2 Install
2026-02-266 turns30,878 charsgpt-5-2
Summary
User attempted to install Ollama v0.17.1-rc2 and encountered model loading metadata output during the process.
Messages
I want to install https://github.com/ollama/ollama/tree/v0.17.1-rc2
Here’s how you can **install and build the `ollama/ollama` v0.17.1-rc2 release** from the GitHub repo you linked, both as a normal install (binaries) *and* from source if you want to compile the code yourself:
---
## ✅ **1. Easiest: Install the official Ollama binary (recommended)**
Even for a specific tag like **v0.17.1-rc2**, you *can* install the released binaries from the official installer (they’ll match that tag’s behavior):
### **On macOS**
- Use Homebrew:
```bash
brew install ollama
```
Or download the macOS package from the official site and run it.
### **On Linux**
Run the official install script (works on most distros):
```bash
curl -fsSL https://ollama.com/install.sh | sh
```
This installs `ollama` in your PATH and sets up the daemon. citeturn0search0turn0search1
### **On Windows**
- Download the `.exe` installer from the official site and run it, or use **winget**:
```powershell
winget install Ollama.Ollama
```
Windows support includes a native app and CLI. citeturn0search0
➤ Once installed, verify with:
```bash
ollama --version
ollama list
```
Then run a model:
```bash
ollama run gemma3
```
to test that installation works locally. citeturn0search0
---
## 🛠 **2. Build from Source (from the v0.17.1-rc2 tag)**
If you specifically want to compile the exact source code at tag `v0.17.1-rc2` from GitHub instead of using prebuilt installers:
### **Prerequisites**
You’ll need (on *nix or macOS):
- **Go** ≥ 1.22
- **CMake**
- **C/C++ compiler** (GCC/Clang)
- Git
Clone the repo at the specific tag:
```bash
git clone --branch v0.17.1-rc2 https://github.com/ollama/ollama.git
cd ollama
```
### **Build**
```bash
go generate ./...
go build .
```
This produces a local `ollama` binary in the repo root. citeturn1search1
You can then:
```bash
./ollama serve
# in another terminal
./ollama run gemma3
```
### **Notes**
- On Linux/macOS this generally works out of the box with Go and CMake installed.
- On **Windows**, builds are more complex (requires MSVC + MinGW or MSYS2 & Go & CMake) and Windows support is still under active development for source builds. citeturn1search3
---
## 🐋 **3. Alternative: Run using Docker**
If you don’t want to build or install locally, you can use Docker:
```bash
docker pull ollama/ollama
docker run -it -v ollama_models:/root/.ollama -p 11434:11434 ollama/ollama
```
Then in another shell run:
```bash
ollama run gemma3
```
This runs Ollama inside a container with model storage persisted in a named volume. citeturn0search0
---
## 🧪 **Running Models After Install**
After installation (by any method), common commands are:
```bash
# List local models
ollama list
# Pull a new model
ollama pull gemma3:1b
# Run a model
ollama run gemma3
```
These are available once `ollama` is installed and running. citeturn0search0
---
## Summary
**Best for most users:**
✨ Run the official install script or binary — easiest and fully packaged.
**Advanced / developer:**
⚙️ Clone the `v0.17.1-rc2` repo and compile from source with Go and CMake.
**Containerized setup:**
🐳 Use Docker for easy manageability and isolation.
---
If you want, I can also give you a **step-by-step shell script** that automates the build process on your specific OS (macOS, Linux, or Windows/WSL).
gpt-5-2
maybe I need to uninstall the other version
Yes — if you’re trying to install or build **`v0.17.1-rc2` specifically**, it’s usually best to remove the existing Ollama version first to avoid:
- PATH conflicts
- Old daemon still running
- Mismatched client/server versions
- LaunchAgent / systemd service conflicts
Let’s do this cleanly.
---
# 🔎 Step 1 — Check What’s Currently Installed
Run:
```bash
which ollama
ollama --version
```
Also check if the daemon is running:
```bash
ps aux | grep ollama
```
---
# 🧹 Step 2 — Uninstall Based on How You Installed It
## 🟢 If you used Homebrew (macOS)
```bash
brew uninstall ollama
brew cleanup
```
Then confirm:
```bash
which ollama
```
It should return nothing.
---
## 🟢 If you used the curl installer (Linux/macOS)
Remove the binary manually:
```bash
sudo rm /usr/local/bin/ollama
```
Remove service files:
### macOS:
```bash
launchctl remove com.ollama.ollama
rm ~/Library/LaunchAgents/com.ollama.ollama.plist
```
### Linux:
```bash
sudo systemctl stop ollama
sudo systemctl disable ollama
sudo rm /etc/systemd/system/ollama.service
sudo systemctl daemon-reload
```
---
## 🟢 If you used the macOS App
Delete:
```
/Applications/Ollama.app
```
And remove background service:
```bash
launchctl remove com.ollama.ollama
```
---
## 🟢 If you used Docker
Just stop and remove container:
```bash
docker ps
docker stop <container_id>
docker rm <container_id>
```
---
# 🧠 Important: Do You Want to Keep Your Models?
Models are stored in:
- macOS: `~/.ollama`
- Linux: `~/.ollama`
- Windows: `%USERPROFILE%\.ollama`
If you want a completely clean slate:
```bash
rm -rf ~/.ollama
```
If you want to keep models, **don’t delete this folder**.
---
# 🛠 After That
Now you can safely:
```bash
git clone --branch v0.17.1-rc2 https://github.com/ollama/ollama.git
cd ollama
go build .
```
Or reinstall normally.
---
## Quick Question For You
Since you’ve been experimenting with local LLM infra and custom orchestration setups — are you installing `v0.17.1-rc2` because:
- You need a specific bugfix?
- You’re testing API changes?
- Something broke in your current setup?
- You’re integrating with your journaling platform or agent system?
Tell me your goal and I’ll recommend the safest path.
gpt-5-2
llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
llama_model_loader: - kv 0: general.architecture str = qwen35
llama_model_loader: - kv 1: general.type str = model
llama_model_loader: - kv 2: general.sampling.top_k i32 = 20
llama_model_loader: - kv 3: general.sampling.top_p f32 = 0.950000
llama_model_loader: - kv 4: general.sampling.temp f32 = 0.600000
llama_model_loader: - kv 5: general.name str = Qwen3.5-27B
llama_model_loader: - kv 6: general.basename str = Qwen3.5-27B
llama_model_loader: - kv 7: general.quantized_by str = Unsloth
llama_model_loader: - kv 8: general.size_label str = 27B
llama_model_loader: - kv 9: general.license str = apache-2.0
llama_model_loader: - kv 10: general.license.link str = https://huggingface.co/Qwen/Qwen3.5-2...
llama_model_loader: - kv 11: general.repo_url str = https://huggingface.co/unsloth
llama_model_loader: - kv 12: general.tags arr[str,1] = ["image-text-to-text"]
llama_model_loader: - kv 13: qwen35.block_count u32 = 64
llama_model_loader: - kv 14: qwen35.context_length u32 = 262144
llama_model_loader: - kv 15: qwen35.embedding_length u32 = 5120
llama_model_loader: - kv 16: qwen35.feed_forward_length u32 = 17408
llama_model_loader: - kv 17: qwen35.attention.head_count u32 = 24
llama_model_loader: - kv 18: qwen35.attention.head_count_kv u32 = 4
llama_model_loader: - kv 19: qwen35.rope.dimension_sections arr[i32,4] = [11, 11, 10, 0]
llama_model_loader: - kv 20: qwen35.rope.freq_base f32 = 10000000.000000
llama_model_loader: - kv 21: qwen35.attention.layer_norm_rms_epsilon f32 = 0.000001
llama_model_loader: - kv 22: qwen35.attention.key_length u32 = 256
llama_model_loader: - kv 23: qwen35.attention.value_length u32 = 256
llama_model_loader: - kv 24: qwen35.ssm.conv_kernel u32 = 4
llama_model_loader: - kv 25: qwen35.ssm.state_size u32 = 128
llama_model_loader: - kv 26: qwen35.ssm.group_count u32 = 16
llama_model_loader: - kv 27: qwen35.ssm.time_step_rank u32 = 48
llama_model_loader: - kv 28: qwen35.ssm.inner_size u32 = 6144
llama_model_loader: - kv 29: qwen35.full_attention_interval u32 = 4
llama_model_loader: - kv 30: qwen35.rope.dimension_count u32 = 64
llama_model_loader: - kv 31: tokenizer.ggml.model str = gpt2
llama_model_loader: - kv 32: tokenizer.ggml.pre str = qwen35
llama_model_loader: - kv 33: tokenizer.ggml.tokens arr[str,248320] = ["!", "\"", "#", "$", "%", "&", "'", ...
llama_model_loader: - kv 34: tokenizer.ggml.token_type arr[i32,248320] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
llama_model_loader: - kv 35: tokenizer.ggml.merges arr[str,247587] = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",...
llama_model_loader: - kv 36: tokenizer.ggml.eos_token_id u32 = 248046
llama_model_loader: - kv 37: tokenizer.ggml.padding_token_id u32 = 248044
llama_model_loader: - kv 38: tokenizer.ggml.add_bos_token bool = false
llama_model_loader: - kv 39: tokenizer.chat_template str = {%- set image_count = namespace(value...
llama_model_loader: - kv 40: general.quantization_version u32 = 2
llama_model_loader: - kv 41: general.file_type u32 = 15
llama_model_loader: - type f32: 353 tensors
llama_model_loader: - type q8_0: 96 tensors
llama_model_loader: - type q4_K: 263 tensors
llama_model_loader: - type q5_K: 96 tensors
llama_model_loader: - type q6_K: 43 tensors
print_info: file format = GGUF V3 (latest)
print_info: file type = Q4_K - Medium
print_info: file size = 15.58 GiB (4.98 BPW)
llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'qwen35'
llama_model_load_from_file_impl: failed to load model
time=2026-02-26T12:19:30.969-06:00 level=INFO source=sched.go:473 msg="NewLlamaServer failed" model=/Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 error="unable to load model: /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17"
[GIN] 2026/02/26 - 12:19:30 | 500 | 207.193083ms | 127.0.0.1 | POST "/api/chat"
time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/MistralThink:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-q.gguf:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-s.gguf:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/mistral-r:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.984-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.984-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:qwen.gguf error="invalid character 'G' looking for beginning of value"
time=2026-02-26T12:19:31.984-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/MistralThink:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.984-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-q.gguf:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-s.gguf:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/mistral-r:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:qwen.gguf error="invalid character 'G' looking for beginning of value"
llama_model_load_from_file_impl: using device Metal (Apple M4 Pro) (unknown id) - 38338 MiB free
llama_model_loader: loaded meta data with 42 key-value pairs and 851 tensors from /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 (version GGUF V3 (latest))
llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
llama_model_loader: - kv 0: general.architecture str = qwen35
llama_model_loader: - kv 1: general.type str = model
llama_model_loader: - kv 2: general.sampling.top_k i32 = 20
llama_model_loader: - kv 3: general.sampling.top_p f32 = 0.950000
llama_model_loader: - kv 4: general.sampling.temp f32 = 0.600000
llama_model_loader: - kv 5: general.name str = Qwen3.5-27B
llama_model_loader: - kv 6: general.basename str = Qwen3.5-27B
llama_model_loader: - kv 7: general.quantized_by str = Unsloth
llama_model_loader: - kv 8: general.size_label str = 27B
llama_model_loader: - kv 9: general.license str = apache-2.0
llama_model_loader: - kv 10: general.license.link str = https://huggingface.co/Qwen/Qwen3.5-2...
llama_model_loader: - kv 11: general.repo_url str = https://huggingface.co/unsloth
llama_model_loader: - kv 12: general.tags arr[str,1] = ["image-text-to-text"]
llama_model_loader: - kv 13: qwen35.block_count u32 = 64
llama_model_loader: - kv 14: qwen35.context_length u32 = 262144
llama_model_loader: - kv 15: qwen35.embedding_length u32 = 5120
llama_model_loader: - kv 16: qwen35.feed_forward_length u32 = 17408
llama_model_loader: - kv 17: qwen35.attention.head_count u32 = 24
llama_model_loader: - kv 18: qwen35.attention.head_count_kv u32 = 4
llama_model_loader: - kv 19: qwen35.rope.dimension_sections arr[i32,4] = [11, 11, 10, 0]
llama_model_loader: - kv 20: qwen35.rope.freq_base f32 = 10000000.000000
llama_model_loader: - kv 21: qwen35.attention.layer_norm_rms_epsilon f32 = 0.000001
llama_model_loader: - kv 22: qwen35.attention.key_length u32 = 256
llama_model_loader: - kv 23: qwen35.attention.value_length u32 = 256
llama_model_loader: - kv 24: qwen35.ssm.conv_kernel u32 = 4
llama_model_loader: - kv 25: qwen35.ssm.state_size u32 = 128
llama_model_loader: - kv 26: qwen35.ssm.group_count u32 = 16
llama_model_loader: - kv 27: qwen35.ssm.time_step_rank u32 = 48
llama_model_loader: - kv 28: qwen35.ssm.inner_size u32 = 6144
llama_model_loader: - kv 29: qwen35.full_attention_interval u32 = 4
llama_model_loader: - kv 30: qwen35.rope.dimension_count u32 = 64
llama_model_loader: - kv 31: tokenizer.ggml.model str = gpt2
llama_model_loader: - kv 32: tokenizer.ggml.pre str = qwen35
llama_model_loader: - kv 33: tokenizer.ggml.tokens arr[str,248320] = ["!", "\"", "#", "$", "%", "&", "'", ...
llama_model_loader: - kv 34: tokenizer.ggml.token_type arr[i32,248320] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
llama_model_loader: - kv 35: tokenizer.ggml.merges arr[str,247587] = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",...
llama_model_loader: - kv 36: tokenizer.ggml.eos_token_id u32 = 248046
llama_model_loader: - kv 37: tokenizer.ggml.padding_token_id u32 = 248044
llama_model_loader: - kv 38: tokenizer.ggml.add_bos_token bool = false
llama_model_loader: - kv 39: tokenizer.chat_template str = {%- set image_count = namespace(value...
llama_model_loader: - kv 40: general.quantization_version u32 = 2
llama_model_loader: - kv 41: general.file_type u32 = 15
llama_model_loader: - type f32: 353 tensors
llama_model_loader: - type q8_0: 96 tensors
llama_model_loader: - type q4_K: 263 tensors
llama_model_loader: - type q5_K: 96 tensors
llama_model_loader: - type q6_K: 43 tensors
print_info: file format = GGUF V3 (latest)
print_info: file type = Q4_K - Medium
print_info: file size = 15.58 GiB (4.98 BPW)
llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'qwen35'
llama_model_load_from_file_impl: failed to load model
time=2026-02-26T12:19:32.185-06:00 level=INFO source=sched.go:473 msg="NewLlamaServer failed" model=/Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 error="unable to load model: /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17"
[GIN] 2026/02/26 - 12:19:32 | 500 | 203.97225ms | 127.0.0.1 | POST "/api/chat"
time=2026-02-26T12:19:34.200-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/MistralThink:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.200-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.200-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-q.gguf:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.200-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-s.gguf:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/mistral-r:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:qwen.gguf error="invalid character 'G' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/MistralThink:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-q.gguf:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-s.gguf:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/mistral-r:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:Modelfile error="invalid character 'F' looking for beginning of value"
time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:qwen.gguf error="invalid character 'G' looking for beginning of value"
llama_model_load_from_file_impl: using device Metal (Apple M4 Pro) (unknown id) - 38338 MiB free
llama_model_loader: loaded meta data with 42 key-value pairs and 851 tensors from /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 (version GGUF V3 (latest))
llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
llama_model_loader: - kv 0: general.architecture str = qwen35
llama_model_loader: - kv 1: general.type str = model
llama_model_loader: - kv 2: general.sampling.top_k i32 = 20
llama_model_loader: - kv 3: general.sampling.top_p f32 = 0.950000
llama_model_loader: - kv 4: general.sampling.temp f32 = 0.600000
llama_model_loader: - kv 5: general.name str = Qwen3.5-27B
llama_model_loader: - kv 6: general.basename str = Qwen3.5-27B
llama_model_loader: - kv 7: general.quantized_by str = Unsloth
llama_model_loader: - kv 8: general.size_label str = 27B
llama_model_loader: - kv 9: general.license str = apache-2.0
llama_model_loader: - kv 10: general.license.link str = https://huggingface.co/Qwen/Qwen3.5-2...
llama_model_loader: - kv 11: general.repo_url str = https://huggingface.co/unsloth
llama_model_loader: - kv 12: general.tags arr[str,1] = ["image-text-to-text"]
llama_model_loader: - kv 13: qwen35.block_count u32 = 64
llama_model_loader: - kv 14: qwen35.context_length u32 = 262144
llama_model_loader: - kv 15: qwen35.embedding_length u32 = 5120
llama_model_loader: - kv 16: qwen35.feed_forward_length u32 = 17408
llama_model_loader: - kv 17: qwen35.attention.head_count u32 = 24
llama_model_loader: - kv 18: qwen35.attention.head_count_kv u32 = 4
llama_model_loader: - kv 19: qwen35.rope.dimension_sections arr[i32,4] = [11, 11, 10, 0]
llama_model_loader: - kv 20: qwen35.rope.freq_base f32 = 10000000.000000
llama_model_loader: - kv 21: qwen35.attention.layer_norm_rms_epsilon f32 = 0.000001
llama_model_loader: - kv 22: qwen35.attention.key_length u32 = 256
llama_model_loader: - kv 23: qwen35.attention.value_length u32 = 256
llama_model_loader: - kv 24: qwen35.ssm.conv_kernel u32 = 4
llama_model_loader: - kv 25: qwen35.ssm.state_size u32 = 128
llama_model_loader: - kv 26: qwen35.ssm.group_count u32 = 16
llama_model_loader: - kv 27: qwen35.ssm.time_step_rank u32 = 48
llama_model_loader: - kv 28: qwen35.ssm.inner_size u32 = 6144
llama_model_loader: - kv 29: qwen35.full_attention_interval u32 = 4
llama_model_loader: - kv 30: qwen35.rope.dimension_count u32 = 64
llama_model_loader: - kv 31: tokenizer.ggml.model str = gpt2
llama_model_loader: - kv 32: tokenizer.ggml.pre str = qwen35
llama_model_loader: - kv 33: tokenizer.ggml.tokens arr[str,248320] = ["!", "\"", "#", "$", "%", "&", "'", ...
llama_model_loader: - kv 34: tokenizer.ggml.token_type arr[i32,248320] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
llama_model_loader: - kv 35: tokenizer.ggml.merges arr[str,247587] = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",...
llama_model_loader: - kv 36: tokenizer.ggml.eos_token_id u32 = 248046
llama_model_loader: - kv 37: tokenizer.ggml.padding_token_id u32 = 248044
llama_model_loader: - kv 38: tokenizer.ggml.add_bos_token bool = false
llama_model_loader: - kv 39: tokenizer.chat_template str = {%- set image_count = namespace(value...
llama_model_loader: - kv 40: general.quantization_version u32 = 2
llama_model_loader: - kv 41: general.file_type u32 = 15
llama_model_loader: - type f32: 353 tensors
llama_model_loader: - type q8_0: 96 tensors
llama_model_loader: - type q4_K: 263 tensors
llama_model_loader: - type q5_K: 96 tensors
llama_model_loader: - type q6_K: 43 tensors
print_info: file format = GGUF V3 (latest)
print_info: file type = Q4_K - Medium
print_info: file size = 15.58 GiB (4.98 BPW)
llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'qwen35'
llama_model_load_from_file_impl: failed to load model
time=2026-02-26T12:19:34.403-06:00 level=INFO source=sched.go:473 msg="NewLlamaServer failed" model=/Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 error="unable to load model: /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17"
[GIN] 2026/02/26 - 12:19:34 | 500 | 205.052459ms | 127.0.0.1 | POST "/api/chat"
Good — this log tells us exactly what’s wrong.
## 🔥 The Real Problem
```
error loading model architecture: unknown model architecture: 'qwen35'
```
Your Ollama build **does not recognize the `qwen35` architecture** in that GGUF file.
That means:
- The GGUF model was exported with a newer `llama.cpp`
- Your Ollama version is built against an older `llama.cpp`
- That version does not yet support Qwen 3.5
This is **not** a corrupted model.
This is a **version mismatch**.
---
# 🎯 Why This Is Happening
The metadata clearly says:
```
general.architecture = qwen35
```
Support for `qwen35` was added to `llama.cpp` relatively recently.
If you're running:
- An older Ollama binary
- Or a build that didn’t include updated submodules
- Or a mismatched release candidate
You’ll get exactly this failure.
---
# ✅ Fix Option 1 (Recommended): Clean Reinstall Latest Ollama
You’re on an M4 Pro with Metal and 38GB free VRAM — so let’s not fight tooling.
### 1️⃣ Fully remove Ollama
```bash
brew uninstall ollama
rm -rf ~/.ollama
```
(Yes, wipe models — they may be built against incompatible formats.)
Then reinstall clean:
```bash
brew install ollama
```
Check version:
```bash
ollama --version
```
Then pull a known working Qwen:
```bash
ollama pull qwen2.5:7b
```
If that works, try your 27B again.
---
# ✅ Fix Option 2: If You REALLY Want v0.17.1-rc2
If you're building from source:
You must ensure submodules are updated:
```bash
git clone --branch v0.17.1-rc2 https://github.com/ollama/ollama.git
cd ollama
git submodule update --init --recursive
go generate ./...
go build .
```
If you skip submodules, you get old llama.cpp.
---
# 🚨 The “bad manifest” Errors
This part:
```
bad manifest ... invalid character 'F' looking for beginning of value
```
Means your model cache or registry manifests are corrupted.
That’s another strong reason to:
```
rm -rf ~/.ollama
```
Start clean.
---
# 🧠 Important Insight For You
You’re running:
- Unsloth quantized Qwen3.5-27B
- Q4_K
- 15.6GB
- 262k context (!!)
That’s a heavy, bleeding-edge model.
Given your experimentation with:
- Local orchestration
- Custom agents
- Long-context systems
- Persona injection
You probably want stability over bleeding-edge RC builds.
---
# 🏆 My Recommendation For You Specifically
Given your workflow:
1. Install latest stable Ollama
2. Use official Qwen builds via:
```
ollama pull qwen2.5:14b
```
3. Only use custom GGUF if you’re doing model research
Unsloth Qwen3.5 27B Q4_K is overkill unless you're benchmarking.
---
# Quick Question
Are you trying to:
- Run vision (image-text-to-text)?
- Push 200k+ context experiments?
- Or just test raw reasoning power?
Tell me your goal and I’ll tune the setup specifically for your M4 Pro.
gpt-5-2