← all conversations

Ollama v0.17.1-rc2 Install

2026-02-266 turns30,878 charsgpt-5-2
ollama-installationmodel-loadingversion-management

Summary

User attempted to install Ollama v0.17.1-rc2 and encountered model loading metadata output during the process.

Messages

I want to install https://github.com/ollama/ollama/tree/v0.17.1-rc2
Here’s how you can **install and build the `ollama/ollama` v0.17.1-rc2 release** from the GitHub repo you linked, both as a normal install (binaries) *and* from source if you want to compile the code yourself: --- ## ✅ **1. Easiest: Install the official Ollama binary (recommended)** Even for a specific tag like **v0.17.1-rc2**, you *can* install the released binaries from the official installer (they’ll match that tag’s behavior): ### **On macOS** - Use Homebrew: ```bash brew install ollama ``` Or download the macOS package from the official site and run it. ### **On Linux** Run the official install script (works on most distros): ```bash curl -fsSL https://ollama.com/install.sh | sh ``` This installs `ollama` in your PATH and sets up the daemon. citeturn0search0turn0search1 ### **On Windows** - Download the `.exe` installer from the official site and run it, or use **winget**: ```powershell winget install Ollama.Ollama ``` Windows support includes a native app and CLI. citeturn0search0 ➤ Once installed, verify with: ```bash ollama --version ollama list ``` Then run a model: ```bash ollama run gemma3 ``` to test that installation works locally. citeturn0search0 --- ## 🛠 **2. Build from Source (from the v0.17.1-rc2 tag)** If you specifically want to compile the exact source code at tag `v0.17.1-rc2` from GitHub instead of using prebuilt installers: ### **Prerequisites** You’ll need (on *nix or macOS): - **Go** ≥ 1.22 - **CMake** - **C/C++ compiler** (GCC/Clang) - Git Clone the repo at the specific tag: ```bash git clone --branch v0.17.1-rc2 https://github.com/ollama/ollama.git cd ollama ``` ### **Build** ```bash go generate ./... go build . ``` This produces a local `ollama` binary in the repo root. citeturn1search1 You can then: ```bash ./ollama serve # in another terminal ./ollama run gemma3 ``` ### **Notes** - On Linux/macOS this generally works out of the box with Go and CMake installed. - On **Windows**, builds are more complex (requires MSVC + MinGW or MSYS2 & Go & CMake) and Windows support is still under active development for source builds. citeturn1search3 --- ## 🐋 **3. Alternative: Run using Docker** If you don’t want to build or install locally, you can use Docker: ```bash docker pull ollama/ollama docker run -it -v ollama_models:/root/.ollama -p 11434:11434 ollama/ollama ``` Then in another shell run: ```bash ollama run gemma3 ``` This runs Ollama inside a container with model storage persisted in a named volume. citeturn0search0 --- ## 🧪 **Running Models After Install** After installation (by any method), common commands are: ```bash # List local models ollama list # Pull a new model ollama pull gemma3:1b # Run a model ollama run gemma3 ``` These are available once `ollama` is installed and running. citeturn0search0 --- ## Summary **Best for most users:** ✨ Run the official install script or binary — easiest and fully packaged. **Advanced / developer:** ⚙️ Clone the `v0.17.1-rc2` repo and compile from source with Go and CMake. **Containerized setup:** 🐳 Use Docker for easy manageability and isolation. --- If you want, I can also give you a **step-by-step shell script** that automates the build process on your specific OS (macOS, Linux, or Windows/WSL).
gpt-5-2
maybe I need to uninstall the other version
Yes — if you’re trying to install or build **`v0.17.1-rc2` specifically**, it’s usually best to remove the existing Ollama version first to avoid: - PATH conflicts - Old daemon still running - Mismatched client/server versions - LaunchAgent / systemd service conflicts Let’s do this cleanly. --- # 🔎 Step 1 — Check What’s Currently Installed Run: ```bash which ollama ollama --version ``` Also check if the daemon is running: ```bash ps aux | grep ollama ``` --- # 🧹 Step 2 — Uninstall Based on How You Installed It ## 🟢 If you used Homebrew (macOS) ```bash brew uninstall ollama brew cleanup ``` Then confirm: ```bash which ollama ``` It should return nothing. --- ## 🟢 If you used the curl installer (Linux/macOS) Remove the binary manually: ```bash sudo rm /usr/local/bin/ollama ``` Remove service files: ### macOS: ```bash launchctl remove com.ollama.ollama rm ~/Library/LaunchAgents/com.ollama.ollama.plist ``` ### Linux: ```bash sudo systemctl stop ollama sudo systemctl disable ollama sudo rm /etc/systemd/system/ollama.service sudo systemctl daemon-reload ``` --- ## 🟢 If you used the macOS App Delete: ``` /Applications/Ollama.app ``` And remove background service: ```bash launchctl remove com.ollama.ollama ``` --- ## 🟢 If you used Docker Just stop and remove container: ```bash docker ps docker stop <container_id> docker rm <container_id> ``` --- # 🧠 Important: Do You Want to Keep Your Models? Models are stored in: - macOS: `~/.ollama` - Linux: `~/.ollama` - Windows: `%USERPROFILE%\.ollama` If you want a completely clean slate: ```bash rm -rf ~/.ollama ``` If you want to keep models, **don’t delete this folder**. --- # 🛠 After That Now you can safely: ```bash git clone --branch v0.17.1-rc2 https://github.com/ollama/ollama.git cd ollama go build . ``` Or reinstall normally. --- ## Quick Question For You Since you’ve been experimenting with local LLM infra and custom orchestration setups — are you installing `v0.17.1-rc2` because: - You need a specific bugfix? - You’re testing API changes? - Something broke in your current setup? - You’re integrating with your journaling platform or agent system? Tell me your goal and I’ll recommend the safest path.
gpt-5-2
llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output. llama_model_loader: - kv 0: general.architecture str = qwen35 llama_model_loader: - kv 1: general.type str = model llama_model_loader: - kv 2: general.sampling.top_k i32 = 20 llama_model_loader: - kv 3: general.sampling.top_p f32 = 0.950000 llama_model_loader: - kv 4: general.sampling.temp f32 = 0.600000 llama_model_loader: - kv 5: general.name str = Qwen3.5-27B llama_model_loader: - kv 6: general.basename str = Qwen3.5-27B llama_model_loader: - kv 7: general.quantized_by str = Unsloth llama_model_loader: - kv 8: general.size_label str = 27B llama_model_loader: - kv 9: general.license str = apache-2.0 llama_model_loader: - kv 10: general.license.link str = https://huggingface.co/Qwen/Qwen3.5-2... llama_model_loader: - kv 11: general.repo_url str = https://huggingface.co/unsloth llama_model_loader: - kv 12: general.tags arr[str,1] = ["image-text-to-text"] llama_model_loader: - kv 13: qwen35.block_count u32 = 64 llama_model_loader: - kv 14: qwen35.context_length u32 = 262144 llama_model_loader: - kv 15: qwen35.embedding_length u32 = 5120 llama_model_loader: - kv 16: qwen35.feed_forward_length u32 = 17408 llama_model_loader: - kv 17: qwen35.attention.head_count u32 = 24 llama_model_loader: - kv 18: qwen35.attention.head_count_kv u32 = 4 llama_model_loader: - kv 19: qwen35.rope.dimension_sections arr[i32,4] = [11, 11, 10, 0] llama_model_loader: - kv 20: qwen35.rope.freq_base f32 = 10000000.000000 llama_model_loader: - kv 21: qwen35.attention.layer_norm_rms_epsilon f32 = 0.000001 llama_model_loader: - kv 22: qwen35.attention.key_length u32 = 256 llama_model_loader: - kv 23: qwen35.attention.value_length u32 = 256 llama_model_loader: - kv 24: qwen35.ssm.conv_kernel u32 = 4 llama_model_loader: - kv 25: qwen35.ssm.state_size u32 = 128 llama_model_loader: - kv 26: qwen35.ssm.group_count u32 = 16 llama_model_loader: - kv 27: qwen35.ssm.time_step_rank u32 = 48 llama_model_loader: - kv 28: qwen35.ssm.inner_size u32 = 6144 llama_model_loader: - kv 29: qwen35.full_attention_interval u32 = 4 llama_model_loader: - kv 30: qwen35.rope.dimension_count u32 = 64 llama_model_loader: - kv 31: tokenizer.ggml.model str = gpt2 llama_model_loader: - kv 32: tokenizer.ggml.pre str = qwen35 llama_model_loader: - kv 33: tokenizer.ggml.tokens arr[str,248320] = ["!", "\"", "#", "$", "%", "&", "'", ... llama_model_loader: - kv 34: tokenizer.ggml.token_type arr[i32,248320] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ... llama_model_loader: - kv 35: tokenizer.ggml.merges arr[str,247587] = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",... llama_model_loader: - kv 36: tokenizer.ggml.eos_token_id u32 = 248046 llama_model_loader: - kv 37: tokenizer.ggml.padding_token_id u32 = 248044 llama_model_loader: - kv 38: tokenizer.ggml.add_bos_token bool = false llama_model_loader: - kv 39: tokenizer.chat_template str = {%- set image_count = namespace(value... llama_model_loader: - kv 40: general.quantization_version u32 = 2 llama_model_loader: - kv 41: general.file_type u32 = 15 llama_model_loader: - type f32: 353 tensors llama_model_loader: - type q8_0: 96 tensors llama_model_loader: - type q4_K: 263 tensors llama_model_loader: - type q5_K: 96 tensors llama_model_loader: - type q6_K: 43 tensors print_info: file format = GGUF V3 (latest) print_info: file type = Q4_K - Medium print_info: file size = 15.58 GiB (4.98 BPW) llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'qwen35' llama_model_load_from_file_impl: failed to load model time=2026-02-26T12:19:30.969-06:00 level=INFO source=sched.go:473 msg="NewLlamaServer failed" model=/Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 error="unable to load model: /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17" [GIN] 2026/02/26 - 12:19:30 | 500 | 207.193083ms | 127.0.0.1 | POST "/api/chat" time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/MistralThink:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-q.gguf:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-s.gguf:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.983-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/mistral-r:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.984-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.984-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:qwen.gguf error="invalid character 'G' looking for beginning of value" time=2026-02-26T12:19:31.984-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/MistralThink:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.984-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-q.gguf:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-s.gguf:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/mistral-r:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:31.985-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:qwen.gguf error="invalid character 'G' looking for beginning of value" llama_model_load_from_file_impl: using device Metal (Apple M4 Pro) (unknown id) - 38338 MiB free llama_model_loader: loaded meta data with 42 key-value pairs and 851 tensors from /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 (version GGUF V3 (latest)) llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output. llama_model_loader: - kv 0: general.architecture str = qwen35 llama_model_loader: - kv 1: general.type str = model llama_model_loader: - kv 2: general.sampling.top_k i32 = 20 llama_model_loader: - kv 3: general.sampling.top_p f32 = 0.950000 llama_model_loader: - kv 4: general.sampling.temp f32 = 0.600000 llama_model_loader: - kv 5: general.name str = Qwen3.5-27B llama_model_loader: - kv 6: general.basename str = Qwen3.5-27B llama_model_loader: - kv 7: general.quantized_by str = Unsloth llama_model_loader: - kv 8: general.size_label str = 27B llama_model_loader: - kv 9: general.license str = apache-2.0 llama_model_loader: - kv 10: general.license.link str = https://huggingface.co/Qwen/Qwen3.5-2... llama_model_loader: - kv 11: general.repo_url str = https://huggingface.co/unsloth llama_model_loader: - kv 12: general.tags arr[str,1] = ["image-text-to-text"] llama_model_loader: - kv 13: qwen35.block_count u32 = 64 llama_model_loader: - kv 14: qwen35.context_length u32 = 262144 llama_model_loader: - kv 15: qwen35.embedding_length u32 = 5120 llama_model_loader: - kv 16: qwen35.feed_forward_length u32 = 17408 llama_model_loader: - kv 17: qwen35.attention.head_count u32 = 24 llama_model_loader: - kv 18: qwen35.attention.head_count_kv u32 = 4 llama_model_loader: - kv 19: qwen35.rope.dimension_sections arr[i32,4] = [11, 11, 10, 0] llama_model_loader: - kv 20: qwen35.rope.freq_base f32 = 10000000.000000 llama_model_loader: - kv 21: qwen35.attention.layer_norm_rms_epsilon f32 = 0.000001 llama_model_loader: - kv 22: qwen35.attention.key_length u32 = 256 llama_model_loader: - kv 23: qwen35.attention.value_length u32 = 256 llama_model_loader: - kv 24: qwen35.ssm.conv_kernel u32 = 4 llama_model_loader: - kv 25: qwen35.ssm.state_size u32 = 128 llama_model_loader: - kv 26: qwen35.ssm.group_count u32 = 16 llama_model_loader: - kv 27: qwen35.ssm.time_step_rank u32 = 48 llama_model_loader: - kv 28: qwen35.ssm.inner_size u32 = 6144 llama_model_loader: - kv 29: qwen35.full_attention_interval u32 = 4 llama_model_loader: - kv 30: qwen35.rope.dimension_count u32 = 64 llama_model_loader: - kv 31: tokenizer.ggml.model str = gpt2 llama_model_loader: - kv 32: tokenizer.ggml.pre str = qwen35 llama_model_loader: - kv 33: tokenizer.ggml.tokens arr[str,248320] = ["!", "\"", "#", "$", "%", "&", "'", ... llama_model_loader: - kv 34: tokenizer.ggml.token_type arr[i32,248320] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ... llama_model_loader: - kv 35: tokenizer.ggml.merges arr[str,247587] = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",... llama_model_loader: - kv 36: tokenizer.ggml.eos_token_id u32 = 248046 llama_model_loader: - kv 37: tokenizer.ggml.padding_token_id u32 = 248044 llama_model_loader: - kv 38: tokenizer.ggml.add_bos_token bool = false llama_model_loader: - kv 39: tokenizer.chat_template str = {%- set image_count = namespace(value... llama_model_loader: - kv 40: general.quantization_version u32 = 2 llama_model_loader: - kv 41: general.file_type u32 = 15 llama_model_loader: - type f32: 353 tensors llama_model_loader: - type q8_0: 96 tensors llama_model_loader: - type q4_K: 263 tensors llama_model_loader: - type q5_K: 96 tensors llama_model_loader: - type q6_K: 43 tensors print_info: file format = GGUF V3 (latest) print_info: file type = Q4_K - Medium print_info: file size = 15.58 GiB (4.98 BPW) llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'qwen35' llama_model_load_from_file_impl: failed to load model time=2026-02-26T12:19:32.185-06:00 level=INFO source=sched.go:473 msg="NewLlamaServer failed" model=/Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 error="unable to load model: /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17" [GIN] 2026/02/26 - 12:19:32 | 500 | 203.97225ms | 127.0.0.1 | POST "/api/chat" time=2026-02-26T12:19:34.200-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/MistralThink:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.200-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.200-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-q.gguf:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.200-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-s.gguf:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/mistral-r:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:qwen.gguf error="invalid character 'G' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/MistralThink:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-q.gguf:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/gemma-s.gguf:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/mistral-r:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:Modelfile error="invalid character 'F' looking for beginning of value" time=2026-02-26T12:19:34.201-06:00 level=WARN source=manifest.go:218 msg="bad manifest" name=registry.ollama.ai/library/qwen:qwen.gguf error="invalid character 'G' looking for beginning of value" llama_model_load_from_file_impl: using device Metal (Apple M4 Pro) (unknown id) - 38338 MiB free llama_model_loader: loaded meta data with 42 key-value pairs and 851 tensors from /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 (version GGUF V3 (latest)) llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output. llama_model_loader: - kv 0: general.architecture str = qwen35 llama_model_loader: - kv 1: general.type str = model llama_model_loader: - kv 2: general.sampling.top_k i32 = 20 llama_model_loader: - kv 3: general.sampling.top_p f32 = 0.950000 llama_model_loader: - kv 4: general.sampling.temp f32 = 0.600000 llama_model_loader: - kv 5: general.name str = Qwen3.5-27B llama_model_loader: - kv 6: general.basename str = Qwen3.5-27B llama_model_loader: - kv 7: general.quantized_by str = Unsloth llama_model_loader: - kv 8: general.size_label str = 27B llama_model_loader: - kv 9: general.license str = apache-2.0 llama_model_loader: - kv 10: general.license.link str = https://huggingface.co/Qwen/Qwen3.5-2... llama_model_loader: - kv 11: general.repo_url str = https://huggingface.co/unsloth llama_model_loader: - kv 12: general.tags arr[str,1] = ["image-text-to-text"] llama_model_loader: - kv 13: qwen35.block_count u32 = 64 llama_model_loader: - kv 14: qwen35.context_length u32 = 262144 llama_model_loader: - kv 15: qwen35.embedding_length u32 = 5120 llama_model_loader: - kv 16: qwen35.feed_forward_length u32 = 17408 llama_model_loader: - kv 17: qwen35.attention.head_count u32 = 24 llama_model_loader: - kv 18: qwen35.attention.head_count_kv u32 = 4 llama_model_loader: - kv 19: qwen35.rope.dimension_sections arr[i32,4] = [11, 11, 10, 0] llama_model_loader: - kv 20: qwen35.rope.freq_base f32 = 10000000.000000 llama_model_loader: - kv 21: qwen35.attention.layer_norm_rms_epsilon f32 = 0.000001 llama_model_loader: - kv 22: qwen35.attention.key_length u32 = 256 llama_model_loader: - kv 23: qwen35.attention.value_length u32 = 256 llama_model_loader: - kv 24: qwen35.ssm.conv_kernel u32 = 4 llama_model_loader: - kv 25: qwen35.ssm.state_size u32 = 128 llama_model_loader: - kv 26: qwen35.ssm.group_count u32 = 16 llama_model_loader: - kv 27: qwen35.ssm.time_step_rank u32 = 48 llama_model_loader: - kv 28: qwen35.ssm.inner_size u32 = 6144 llama_model_loader: - kv 29: qwen35.full_attention_interval u32 = 4 llama_model_loader: - kv 30: qwen35.rope.dimension_count u32 = 64 llama_model_loader: - kv 31: tokenizer.ggml.model str = gpt2 llama_model_loader: - kv 32: tokenizer.ggml.pre str = qwen35 llama_model_loader: - kv 33: tokenizer.ggml.tokens arr[str,248320] = ["!", "\"", "#", "$", "%", "&", "'", ... llama_model_loader: - kv 34: tokenizer.ggml.token_type arr[i32,248320] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ... llama_model_loader: - kv 35: tokenizer.ggml.merges arr[str,247587] = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",... llama_model_loader: - kv 36: tokenizer.ggml.eos_token_id u32 = 248046 llama_model_loader: - kv 37: tokenizer.ggml.padding_token_id u32 = 248044 llama_model_loader: - kv 38: tokenizer.ggml.add_bos_token bool = false llama_model_loader: - kv 39: tokenizer.chat_template str = {%- set image_count = namespace(value... llama_model_loader: - kv 40: general.quantization_version u32 = 2 llama_model_loader: - kv 41: general.file_type u32 = 15 llama_model_loader: - type f32: 353 tensors llama_model_loader: - type q8_0: 96 tensors llama_model_loader: - type q4_K: 263 tensors llama_model_loader: - type q5_K: 96 tensors llama_model_loader: - type q6_K: 43 tensors print_info: file format = GGUF V3 (latest) print_info: file type = Q4_K - Medium print_info: file size = 15.58 GiB (4.98 BPW) llama_model_load: error loading model: error loading model architecture: unknown model architecture: 'qwen35' llama_model_load_from_file_impl: failed to load model time=2026-02-26T12:19:34.403-06:00 level=INFO source=sched.go:473 msg="NewLlamaServer failed" model=/Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17 error="unable to load model: /Users/danielkliewer/.ollama/models/blobs/sha256-728960e4dda52d4f2af5bee09b2cbe86addfa93220fe9324bfac9dc727605c17" [GIN] 2026/02/26 - 12:19:34 | 500 | 205.052459ms | 127.0.0.1 | POST "/api/chat"
Good — this log tells us exactly what’s wrong. ## 🔥 The Real Problem ``` error loading model architecture: unknown model architecture: 'qwen35' ``` Your Ollama build **does not recognize the `qwen35` architecture** in that GGUF file. That means: - The GGUF model was exported with a newer `llama.cpp` - Your Ollama version is built against an older `llama.cpp` - That version does not yet support Qwen 3.5 This is **not** a corrupted model. This is a **version mismatch**. --- # 🎯 Why This Is Happening The metadata clearly says: ``` general.architecture = qwen35 ``` Support for `qwen35` was added to `llama.cpp` relatively recently. If you're running: - An older Ollama binary - Or a build that didn’t include updated submodules - Or a mismatched release candidate You’ll get exactly this failure. --- # ✅ Fix Option 1 (Recommended): Clean Reinstall Latest Ollama You’re on an M4 Pro with Metal and 38GB free VRAM — so let’s not fight tooling. ### 1️⃣ Fully remove Ollama ```bash brew uninstall ollama rm -rf ~/.ollama ``` (Yes, wipe models — they may be built against incompatible formats.) Then reinstall clean: ```bash brew install ollama ``` Check version: ```bash ollama --version ``` Then pull a known working Qwen: ```bash ollama pull qwen2.5:7b ``` If that works, try your 27B again. --- # ✅ Fix Option 2: If You REALLY Want v0.17.1-rc2 If you're building from source: You must ensure submodules are updated: ```bash git clone --branch v0.17.1-rc2 https://github.com/ollama/ollama.git cd ollama git submodule update --init --recursive go generate ./... go build . ``` If you skip submodules, you get old llama.cpp. --- # 🚨 The “bad manifest” Errors This part: ``` bad manifest ... invalid character 'F' looking for beginning of value ``` Means your model cache or registry manifests are corrupted. That’s another strong reason to: ``` rm -rf ~/.ollama ``` Start clean. --- # 🧠 Important Insight For You You’re running: - Unsloth quantized Qwen3.5-27B - Q4_K - 15.6GB - 262k context (!!) That’s a heavy, bleeding-edge model. Given your experimentation with: - Local orchestration - Custom agents - Long-context systems - Persona injection You probably want stability over bleeding-edge RC builds. --- # 🏆 My Recommendation For You Specifically Given your workflow: 1. Install latest stable Ollama 2. Use official Qwen builds via: ``` ollama pull qwen2.5:14b ``` 3. Only use custom GGUF if you’re doing model research Unsloth Qwen3.5 27B Q4_K is overkill unless you're benchmarking. --- # Quick Question Are you trying to: - Run vision (image-text-to-text)? - Push 200k+ context experiments? - Or just test raw reasoning power? Tell me your goal and I’ll tune the setup specifically for your M4 Pro.
gpt-5-2