‹ 返回笔记 Esc·

Ollama 命令

Ollama 创建自定义模型 --- Ollama 远程测试状态 API:https://github.com/ollama/ollama/blob/main/docs/api.md --- Olla…

Ollama 创建自定义模型

1touch Modelfile
2vim Modelfile
1FROM /Users/zailiang/Downloads/qwen1_5-0_5b-chat-q5_k_m.gguf
2
3# set the temperature to 1 [higher is more creative, lower is more coherent]
4PARAMETER temperature 1
5
6SYSTEM """
7If you're asked who you are or who developed it, you have to say I'm an alien from the universe
8"""
1ollama create example -f Modelfile
2ollama list
3ollama run example

Ollama 远程测试状态

API:https://github.com/ollama/ollama/blob/main/docs/api.md

1curl http://192.168.2.42:11434/api/tags

Ollama 服务以 0.0.0.0 启动

1sudo vim /etc/systemd/system/ollama.service

在 [Service] 部分,添加以下行以设置 OLLAMA_HOST 环境变量,使其监听所有网络接口的指定端口(默认端口为 11434):

1[Service]
2Environment="OLLAMA_HOST=0.0.0.0:11434"
1sudo systemctl daemon-reload
2sudo systemctl restart ollama
3sudo systemctl status ollama
4sudo netstat -tulnp | grep 11434

Ollama 开启代理

1  Environment="http_proxy=http://192.168.2.41:20172"
2  Environment="https_proxy=http://192.168.2.41:20172"

Ollama 运行 Huggingface ModelScope 模型

1ollama run hf.co/unsloth/DeepSeek-R1-Distill-Qwen-7B-GGUF:Q4_K_M
2ollama run modelscope.cn/Qwen/Qwen2.5-3B-Instruct-GGUF:Q3_K_M

hf.co = huggingface.co

https://www.modelscope.cn/docs/models/advanced-usage/ollama-integration


Ollama 模型跑分

1ollama run gemma4:31b --verbose "用中文写一篇关于人工智能的500字文章"
1total duration:       27.48292873s
2load duration:        644.267865ms
3prompt eval count:    28 token(s)
4prompt eval duration: 76.864355ms
5prompt eval rate:     364.28 tokens/s
6eval count:           981 token(s)
7eval duration:        25.683681903s
8eval rate:            38.20 tokens/s
指标 数值 说明
生成速度 38.20 tokens/s 核心指标,模型输出文字的速度
读取输入速度 364.28 tokens/s 处理你输入问题的速度
总耗时 27.48s 含加载+推理全程
加载耗时 0.64s 模型已在内存中,加载很快
输出 token 数 981 tokens 本次生成了约 700 字

怎么评价这个成绩?

38.20 tokens/s 对于 31B 模型来说属于中等偏好的水平。

参考对比:

  • 🐢 低于 15 tokens/s → 慢,体验较差
  • ✅ 15~40 tokens/s → 正常,流畅可用
  • 🚀 40+ tokens/s → 快,体验很好

你的 38.20 接近“流畅”上限,说明你的硬件跑 31B 模型还是比较给力的。