gear

ollama本地运行AI大模型的方式方法

Admin

2026-08-27

下载地址: https://ollama.com/download/windows

选择合适的量化级别


量化级别显存占用 (7B 模型)推理速度精度损失适用场景
q2_K~2.5GB+150%~5%低配电脑,追求速度
q4_K_M~4GB+120%<2%性价比首选,日常使用
q5_K_M~5GB+80%<1%对精度要求较高
q8_0~7GB+50%几乎无追求最高精度

拓展建议

5.1 推荐生态工具

5.1.1 Open WebUI(图形化界面)

Open WebUI 是一个功能强大的 Web 界面,支持聊天、文档上传、模型管理等功能,界面类似 ChatGPT。


Docker 一键部署:


docker run -d -p 3000:3000 -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

AI写代码

然后访问http://localhost:3000即可使用,它会自动检测本地的 Ollama 服务。


5.1.2 Dify(LLMOps 平台)

Dify 是一个开源的 LLMOps 平台,支持可视化构建 AI 应用、RAG 知识库、工作流等。


Docker Compose 部署: 软件部署教程


git clone https://github.com/langgenius/dify.git

cd dify/docker

docker compose up -d

AI写代码

访问http://localhost:8080,在设置中添加 Ollama 作为模型供应商,Base URL 填写http://host.docker.internal:11434。


5.1.3 LangChain(应用开发框架)

LangChain 是一个用于构建 LLM 应用的框架,支持 RAG、Agent、工具调用等高级功能。


简单 RAG 示例:


from langchain_community.document_loaders import TextLoader

from langchain_text_splitters import RecursiveCharacterTextSplitter

from langchain_community.embeddings import OllamaEmbeddings

from langchain_community.vectorstores import Chroma

from langchain_community.llms import Ollama

from langchain.chains import RetrievalQA

# 加载文档

loader = TextLoader("your_document.txt", encoding="utf-8")

documents = loader.load()

# 文本分割

text_splitter = RecursiveCharacterTextSplitter(chunk_size=500, chunk_overlap=50)

texts = text_splitter.split_documents(documents)

# 创建向量数据库

embeddings = OllamaEmbeddings(model="qwen2.5:7b")

db = Chroma.from_documents(texts, embeddings)

# 创建问答链

llm = Ollama(model="qwen2.5:7b")

qa_chain = RetrievalQA.from_chain_type(llm, retriever=db.as_retriever())

# 提问

result = qa_chain.run("文档中提到了什么内容?")

print(result)

AI写代码


5.2 学习路径建议

初学者阶段(1-2 周):


完成 Ollama 的安装和基础配置

下载并运行几个主流模型,体验不同模型的特点

掌握基本的模型管理命令

学会使用命令行进行对话

进阶阶段(2-4 周):


学习使用 REST API 和 Python SDK

创建自己的自定义模型(Modelfile)

尝试多模态模型进行图片分析

了解量化技术和性能优化方法

高级阶段(1-2 个月):


学习使用 LangChain 构建 RAG 应用

部署 Open WebUI 或 Dify 作为前端界面

尝试微调自己的模型

探索 Agent 和工具调用功能

5.3 常见问题与解决方法

问题 1:模型下载失败或速度极慢

解决方案 1:配置国内镜像源(见 3.2.2 节)

解决方案 2:使用代理

解决方案 3:手动下载 GGUF 模型文件,然后通过 Modelfile 导入:

FROM ./your-model.gguf

AI写代码

ollama create my-model -f Modelfile

AI写代码

问题 2:显存不足,模型无法运行

解决方案 1:使用更低量化级别的模型(如 q4_K_M 或 q2_K)

解决方案 2:使用更小参数量的模型

解决方案 3:增加系统内存,Ollama 会自动使用内存作为显存的补充

解决方案 4:关闭其他占用显存的程序

问题 3:GPU 加速失效

解决方案 1:确保已安装最新的 NVIDIA 驱动

解决方案 2:运行nvidia-smi检查 GPU 是否被识别

解决方案 3:重启 Ollama 服务

解决方案 4:在 Windows 上,确保 Ollama 服务使用的是独立显卡而不是集成显卡

问题 4:端口 11434 被占用

解决方案 1:查找并关闭占用端口的进程:

# Windows

netstat -ano | findstr :11434

taskkill /PID <进程ID> /F

# Linux/macOS

lsof -i :11434

kill -9 <进程ID>

AI写代码

解决方案 2:修改 Ollama 使用的端口:

OLLAMA_HOST=0.0.0.0:11435 ollama serve

AI写代码

5.4 安全注意事项

不要在公共网络上开放 Ollama 服务,除非你已经配置了适当的身份验证

不要将敏感 数据发送给未经验证的第三方模型

定期更新 Ollama 到最新版本,以获取安全补丁和性能改进

注意模型的许可证,有些模型禁止商业使用

总结

Ollama 极大地降低了本地大模型部署的门槛,让每个人都能拥有自己的私人 AI 助手。通过本指南,你已经掌握了 Ollama 的安装、配置、基础使用和高级技巧。接下来,你可以根据自己的需求,探索更多有趣的应用场景,比如构建个人知识库、开发 AI 应用、或者深入学习大模型技术。