本地大模型上手:先做一轮小规模验证
先估内存,再用同一组请求验证本地模型的速度与质量;附 Ollama 用量字段和测速公式。
先估权重,不把它当整机需求
粗略权重大小可按参数量×每参数位数÷8计算。7B参数用4位表示约3.5GB十进制权重;运行还需要量化元数据、缓存、临时张量和系统内存,不能据此保证4GB显存就能跑。上下文长度和并发也会增加占用。先查看所选模型的官方运行说明和许可,再决定是否下载。
只选一个模型完成基线
用 Ollama 官方安装方式启动服务,先在终端用 ollama list 查本机实际模型标签,再将下面示例中的占位模型名替换。先做本地短请求,不同时测试多个模型。若尚未安装模型,按官方目录选择硬件可承受的版本并下载;不要把本示例的占位符当成真实模型名。
curl http://localhost:11434/api/generate -d '{
"model": "替换为本机实际模型标签",
"prompt": "把以下反馈分成登录、编辑、导出、其他:导出按钮点击后没有反应。只输出类别。",
"stream": false
}'把首次加载与生成速度分开
记录完整返回中的 load_duration、prompt_eval_count、prompt_eval_duration、eval_count、eval_duration。时长字段按该接口文档以纳秒计算;输出速度为 eval_count÷(eval_duration/1e9)。第一次可能包含模型加载,连续重复五次短请求后再比较。只报 tokens/s 会漏掉加载和读取长输入的等待。
用同样任务检查质量
准备十条带参考答案的反馈分类,包含空输入和含糊表达。记录是否答对、是否服从输出格式和总等待时间。先固定上下文与生成参数;量化更省内存,不代表你的任务质量完全不变。若改量化版本,应重复这组样本,不用一句闲聊判断是否值得替代云服务。
出现问题按顺序排查
模型无法加载:先看可用内存和日志,再减模型规模。短输入快而长文很慢:比较提示处理耗时。运行一阵变慢:看其他进程与内存交换。服务能连但返回404:检查模型标签和接口路径。保存错误信息与配置,不要一遇到问题就同时更新模型、驱动和运行器。
本地不自动等于完全私密
模型请求可留在本机,但下载、插件、联网搜索和遥测可能另有网络行为。需要离线处理时核查实际出站流量与插件配置。服务默认用于本机测试,不要未经认证直接公开端口。交付一份硬件、模型标签、量化、上下文、质量通过数与速度记录,再判断是否用于日常工作。