纲要大模型资源AI Agent 的“燃料”闭源模型与开源模型的分野资源获取的核心考量闭源模型实战以智谱 AI 为例注册与 API Key 申请流程核心模型列表与适用场景并发限制与速率控制策略计费模式与成本参考完整的 Python 调用示例开源模型实战使用Ollama本地部署Ollama简介与多平台安装常用命令速查拉取并运行首个模型以deepseek-r1:7b为例交互式对话与退出Ollama的 HTTP API 及 Python 集成硬件需求参考闭源 vs 开源选型决策速查表总结与后续路径大模型资源AI Agent 的“燃料”对于 AI Agent 开发者而言首要任务并非编写复杂的工作流代码而是获取可用的模型推理资源。无论是构建对话系统、知识库问答还是自动化任务执行单元其核心皆依赖大语言模型Large Language Model, LLM的推理能力作为“大脑”。当前获取模型资源的主流路径分为两条闭源模型Proprietary Models通过 API 调用厂商托管的模型服务开箱即用按 token 消耗量计费。开源模型Open-Source Models下载模型权重文件进行本地部署数据完全自持无需网络访问但依赖本地硬件算力。本章旨在引导开发者完成两项关键实操在智谱 AI 开放平台申请闭源模型的 API 访问密钥以及利用Ollama工具在本地环境中部署并运行开源模型。完成这两项基础准备后即可获得构建 Agent 应用的模型能力层。闭源模型实战以智谱 AI 为例获取 API 资源注册与申请 API Key智谱 AI 提供涵盖语言、多模态等方向的完整模型矩阵其开发者平台对国内用户友好且定价策略清晰。API Key 的申请流程如下访问 open.bigmodel.cn注册/登录账号进入控制台点击右上角钥匙图标创建新的 API Key填写名称并确认复制 Key 保存备用获取 Key 后可在控制台查阅完整的可用模型列表。当前阶段值得重点关注的模型包括GLM-4-Plus旗舰级语言模型支持 128k 上下文窗口综合能力最强。GLM-4-Flash轻量高速版本默认最大并发数为 200适合高吞吐量场景。GLM-4V-Plus多模态模型支持图像理解与视觉推理任务。并发限制与速率控制在 Agent 开发中并发限制是影响系统稳定性的关键细节。智谱 AI 对不同模型设定了差异化的默认并发上限模型最大并发数GLM-4-Plus50GLM-4-Flash200GLM-4V-Plus30参考值当应用面临突发流量或批量任务时前端需实现限流、排队或退避重试机制否则超出并发阈值将直接返回错误响应。生产环境中建议优先选用GLM-4-Flash以获取更高吞吐或采用异步请求管理框架如asyncioaiohttp来提升并发效率。计费模式与价格智谱 AI 采用按量计费模式以 1000 tokens 为计价单位。以GLM-4-Plus为例单次交互输入与输出合计成本约为0.05 元 / 千 token对于个人开发者和中小规模项目极具性价比。用户可在控制台进行在线充值并可设置用量告警阈值以防止超额消费。完整的 Python 调用示例以下脚本展示了通过兼容 OpenAI 的 SDK 调用智谱GLM-4-Flash模型实现基础对话的完整流程。前置步骤安装依赖pip install openai替换代码中your-api-key为真实的 API Key。直接运行脚本。importosfromopenaiimportOpenAI# 初始化客户端指向智谱 AI 的 OpenAI 兼容接口clientOpenAI(api_keyyour-api-key,# 替换为实际申请的智谱 API Keybase_urlhttps://open.bigmodel.cn/api/paas/v4/)defchat_with_glm(prompt:str,model:strglm-4-flash)-str: 发送用户消息并获取模型回复 responseclient.chat.completions.create(modelmodel,messages[{role:user,content:prompt}],temperature0.7,max_tokens512,)returnresponse.choices[0].message.contentif__name____main__:question请用一句话解释什么是 AI Agentanswerchat_with_glm(question)print(用户:,question)print(助手:,answer)该脚本通过 API 调用实现了模型推理开发者无需关心底层 GPU 资源调度适用于快速原型验证和轻量级项目开发。如需测试多模态能力可切换模型为glm-4v-plus并参照官方文档构造包含图片 URL 或 Base64 编码的消息内容。开源模型实战使用 Ollama 本地部署你的第一个大模型若项目涉及敏感数据、需规避网络延迟或期望自由切换不同开源模型权重Ollama是当前社区公认最便捷的开源模型托管工具。它原生支持 macOS、Linux 和 Windows提供从模型拉取到命令行交互的一站式体验。安装 Ollama访问 Ollama 官方网站 下载对应操作系统版本并完成安装。安装完毕后打开终端命令行输入ollama若输出帮助信息则说明安装成功。# 验证安装并查看版本ollama-v常用命令速查命令功能描述ollama list列出本地已下载的所有模型ollama pull 模型名从官方仓库拉取指定模型如deepseek-r1:7bollama run 模型名启动模型并进入交互式对话模式/bye退出当前对话会话ollama rm 模型名删除本地指定的模型文件拉取并运行你的第一个模型以近期备受关注的推理增强模型DeepSeek-R1的 7B 量化版本为例# 拉取模型大小约 4.7GBollama pull deepseek-r1:7b# 查看本地模型列表确认ollama list预期输出示例NAME ID SIZE MODIFIED deepseek-r1:7b 6e4c38f0a6e3 4.7 GB 2 minutes ago启动交互式对话ollama run deepseek-r1:7b模型加载完成后可直接输入问题。该模型会先输出其内部的思维链Chain of Thought随后给出最终答案。例如 什么是 AI Agent 思考过程... AI Agent 是一种能够感知环境、自主决策并执行动作的智能实体...如需退出输入/bye即可。通过 API 调用本地 Ollama 模型Ollama 除提供命令行界面外默认监听http://localhost:11434并暴露兼容 OpenAI 格式的 HTTP API。这意味着开发者可使用标准的openaiPython 库直接调用本地模型无需联网且不产生 token 费用。以下示例展示了如何调用已下载的qwen2.5:7b模型或替换为任意已拉取的模型名fromopenaiimportOpenAI# 连接到本地 Ollama 服务clientOpenAI(base_urlhttp://localhost:11434/v1,api_keyollama# 本地服务不校验 Key任意字符串即可)defask_local_model(prompt:str,model:strqwen2.5:7b)-str:responseclient.chat.completions.create(modelmodel,messages[{role:user,content:prompt}],temperature0.7,max_tokens512)returnresponse.choices[0].message.contentif__name____main__:print(本地模型回复:,ask_local_model(简要说明 RAG 的工作原理))执行前提Ollama 服务需保持后台运行安装后通常默认自启或手动执行ollama serve。目标模型须已通过ollama pull完成下载。本地推理速度直接受硬件配置影响。对于 7B 参数量的模型建议配备至少8GB 显存的 GPU如 NVIDIA RTX 3060 及以上若仅依赖 CPU 推理速度会显著下降但仍可运行。对于 13B 及以上规模的模型建议使用云 GPU 实例或高性能服务器。其他开源模型部署工具简介除 Ollama 外社区中还有其他成熟的部署方案LM Studio提供图形化界面支持从 Hugging Face 直接下载模型并进行交互操作直观。vLLM/Text Generation Inference (TGI)面向生产环境的高性能推理引擎支持 PagedAttention、持续批处理等高级优化特性。对于入门阶段Ollama 凭借其极简的安装与使用体验是降低试错成本的最佳选择。闭源 vs 开源选型决策速查表维度闭源 API如智谱 AI、OpenAI开源本地部署如 Ollama使用门槛极低注册账号即可调用需自行安装配置依赖本地硬件推理成本按 token 消耗计费高频场景成本累积较快一次性硬件投入后续推理边际成本趋近于零数据隐私请求数据需上传至厂商服务端完全本地化处理数据无外泄风险模型更新厂商自动升级模型版本需手动拉取新权重或重新部署定制化能力主要依赖提示词工程与上下文注入支持模型微调、量化压缩、架构修改适用场景快速原型验证、中小规模应用、低延迟要求隐私敏感业务、高频批量调用、深度定制需求在实际工程实践中通常采用混合策略在开发阶段借助闭源 API 快速迭代验证逻辑待需求稳定后再依据成本、隐私和性能要求逐步将推理链路迁移至本地开源模型。总结与后续路径通过本章的实操演练开发者应已掌握以下核心技能在智谱 AI 开放平台完成注册、API Key 申请并通过 Python 脚本调用闭源模型接口。使用 Ollama 工具在本地完成开源模型的下载、运行并通过兼容 OpenAI 的 API 将其集成至代码工程。上述两种模型资源获取方式覆盖了绝大多数 AI Agent 开发场景的初始需求。在具备可用的模型推理能力后后续可进阶学习提示词工程、检索增强生成RAG系统搭建以及多步工作流编排等关键技术逐步构建具备复杂认知与执行能力的智能体应用。API 速览智谱 AI 兼容 OpenAI 接口库openai(v1.0.0)端点https://open.bigmodel.cn/api/paas/v4/方法client.chat.completions.create核心参数model(str): 模型名称如glm-4-flash、glm-4-plus。messages(list): 对话消息列表支持system、user、assistant角色。temperature(float): 采样温度控制随机性范围 0-1。max_tokens(int): 生成回复的最大 token 长度。返回ChatCompletion对象通过response.choices[0].message.content获取回复内容。Ollama 兼容 OpenAI 接口库openai(v1.0.0)端点http://localhost:11434/v1方法client.chat.completions.create核心参数同 OpenAI 标准接口model须为已下载的本地模型名称。返回同 OpenAI 标准响应格式。前置条件Ollama 服务须处于运行状态且目标模型已拉取至本地。Demo 示例以下提供一份完整的可运行脚本演示如何通过统一接口风格同时调用智谱 AI 闭源模型与本地 Ollama 开源模型便于开发者进行效果对比或渐进式迁移。运行说明安装依赖pip install openai替换脚本中的ZHIPU_API_KEY为实际值。确保本地 Ollama 服务已启动且已下载qwen2.5:7b模型。直接运行脚本。importosfromopenaiimportOpenAI# ---------- 配置区 ----------ZHIPU_API_KEYyour-zhipu-api-key# 替换为智谱 AI 真实 KeyOLLAMA_BASEhttp://localhost:11434/v1ZHIPU_BASEhttps://open.bigmodel.cn/api/paas/v4/# ---------- 初始化客户端 ----------zhipu_clientOpenAI(api_keyZHIPU_API_KEY,base_urlZHIPU_BASE)ollama_clientOpenAI(api_keyollama,base_urlOLLAMA_BASE)# ---------- 通用调用函数 ----------defcall_model(client,model_name:str,prompt:str)-str:responseclient.chat.completions.create(modelmodel_name,messages[{role:user,content:prompt}],temperature0.7,max_tokens512,)returnresponse.choices[0].message.content# ---------- 执行示例 ----------if__name____main__:test_prompt请用一句话解释什么是 AI Agentprint( 智谱 AI (GLM-4-Flash) )try:zhipu_replycall_model(zhipu_client,glm-4-flash,test_prompt)print(zhipu_reply)exceptExceptionase:print(f调用智谱 API 失败:{e})print(\n 本地 Ollama (qwen2.5:7b) )try:ollama_replycall_model(ollama_client,qwen2.5:7b,test_prompt)print(ollama_reply)exceptExceptionase:print(f调用本地 Ollama 失败:{e})技术点总结统一的openaiSDK 抽象层降低了多服务切换的适配成本。异常捕获机制增强了示例的鲁棒性便于调试。配置与逻辑分离符合生产级代码的基本规范。参考文档官方文档智谱 AI 开放平台官方文档Ollama 官方文档OpenAI Python SDK 官方文档参考链接智谱 AI 模型列表与并发限制说明Ollama 模型仓库 (Library)DeepSeek-R1 技术报告总结本文系统梳理了 AI Agent 开发中获取模型推理资源的两种主流路径基于闭源 API 的云端调用方案以智谱 AI 为例与基于开源模型的本地部署方案以 Ollama 为例。内容涵盖了从账号注册、环境配置到代码集成的完整生命周期并提供了可直接投入项目实践的 Python 代码示例。开发者可根据自身对成本、隐私、硬件和定制化程度的需求灵活选择或组合运用上述方案。