本文分两部分前半部分梳理基础概念后半部分分析它们在数据开发中的应用场景和边界。第一部分基础概念LLMLLMLarge Language Model的核心机制是基于海量文本训练的 token 预测模型。给定一段上下文模型计算下一个 token 的概率分布并从中采样生成后续文本。基于这一机制LLM 表现出两个基本特征擅长文本生成、代码生成、翻译、摘要、问答——这些是统计语言建模的自然延伸局限模型内化的知识受训练数据截止时间的限制对未知事实可能产生幻觉。推理能力因模型而异早期版本在多步推理上表现较弱随着思维链等技术的引入新一代模型在数学与结构化推理上的准确率已有显著提升RAG / Fine-tune / Pre-train三者是递进关系按让 AI 获取知识的方式从轻到重排列RAG检索增强生成 — 把自己的资料喂给 AI让它边查边答。不需训练只需建立知识库并在提问时检索相关内容。适用于内部文档问答、数据字典查询。Fine-tune微调 — 用自己的数据重新训练基座模型的参数让模型掌握新的知识或风格。需要标注数据成本高于 RAG。适用于特定领域的术语、格式或风格但微调不适用于注入事实性知识。Pre-train预训练 — 从零开始用海量数据训练出一个全新的模型。例如训练出 DeepSeek 系列模型。成本最高仅模型厂商或大型研究团队适用。对比RAGFine-tunePre-train知识注入方式检索外部文档调整模型参数从头训练成本低中极高适用方所有团队有标注数据的团队模型厂商典型场景内部文档问答特定领域风格适配训练新基座模型Agent标准 LLM 的交互模式是单轮请求-响应。Agent 在此基础上加入工具调用、任务规划、多步执行和结果验证。流程用户指令 → 任务分解 → 选择工具 → 执行 → 获取结果 → 判断是否完成 ↓ 未完成 调整策略继续执行Agent 可调用的工具包括数据库连接、API 调用、文件操作、代码执行沙箱等。其能力不在于知道答案本身而在于通过工具链逐步获取所需信息。AI Agent 的三要素大模型 私域知识/经验和方法 工具调用。仅靠大模型只能完成文本生成。加上私域知识和工具调用后Agent 才能解决实际问题。Agent 按作业范围分级级别作业范围说明举例原子能力完成一次问答基础 LLM 调用GPT-4.1、Claude 3.7、Gemini 2.5 Pro活动智能Activity Agent完成一个类型任务封装了特定工具和规则识别和抓取竞品数据、打标识别文本关键词、生成分析总结到文档角色智能体Role Agent完成组合的一系列任务类似 Manus 类产品做一次竞品分析、做一个小游戏并发布上线多智能体流程Multi-Agent Process完成多人协作的复杂任务多个 Agent 分工协作运营一家小游戏公司Agent A 做广告引流Agent B 做开发运维数据开发中涉及的 Agent 主要在活动智能级别——完成某一类标准化任务。角色智能体和多智能体流程更适合产品、运营等跨角色复杂协作场景。Function Call 与 MCP让 Agent 调用外部工具有两种方式Function Call — LLM 内置的能力。模型根据用户意图自行决定调用哪个函数、传什么参数。适用于简单的工具调用场景查天气、做计算。MCP — 标准化协议。MCP Server 封装外部服务MCP ClientAgent 端通过统一协议发现和调用。优势在于每个服务只需封装一次不同 LLM 平台共用同一套 Server。架构┌──────────────────────────┐ ┌──────────────────────────┐ │ MCP ClientAgent 侧 │ ←协议→ │ MCP Server服务端 │ │ 发现可用能力调用工具 │ │ 暴露特定服务 │ │ │ │ SQL 执行、表结构查询、 │ │ │ │ 文件读写、消息发送等 │ └──────────────────────────┘ └──────────────────────────┘SkillAgent 发现工具有哪些之后还需要知道——接到某一类任务时按什么步骤、用什么工具、遵循什么规则来完成。Skill 就是这份结构化的行为指令文档。目录结构skill/ ├── .meta.json ← 注册信息 ├── skill.md ← 主文档指令文档 ├── references/ ← 参考文档 ├── scripts/ ← 可执行脚本 └── examples/各文件职责.meta.json — 注册信息。name 表示 Skill 名称description 定义触发时机skill.md — 指令文档。包含参数表、执行步骤、SQL 模板、禁止规则、错误处理references/ — 详细参考文档如代码生成逻辑、字段定义 schema、示例scripts/ — 可执行脚本。复杂逻辑拆出来让 AI 按需读取Skill 和 LLM、Agent、MCP 的分工概念定位LLM推理引擎Agent任务执行者MCP对接外部服务的协议Skill任务执行规范Skill 不等于 AISkill 是一份结构化指令文档——即使没有 AI 参与一个新人按照 skill.md 的步骤也能完成任务。AI 的价值在于加速执行而非替代规范本身。封装标准同一类任务反复出现步骤基本相同执行流程能写成明确的步骤规则不依赖个人判断出错的代价可控结果能被人工快速验证如果执行路径取决于人的判断如数据异常是否阻断下游或输入本身就存在歧义且依赖上下文才能消除——这类场景不应封装为 Skill。第二部分AI 在数据研发中的应用第二部分AI 在数据研发中的应用数据研发的完整链路可以拆为数据集成 → 数据开发 → 数据质量 → 调度运维 → 数据消费。AI 在每个环节的参与方式不同。数据集成数据探查与元信息整理接入新数据源时AI 辅助分析源表字段结构、数据分布、枚举值范围自动生成字段说明和建表语句。手工翻文档逐一核对字段定义耗时且容易遗漏。非结构化数据入湖日志文件、客服记录等非结构化文本传统入湖方式只做格式转换。加入 LLM 打标后可以在入湖阶段完成情感分类、问题归类、关键字段提取。数据开发SQL 与 ETL 代码生成根据字段映射表源字段→目标字段含类型和转换规则以及命名规范和转换逻辑生成 ODS→DWD→DWS 各层的任务代码。人工只需复核逻辑完整性手写量大幅减少。文档自动生成表 DDL 变更后自动生成数据字典和字段中文说明。表数量越大效率优势越明显。代码规范校验按照 SQL-First 原则、分区过滤、JOIN 完整性等规则全量扫描代码。漏分区字段、枚举值未覆盖、循环依赖等问题在 CI 阶段即可拦截。数据质量质量规则自动配置根据历史数据分布自动建议质量阈值如行数波动上限、非空率底线人工确认后生效。规则在平台配置后按调度自动执行。LLM 打标与回写对非结构化数据用户反馈、客服记录进行自动打标和情感分类。打标结果经抽样校验达标后回写数仓纳入统一资产管理。异常归因辅助数据质量告警触发后AI 扫描相关任务日志和上游依赖标记可能的原因。最终根因确认仍由人完成。调度运维任务部署自动化代码审查通过后Agent 自动识别当前环境将任务注册到调度平台配置依赖关系、调度时间和告警通知。监控与告警优化AI 分析历史运行数据识别频繁误报的告警规则建议调整阈值。减少告警疲劳导致的真实故障被忽略。数据消费内部知识库问答将数据字典、ETL 规范、字段口径文档接入 RAG 知识库。用自然语言查询某字段在哪张表、口径是什么系统检索文档后生成回答。分析报告辅助生成AI 根据分析框架自动生成初版分析报告数据汇总、趋势图表、异常标记分析人员在此基础上补充洞察和结论。人机协同的边界环节AI 角色工程师角色数据探查自动生成字段说明和分布报告确认探查结论处理异常情况代码生成根据蓝图生成 SQL 和任务配置复核逻辑确认口径和转换规则规范校验全量扫描标记不符合规范的代码确认并推动修复质量监控自动执行规则 异常归因建议确认告警有效性做根因决策任务部署自动注册和配置确认部署范围和回滚预案口径管理扫描全量 SQL 标记不一致写法给出收敛建议基于业务语义确认最终口径异常处置比对历史基线标记波动结合业务上下文判断是正常波动还是故障报告生成生成初版报告数据汇总、图表补充洞察和业务判断核心原则AI 承担执行层工作规则明确、重复性高、可自动验证工程师保留决策层判断口径确认、异常处置、架构选型、上下游语义理解。