AI 搬家复原 Agent 项目说明文档
AI 搬家复原 Agent 项目说明文档团队名称念头通达项目名称AI 搬家复原 Agent开源仓库https://github.com/seandongAne/niantoutongda-dgx-sparkDemo 视频https://www.bilibili.com/video/BV1KbKH6sEuP/?vd_source11420bee6af944cfd208ce18c89a53d7赛事征文https://zhuanlan.zhihu.com/p/2062866864926089565项目报告书https://blog.csdn.net/weixin_42963573/article/details/163082319?spm1011.2415.3001.10575sharefrommp_manage_linkAI 辅助说明本文使用 AI 工具进行结构整理和语言润色项目指标、技术边界、运行结果和证据链均来自项目实际材料。1. 项目概述搬家真正困难的部分往往不是把物品从 A 点搬到 B 点而是把一个家已经形成的使用习惯、物品关系和空间秩序一起迁移到新环境。传统搬家服务交付的是箱子传统收纳服务依赖人工经验而用户真正痛苦的是到了新家之后找不到东西原本顺手的生活组合被拆散厨房、书桌、洗漱、儿童用品、老人常用物品等日常动线突然失效。AI 搬家复原 Agent 面向这个真实场景构建了一套运行在 NVIDIA DGX Spark 上的本地多模态智能体系统。系统接收三段旧居视频、一段口述旁白和一段新居扫描在本地完成物品识别、跨视角身份聚合、生活组合恢复、新居区域理解、约束布局求解和任务卡生成最终输出一套可执行、可验收、可回放的搬家复原方案。项目的目标不是做一个简单的“物品检测 Demo”而是回答更完整的问题旧家里哪些东西是真正可信的物品哪些物品应该一起搬、一起放、一起验收新家里哪些区域适合承接这些生活组合搬家人员或未来的家务机器人应该按照什么顺序执行每一步结论能不能追溯到原始视频、模型输出和求解结果2. 作品特点与核心亮点第一项目从真实家庭搬家痛点出发。系统不是只生成一份物品清单而是试图恢复“物品、习惯、区域、动作”之间的关系把旧家的生活秩序迁移到新家。第二项目输入方式贴近普通用户。用户只需要提供三类自然材料旧居随手拍视频、口述说明、新居扫描视频。系统再把这些非结构化材料转化为可信物品记忆、生活组合、目标区域和执行任务卡。第三项目形成了完整的四 Agent 闭环。MEM Agent 负责物品身份、跨镜头追踪和最小澄清问题GROUP Agent 根据视觉证据与口述线索恢复生活组合SPACE Agent 理解新居空间并生成候选区域EXEC Agent 调用约束求解器生成布局方案和可执行任务卡。第四项目强调 DGX Spark 本地部署价值。家庭视频、空间结构和生活习惯属于高度敏感数据本项目把视觉、语音、视觉语言模型、优化求解和审计回放尽量收进同一台本地设备体现了 DGX Spark 在隐私敏感多模态 Agent 应用中的平台优势。第五项目不是黑箱输出而是保留可复核证据链。Agent 之间通过 Pydantic v2 定义 JSON / JSONL 消息每条关键消息包含message_id、因果引用、producer 和 SHA-256 payload hash最终通过 trace replay 和 bundle 支持复查。3. 技术实现方案3.1 多模态输入与信息抽取系统输入由三段旧居视频、一段口述旁白和一段新居扫描组成。旧居视频负责提供真实物品、摆放区域、生活组合和视觉证据口述旁白负责补充视觉难以判断的使用习惯、偏好、家庭成员使用场景和特殊注意事项新居扫描负责提供新家可用区域、柜体、桌面、墙架、梳妆台、抽屉柜等承接位置。语音侧使用 Step-Audio 2 mini 将自然语言旁白整理为结构化生活线索。视觉侧使用 Grounding DINO 完成开放词汇目标发现解决普通检测模型类别固定的问题。跨视角身份建模使用 DINOv2 冻结视觉骨干配合轻量投影头提取特征再通过匈牙利匹配、质量门、hard gate 和 ReID 约束把同一件物品在不同镜头中的碎片重新连接起来。经过这条链路系统得到的不是简单检测框列表而是一份带证据、关系和置信度的“家庭物品记忆”。3.2 四 Agent 协作链路MEM Agent 维护可信物品身份处理跨镜头追踪、重复候选收敛和最小澄清问题。它的目标是把大量原始视觉实体收敛为下游可用的可信物品而不是把噪声全部交给后续流程。GROUP Agent 负责恢复生活组合。它根据口述线索、视觉共现和物品语义判断哪些东西应该一起搬、一起装箱、一起摆放和一起验收。例如学习文具、杯具饮品、洗漱护理、技术玩具和零食收纳等组合都属于比单件识别更贴近用户实际需求的生活单元。SPACE Agent 负责理解新居空间。它把新居扫描中的空间观察转化为候选区域图并筛选出可以承接生活组合的目标区域。EXEC Agent 负责把结果转化为执行计划。它调用 OR-Tools CP-SAT在容量、支撑、电源、共置、互斥、风险和区域适配等约束下求解布局再把布局方案编译为搬家人员可直接执行和验收的任务卡。3.3 结构化通信与可回放审计Agent 之间不依赖隐式聊天上下文而是使用 Pydantic v2 定义结构化消息并通过 JSON / JSONL 记录每一次关键交接。每条消息带有message_id、因果引用、producer 和 SHA-256 payload hash因此一次运行可以严格回放任意结论也可以追溯到原始视频、模型输出、空间区域、约束求解结果和任务卡。在 Spark 验收阶段系统已经以独立进程完成 MEM / SPACE 并行 fan-out 与 EXEC 确定性 fan-in使四 Agent 从概念分工落到了可验证的工程边界。4. 架构设计思路整体架构可以概括为旧居视频 口述旁白 新居扫描 - 多模态感知 - 可信物品记忆 - 生活组合恢复 - 新居空间理解 - 约束布局求解 - 可执行任务卡 - trace replay SHA-256 bundle系统分为六层输入层、多模态感知层、可信记忆层、Agent 编排层、约束求解与交付层、证据审计层。这样的设计有三个好处感知结果不会直接变成最终结论中间经过可信记忆和质量门收敛降低误检、重复检测和跨镜头混淆对下游的影响。生活组合、空间区域和任务卡分别由不同 Agent 负责职责清晰便于定位问题也便于未来替换模型或增强局部能力。最终结果不是一次性文本而是结构化产物可以被用户、评委、搬家人员、收纳管理师或未来家务机器人继续消费。5. DGX Spark 本地部署与模型优化项目以 DGX Spark 的 GB10 和 128 GB 统一内存作为计算底座将视觉、语音、视觉语言模型、组合优化和证据回放集中在同一台本地设备上运行。这个选择与场景高度匹配家庭视频和空间数据不适合无控制地上传云端本地推理既保护隐私也让系统在网络不稳定或不能出网的环境中保留可用性。本地视觉语言模型服务使用 Nemotron Nano 12B V2 VL采用 NVFP4 权重并通过 vLLM 服务化。在项目测试中图像任务吞吐从约 1.7 tok/s 提升到 25.4 tok/s约为原始 BF16 Transformers 路径的 15 倍。这个优化让视觉语言判断能够进入实际链路而不是只作为离线说明材料。在 ReID 方向项目在 Spark 本地训练 DINOv2 轻量投影头并扫描 18 组工作点将 ReID R1 提升到 0.8475同时把澄清量从 1379 降至 677。这一部分直接服务于“少问用户、少把噪声交给下游”的产品目标。研发阶段使用 StepFun 3.7 Flash 对难样本进行错误归因和伪标签建议用于辅助定位检测、聚合和链路问题。正式运行链路中则强调家庭数据本地处理不把云端辅助能力包装成本地部署成果。面向视觉推理链路的 TensorRT 部署正在进行 engine 构建、输出一致性和吞吐测试测试结果将接入同一套可回放证据链。当前文档只把 TensorRT 作为正在验证的优化路径不把尚未完成的 FP16 TensorRT 结果写成正式生产结论。6. NVIDIA / StepFun 技术栈说明模块使用技术作用本地计算平台NVIDIA DGX Spark、GB10、128 GB 统一内存承载本地多模态推理、训练、求解和证据回放本地视觉语言模型NVIDIA Nemotron Nano 12B V2 VL、NVFP4、vLLM支持图文理解与本地模型服务化推理优化NVIDIA TensorRT、torch.compile、等价性测试验证视觉推理链路的性能优化与输出一致性视觉检测Grounding DINO开放词汇目标发现跨视角特征DINOv2、轻量投影头、ReID建立同一物品在不同镜头中的身份关联语音理解Step-Audio 2 mini将口述旁白结构化为生活线索研发辅助StepFun 3.7 Flash难样本归因、伪标签建议和开发期错误分析约束求解OR-Tools CP-SAT在空间、容量、支撑、电源、共置和互斥约束下生成布局Agent 契约Python、Pydantic v2、JSON / JSONL保证多 Agent 交接结构化、可验证证据工程YAML、SHA-256、trace replay、bundle保证结果可回放、可复核、可提交7. 实测结果与证据链在完整实测链路中系统已经跑通从旧居感知到新居任务卡的闭环指标结果原始视觉实体3306可信物品20澄清问题不超过 4 个生活组合3 个独立装箱 / 收纳单元2 个物品覆盖20/20新居空间观察2278候选区域168最终放置区域5空间评分5/5布局求解状态PLAN_READY任务卡5 张四 Agent replayPASSSHA-256 阶段产物44 份这组结果说明项目已经完成比赛级规划闭环从旧家的声音、物品和关系到新家的空间、布局和任务卡都已经转化为可执行、可验收、可追溯的结构化产物。系统保存的不是一份孤立清单而是一套可以被重新建立的生活秩序。8. 应用价值与未来延展本项目具有明确行业落地价值。对家庭用户它可以减少搬家后找不到东西、生活动线被打乱的焦虑对收纳管理师它可以沉淀预勘、访谈、箱单、摆放建议和验收证据对搬家公司它可以把服务从“运输箱子”升级为“交付可复原的生活秩序”对长租公寓、民宿、适老化改造、家政交接和家庭资产盘点它也可以提供标准化的空间复位和物品状态记录。更进一步AI 搬家复原 Agent 沉淀的“物品在哪里、常和什么一起使用、适合放在哪个区域、执行时有哪些约束、完成后如何验收”这类家庭语义资产可以成为未来家务机器人或家庭具身智能系统的指令中枢之一。机器人不只需要看见物体还需要理解物品关系、家庭习惯、空间语义和任务优先级。本项目生成的任务卡、区域约束和证据链正好可以向这一方向扩展把“把常用水杯放回展示柜上层”“把学习文具归位到书桌右侧抽屉”这类自然生活指令转化为带目标区域、约束条件和验收标准的结构化任务。项目后续会继续增强多家庭、多户型和多拍摄质量下的鲁棒性补充真实搬后照片验收扩展用户反馈闭环并把任务卡进一步产品化为可交互执行清单和机器人可消费的任务协议。