地铁站、写字楼大堂、医院门诊大厅——智能售货柜正在取代传统的按键式售货机。你开门、拿商品、关门机器自动结算整个过程不到10秒。但有一个问题一直困扰着不少开发者自动售货机到底是怎么“看见”你拿了什么的从“封闭式”到“开放式”交互方式的根本变化传统弹出式售货机的逻辑很简单用户选择货道→支付→电机转动→商品掉落。机器不需要“认识”商品只需要执行机械指令。误拿或偷拿被物理结构完全排除——“封闭式自动售货”最大的优势就是简单、安全、可靠。但这种方式有一个致命缺陷用户只能买机器“允许”他买的东西。一次只能买一件商品被货道限制体验远谈不上“自由”。智能售货柜走的是另一条路自由取货即取即识别。用户开门后可以像逛便利店一样自由挑选关门后系统自动判断拿了什么、拿了几个、有没有放回。三种主流识别技术目前行业内有三种主流技术路线重力识别在每个货架下方安装高精度称重传感器通过重量变化判断商品被取走。优点是成本低、实现简单。缺点是不同商品重量可能相近用户拿了又放回容易误判多人同时操作会互相干扰。射频识别RFID每件商品贴一张RFID标签当商品被拿出货柜时读写器感知到标签“离开”并完成结算。优点是识别准确率高、不受光线影响。缺点是需要给每件商品贴标签运营成本高。视觉识别在货柜顶部安装一至多个摄像头借助深度学习算法实时分析用户动作系统“看到”用户从哪个货架取走了哪件商品。优点是用户体验好、不需要改造商品。缺点是受光线、遮挡等因素影响。视觉识别的技术栈一套完整的视觉识别系统通常采用多路摄像头方案——在货柜内每一层的顶部加装一颗广角摄像头分辨率通常为1080p或更高。摄像头捕捉用户取货全过程AI模型在边缘端或云端逐帧分析视频判断哪些商品被取走。以YOLO系列目标检测算法为例经过优化的模型在商品识别场景中可实现高精度识别。针对零售柜商品摆放密集、部分商品特征难以完全捕捉的问题研究者持续对模型进行改进。在中文零售场景中商品包装上大量使用汉字标识对模型的语言理解能力也提出了更高要求。纯视觉 vs 视觉重力融合在实际工程落地中纯视觉方案存在明显的局限性夜间光线不足时识别准确率下降用户手掌遮挡时漏检率上升相似商品容易混淆。更稳健的方案是视觉重力感应融合——在纯视觉基础上增加重力感应辅助校验。每一层货架部署重力传感器实时监测重量变化。视觉识别结果与重力变化数据交叉验证两者一致才确认交易。实测数据显示融合方案在复杂场景下的识别准确率不低于99.7%光线变化影响较小用户遮挡时即使视觉漏检重力数据仍能完成交易。写在最后从机械控制到深度学习自动售货机的“眼睛”正在变得越来越聪明。对于开发者来说理解视觉识别的技术原理和工程落地细节比单纯追逐“AI概念”更有价值——毕竟真正决定用户体验的不是算法有多炫酷而是在复杂场景下能不能稳定工作。