解决codex接入Deepseek后不能识别图片!!!!别再让 Codex 当“文盲“了!这个开源 Skill 让它直接看懂你的截图
我做了什么我写了一个开源的 Codex 技能read-image识图。它的逻辑很简单你贴一张图它把图片交给视觉大模型看图说话再把结果带回对话里给你。默认走阿里云百炼的 Qwen-VL有免费额度日常使用几乎不花钱支持任意 OpenAI 兼容的视觉模型GPT-4o、GLM-4V、Kimi 都能换纯 Python 标准库实现零第三方依赖Windows / macOS / Linux 通吃实测效果把一张阿里云控制台的截图丢进去几秒钟就返回里面的全部文字一个不漏。为什么值得装不折腾复制文件夹到技能目录 配一个 key三步搞定省钱qwen-vl-plus 自带免费额度识别一次几分钱甚至不要钱可控接口、模型、提示词全部可自定义不绑死某一家厂商安全密钥只存在你本地代码里没有硬编码仓库里不会泄露怎么用真的只要三步# 1. 克隆 git clone https://gitee.com/jie_1999/read-image-codex.git# 2. 复制到 Codex 技能目录 # Windows 示例把 read-image 文件夹放到 # C:\Users\你的用户名\.codex\skills\ # macOS / Linux 则是 ~/.codex/skills/# 3. 配置 API key二选一 # 方式 A设置环境变量 # DASHSCOPE_API_KEY你的key # 方式 B新建密钥文件 scripts/dashscope_key.txt # 里面放一行 sk- 开头的 key 即可然后新开一个 Codex 对话粘贴图片说一句识别这张图片里的文字完事。想换模型两个环境变量的事export DASHSCOPE_ENDPOINThttps://你的接口/v1/chat/completions export DASHSCOPE_MODEL你的模型名原理就三行话图片 → base64 编码 → 发给视觉大模型的 chat/completions 接口 → 返回文字。至于 Skill 本身就是一份SKILL.md告诉 Codex 什么时候该用 一个几十行的 Python 脚本。这个思路谁都能复刻我只是把坑都踩完了打包好直接给你。求个 Star项目地址https://gitee.com/jie_1999/read-image-codex如果对你有用欢迎 Star、提 issue、转发给同事和群友。也欢迎告诉我你还想让它识别什么场景说不定下个版本就加进去了。如果你也在用 Codex 干活这个技能大概率用得上。装一次之后一直能用。