Perslis 无障碍
03 / 看图说话

把镜头对准它,得到关于它的话。

一张照片会变成关于画面中真实内容的沟通选项,而不是一张通用词表。图像产出的是候选表达,绝不会自动送出语音。

三种观看方式

运行时会自行区分。

/see 自动判别物品、菜单或场景,你也可以直接指定模式。

输入返回内容
物品——鞋子、手套、食物物品名称、必要时的身体部位关联,以及请求、求助、动作与拒绝等选项。
菜单照片它从页面上读出的菜品名称与价格,附分类与点单句。多页内容归入同一份目录;读错会被显式呈现,而不是掩盖。
场景可见物体、可选的图像矩形框与空间关系,以及与该场景相关的沟通选项。
/object "/path/to/shoes.jpg"
/menu "/path/to/menu-1.jpg" "/path/to/menu-2.jpg"
/scene "/path/to/room.jpg"
/see "/path/to/photo.jpg"
对话得以延续

“看见”不是终点。

扫描之后,普通的对话输入会继续结合已保存的观察结果使用视觉模型:鞋子 →“我需要我的鞋”→“需要帮忙吗?”→ 相关的后续选项。过程中不再发送新图像,运行时也不会声称看到了变化后的场景。/unsee 回到文本模型并保留对话。

数据承诺了什么

观察结果,并明确其边界。

01

框是比例值

{x,y,w,h} 为图像宽高的比例,原点在左上角。这只是模型的观察,不含深度估计,也不构成导航保证。

02

实例彼此区分

关系中带有指向物体列表的索引,因此两个杯子就是两个杯子。名称含糊时返回空索引,而不是臆测。

03

价格只是展示数据

与候选句子相互独立。选择点单磁贴只会说出使用者的话,绝不会提交任何购买或付款。

04

出错会被报告,而非掩盖

识别与 OCR 可能出错。警告与原始条目文本都会暴露给你的复核界面。结果不完整时会显式失败,而不是编造一份菜单。

05

限制是明确的

每次扫描最多八张图,单张 5 MiB、合计 12 MiB。句子永不截断;超出词数限制的回复会被标记为已排除。

06

照片不会留存

图像字节只在请求期间存在。会话快照只保存哈希、类型、大小与观察结果——绝不保存图像本身、路径或 base64。

离线与图像是两个问题

纯文本的儿童模型不会因为配置而获得图像识别能力。本地 Ollama 模型可以在你的主机上处理图像,但它走 HTTP,因此 --offline 同样会切断该连接。仅仅是回环地址并不能证明推理发生在本地。

继续阅读模型与隐私