框是比例值
{x,y,w,h} 为图像宽高的比例,原点在左上角。这只是模型的观察,不含深度估计,也不构成导航保证。
一张照片会变成关于画面中真实内容的沟通选项,而不是一张通用词表。图像产出的是候选表达,绝不会自动送出语音。
/see 自动判别物品、菜单或场景,你也可以直接指定模式。
| 输入 | 返回内容 |
|---|---|
| 物品——鞋子、手套、食物 | 物品名称、必要时的身体部位关联,以及请求、求助、动作与拒绝等选项。 |
| 菜单照片 | 它从页面上读出的菜品名称与价格,附分类与点单句。多页内容归入同一份目录;读错会被显式呈现,而不是掩盖。 |
| 场景 | 可见物体、可选的图像矩形框与空间关系,以及与该场景相关的沟通选项。 |
/object "/path/to/shoes.jpg"
/menu "/path/to/menu-1.jpg" "/path/to/menu-2.jpg"
/scene "/path/to/room.jpg"
/see "/path/to/photo.jpg"扫描之后,普通的对话输入会继续结合已保存的观察结果使用视觉模型:鞋子 →“我需要我的鞋”→“需要帮忙吗?”→ 相关的后续选项。过程中不再发送新图像,运行时也不会声称看到了变化后的场景。/unsee 回到文本模型并保留对话。
{x,y,w,h} 为图像宽高的比例,原点在左上角。这只是模型的观察,不含深度估计,也不构成导航保证。
关系中带有指向物体列表的索引,因此两个杯子就是两个杯子。名称含糊时返回空索引,而不是臆测。
与候选句子相互独立。选择点单磁贴只会说出使用者的话,绝不会提交任何购买或付款。
识别与 OCR 可能出错。警告与原始条目文本都会暴露给你的复核界面。结果不完整时会显式失败,而不是编造一份菜单。
每次扫描最多八张图,单张 5 MiB、合计 12 MiB。句子永不截断;超出词数限制的回复会被标记为已排除。
图像字节只在请求期间存在。会话快照只保存哈希、类型、大小与观察结果——绝不保存图像本身、路径或 base64。
纯文本的儿童模型不会因为配置而获得图像识别能力。本地 Ollama 模型可以在你的主机上处理图像,但它走 HTTP,因此 --offline 同样会切断该连接。仅仅是回环地址并不能证明推理发生在本地。