capybara近期更新涵盖五大核心功能:一、多模态统一接口启用;二、“截图即记”增强引擎上线;三、“词云快拍”模式开放;四、kairos多模态记忆系统深度集成;五、网络安全漏洞推演模块升级至att&ck v14.1标准。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您正在使用人工智能Capybara相关应用或服务,却发现功能界面、响应逻辑或输出结果与以往存在明显差异,则很可能是因近期版本更新所致。以下是Capybara在2026年3月中下旬至4月初集中上线的核心功能更新内容:
一、多模态统一接口全面启用
该更新将文本、图像、视频三类输入模态整合至同一推理主干,取消原有任务专用子模型调用路径,实现指令驱动下的动态行为切换。用户无需切换工具或重选模式,仅通过自然语言描述即可触发对应生成或编辑动作。
1、向系统提交任意组合输入,例如“一张咖啡馆手绘草图+‘改造成赛博朋克风格,加入全息菜单屏’”。
2、模型自动识别草图结构为视觉锚点,将文本指令解析为风格迁移与元素注入操作。
3、输出结果保持原始构图拓扑不变,仅叠加指定视觉语义特征并补全三维细节。
二、“截图即记”增强引擎上线(咔皮记账v2.3.1)
此功能专为消费场景设计,通过本地化OCR优化模块提升中文模糊图像识别鲁棒性,使零操作记账真正落地。所有处理均在设备端完成,不上传原始截图。
1、打开咔皮记账App,点击底部“+”按钮,选择“截图导入”。
2、从相册选取支付宝/微信支付成功页、银行短信截图或电子小票PDF文件。
3、系统在98.7%准确率下自动提取金额、商户名、时间及消费类目,并同步写入账本。
三、“词云快拍”模式正式开放(卡皮巴拉单词相机v1.0.5)
该模式突破单图单词识别限制,利用跨模态记忆锚点技术,实现画面中多个英文单词的并行识别与语境联动生成,强化外语学习中的视觉-语义绑定效率。
1、启动卡皮巴拉单词相机,对准含多个英文单词的实物或屏幕画面。
2、点击快门后,模型在320ms内完成识别,最多定位并标注5个目标词汇。
3、为每个单词自动生成关联短语、发音对比波形图及带音标标注的离线释义卡片。
四、KAIROS多模态记忆系统深度集成
此次更新将用户长期行为建模能力从后台服务层下沉至终端交互链路,使模型能基于空间语义索引、术语映射关系、情绪反馈信号和工具路径偏好,实时调整响应策略,无需显式记忆开关。
1、在会议笔记App Capy中连续三次使用“跳过原理直接给命令行”类表述,系统将自动标记为周三下午调试CI失败后的惯用指令模式。
2、后续同类场景触发时,模型跳过解释性段落,直接输出可执行命令及参数说明。
3、用户可在设置中进入「Memory Vault」查看向量化摘要快照,并对任一记忆片段点击「Forget this context」即时剥离。
五、网络安全漏洞推演模块升级至ATT&CK v14.1兼容标准
该更新强化了对新兴攻击面(如LLM API滥用、AI训练数据投毒、可信执行环境侧信道)的模式识别能力,输出结果已嵌入MITRE ATT&CK最新战术编号体系,支持红蓝对抗复现与防御策略反推。
1、上传目标系统Nmap扫描XML报告或服务Banner文本。
2、输入提示词“识别是否存在DNS隧道隐蔽通信”,模型解析载荷编码特征并标记异常字符序列。
3、输出结果中每项推演步骤均附带对应ATT&CK技术编号,例如T1059.004(命令行接口:PowerShell)或T1566.001(网络钓鱼:邮件)。











