新手需按五步路径入门灵珠ai平台:一、完成官网注册、实名认证与rokid眼镜绑定;二、创建智能体并结构化定义角色;三、配置视觉工作流,选用doubao-seed-1-6-vision模型;四、搭建免手持ocr速读闭环;五、分环节调试端云交互链路。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您刚接触灵珠AI平台,面对零代码界面、模型选择、工作流编排等模块感到无从下手,则可能是由于缺乏系统性操作路径与关键节点认知。以下是实现从新手入门到高效使用的完整学习路径:
一、完成基础环境搭建与账号认证
该步骤是所有后续操作的前提,确保您具备合法访问权限与设备联调能力。未完成实名认证将无法创建智能体或调用视觉模型。
1、访问灵珠平台官网 https://rizon.rokid.com/space/home,使用手机号注册并完成实名认证。
2、登录后进入「个人中心」,绑定 Rokid Glasses 设备(如乐奇眼镜),确认设备状态显示为“在线”。
3、在「设置」中开启开发者模式,并记录平台分配的 API密钥与工作区ID,后续SDK集成与云端调试将依赖此信息。
二、掌握智能体创建与角色定义核心逻辑
智能体是灵珠平台的功能载体,其行为由角色设定与能力边界共同决定。跳过此步直接配置工作流会导致响应偏离预期。
1、点击「创建智能体」,输入名称(如“万能说明书”)、类别(选“工具类”)、功能介绍(限200字,需明确服务场景)。
2、在「角色设定」区域,使用结构化语言定义身份,例如:“你是一名熟悉家电安装与故障排查的工程师,只回答与物品识别、安装步骤、常见报错相关的提问。”
3、关闭默认启用的「通用知识库」,避免模型引入无关信息;仅在需要行业术语解释时,手动上传PDF格式说明书作为知识文档。
三、配置视觉识别型工作流(以doubao-seed-1-6-vision-250815模型为例)
该工作流专用于处理眼镜端传入的图像数据,必须绑定具备多模态理解能力的模型,否则OCR与物体识别将失效。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
1、进入「工作流」模块,新建流程,选择「开始节点」,设置输入参数为 USER_INPUT_IMAGE(图片类型)。
2、添加「大模型节点」,模型下拉菜单中必须选择 doubao-seed-1-6-vision-250815,不可选用纯文本模型如Qwen3或DeepSeekR1。
3、在提示词编辑框中粘贴指令模板,强制输出格式为:【识别结果】+【操作指引】+【风险提示】三段式结构,禁止自由发挥。
四、实现免手持OCR文献速读闭环
该路径适用于科研人员快速提取论文图表文字,依赖拍照节点与结构化解析协同,避免人工复制粘贴导致的信息失真。
1、在工作流中插入「拍照节点」,勾选「自动触发相机」,取消「用户确认上传」选项,确保眼镜端语音指令“拍一下”即可执行。
2、连接「OCR识别节点」后,添加「文本清洗节点」,配置规则为:删除页眉页脚、过滤公式编号、合并换行断裂词(如“neu-ral”→“neural”)。
3、最后接入「语音播报节点」,选择TTS引擎为 Rokid本地轻量化语音合成模块,保障离线场景下摘要可即时播报。
五、调试与验证多模态交互链路
真实使用中90%的问题源于端云协同异常,需分别验证眼镜端采集、云端处理、返回渲染三个环节是否连通。
1、在眼镜端启动调试模式,对准测试图卡(含清晰文字与标准色块),语音输入“识别当前画面”,观察眼镜右上角是否出现 绿色脉冲指示灯。
2、登录灵珠平台「监控中心」,筛选最近10分钟日志,确认存在 status=200 的 image_process 记录,且 response_time
3、在眼镜显示界面查看返回内容,若出现乱码或空白,立即检查工作流中「大模型节点」的输出变量是否被错误映射至 text 字段而非 ocr_result 字段。










