☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
nova ai平台仅支持从同区域obs桶导入utf-8编码csv或jsonl格式结构化数据,需严格遵循路径、命名、字段及内容规范,校验通过后方可启用。
在nova ai平台中导入外部数据,是训练或微调模型前必须完成的关键准备动作。若数据格式不符合要求,系统将直接拒绝解析,且不会给出具体字段级错误提示,仅显示“文件校验失败”。
确认数据源类型与接入路径
Nova AI当前仅支持从OBS(对象存储服务)桶中拉取结构化数据文件,不支持本地上传、FTP直连或数据库直连。所有待导入数据必须提前上传至已授权的OBS桶内指定路径,且该桶需与Nova AI实例处于同一区域(Region)。
进入Nova AI控制台→左侧导航栏点击【数据管理】→【外部数据集】→点击右上角【+新建数据集】→选择【OBS路径导入】→在弹出框中输入OBS完整URL(格式为obs://bucket-name/path/to/data/),【URL末尾必须以斜杠/结尾,否则系统无法识别为有效目录】。
基础文件格式与命名规范
仅接受以下两种格式之一:CSV(UTF-8编码)、JSONL(每行一个合法JSON对象)。其他格式如Excel、Parquet、XML、TSV均不被识别,即使重命名为.csv也会在校验阶段报错。
CSV文件首行为字段名,禁止空行、合并单元格或BOM头;JSONL文件每行必须独立成JSON对象,不可换行嵌套,不可含逗号分隔的多对象。文件名只能包含英文字母、数字、下划线和短横线,严禁出现中文、空格、括号、星号等特殊字符。
若使用Python生成JSONL,务必用json.dumps(line, ensure_ascii=False)逐行写入,避免用str(dict)方式拼接——后者会导致引号转义异常,导入后字段值全为空。
字段内容与类型约束
方法一:单文本分类任务所需字段
CSV或JSONL中必须包含且仅包含两个字段:text(字符串,原始输入文本)、label(字符串或整数,类别标识)。label值不可为空、不可为浮点数、不可含前后空格。例如{"text":"这手机充电很快","label":"正面"}合法;{"text":"屏幕有点暗","label":" 负面 "}将导致该条丢弃。
方法二:多标签/序列标注任务扩展字段
允许额外添加labels(JSON数组字符串,如["实体A","关系B"])、entities(JSON数组,每个元素含start/end/label键)、intent(字符串)等字段,但所有扩展字段值必须为合法JSON可解析内容。非JSON字符串如"['A','B']"或"{label: 'X'}"会被跳过,不报错也不生效。
【text字段长度上限为8192字符,超长截断不警告;label字段长度不可超过128字符,超出部分将被静默截断】。
验证与触发导入
第一步:填写OBS路径后,点击【预览样本】按钮,系统会随机读取前5行并展示解析结果。此时检查字段是否对齐、label值是否可见、有无乱码。
第二步:确认无误后,点击【提交】→系统自动生成数据集ID并进入后台校验队列。
第三步:约30–90秒后,状态由“校验中”变为“就绪”,此时数据集右侧操作栏出现【启用】按钮,点击即完成导入,可供后续创建训练作业调用。









