具身智能
第一视角家务操作
头戴相机记录叠衣、收纳、清洁等家务过程,标注动作起止和操作对象。
视频 · 动作分段 · 对象标签
获取样例具身智能
桌面抓取与摆放
多机位同步记录抓取、递送和摆放,逐帧标注手部关键点与物体框。
多视角视频 · 手部关键点 · 物体框
获取样例具身智能
灵巧手操作记录
数据手套同步记录手指关节角度与操作画面,按统一时间戳对齐。
视频 + 关节角 · 时间对齐
获取样例具身智能
机械臂遥操作轨迹
遥操作过程中的画面、关节状态和末端位姿,按任务成功或失败分段。
图像 + 本体状态 · 任务分段
获取样例具身智能
工业与仓储操作
分拣、装箱、上下料等流程的第一视角与固定机位视频。
视频 · 工序标签
获取样例具身智能
室内场景采集
家居、办公场景的 RGB-D 数据,标注房间区域和常见物体。
RGB-D · 语义标签
获取样例具身智能
移动导航记录
移动底盘巡游时的画面、位姿和障碍物标注。
视频 + 位姿 · 障碍物框
获取样例具身智能
语言指令与动作对齐
自然语言任务指令与对应操作片段配对,适用于 VLA 模型训练。
文本 + 视频 · 指令对齐
获取样例大模型
中文预训练文本
百科、书籍、新闻和专业领域文本,完成去重、清洗和质量分级。
文本 · 去重 · 质量分级
获取样例大模型
多轮对话
覆盖闲聊、客服和知识问答的多轮对话,人工撰写并审核。
JSONL · 多轮 · 人工审核
获取样例大模型
指令问答对
写作、改写、摘要、推理和代码等任务的指令与参考答案。
JSONL · 指令 + 答案
获取样例大模型
学科试题与解析
K12 与高校学科试题,附标准答案和解题步骤,可单独作为评测集。
题目 · 答案 · 解析
获取样例大模型
图像描述与图文问答
图片的整体描述、区域描述和多轮问答。
图像 + 文本 · 描述 · 问答
获取样例大模型
视频内容描述
按时间片段描述画面、动作和事件,附起止时间。
视频 + 文本 · 时间戳
获取样例大模型
安全与拒答样本
按风险类别整理的敏感提问、安全回复和拒答示例。
提问 · 回复 · 风险类别
获取样例大模型
情感与观点文本
评论和社交文本的情感极性与情绪类别标注。
文本 · 情感标签
获取样例计算机视觉
多姿态人脸
多角度、多光照、多年龄段的人脸图像,采集人均已签署授权。
图像 · 身份 ID · 属性标签
获取样例计算机视觉
人脸关键点
人脸轮廓和五官关键点逐点标注。
图像 · 关键点
获取样例计算机视觉
遮挡人脸
口罩、眼镜、帽子等遮挡条件下的人脸图像。
图像 · 遮挡类型
获取样例计算机视觉
年龄与肤质
人脸年龄段,以及痘痘、色斑、皱纹等肤质问题标注。
图像 · 属性 · 区域框
获取样例计算机视觉
活体检测
真人与打印照片、屏幕翻拍、面具等攻击样本。
图像 / 视频 · 真假标签
获取样例计算机视觉
表情识别
自然表情与引导表情的图像和视频,按表情类别标注。
图像 / 视频 · 表情类别
获取样例计算机视觉
手势识别
静态和动态手势,含手部框与关键点。
图像 / 视频 · 手部关键点
获取样例计算机视觉
人体关键点与姿态
室内外场景的人体骨架关键点。
图像 · 骨架关键点
获取样例计算机视觉
人体语义分割
人像与服饰的像素级分割。
图像 · 分割掩码
获取样例计算机视觉
行人 Re-ID 与跟踪
跨摄像头的行人图像与轨迹,同一身份跨镜头关联。
视频 · 轨迹 · ID 关联
获取样例计算机视觉
人体行为
监控与室内场景的行为片段,标注行为类别和起止时间。
视频 · 行为类别 · 起止
获取样例计算机视觉
车辆与道路
车辆检测、车牌、车道线和交通标志。
图像 / 视频 · 框 · 折线
获取样例计算机视觉
物品检测与垃圾分类
日常物品和垃圾类别的检测框与分类标签。
图像 · 检测框 · 类别
获取样例计算机视觉
宠物识别
猫、狗等宠物的检测、品种和关键点。
图像 · 检测框 · 品种
获取样例计算机视觉
火焰烟雾与异常事件
监控场景中的火焰、烟雾等异常事件。
视频 · 事件类别 · 起止
获取样例语音识别
普通话手机朗读
多地区说话人在安静环境下用手机朗读,逐句转写。
音频 · 句级转写 · 说话人信息
获取样例语音识别
普通话自然对话
双人自由对话,标注说话人、起止时间和转写文本。
音频 · 时间戳 · 说话人
获取样例语音识别
口音普通话
带地方口音的普通话朗读与对话。
音频 · 转写 · 口音地区
获取样例语音识别
方言语音
粤语、四川话、上海话、闽南语等方言的朗读与对话。
音频 · 方言转写
获取样例语音识别
儿童语音
监护人授权下的儿童朗读与对话。
音频 · 转写 · 年龄段
获取样例语音识别
电话信道语音
电话信道下的客服、金融场景对话。
8kHz 音频 · 转写 · 角色
获取样例语音识别
噪声环境语音
车内、家居、街道等噪声环境下的录音,附噪声类型。
音频 · 转写 · 噪声标签
获取样例语音识别
唤醒词与命令词
不同距离、不同设备采集的唤醒词和控制指令。
音频 · 指令文本 · 距离
获取样例语音识别
英语语音
美式、英式及多国口音英语的朗读与对话。
音频 · 转写 · 口音
获取样例语音识别
日语与韩语语音
日语、韩语母语者的朗读与对话。
音频 · 转写
获取样例语音识别
东南亚语种语音
泰语、越南语、印尼语、马来语、缅甸语等。
音频 · 转写
获取样例语音识别
欧洲语种语音
德语、法语、西班牙语、意大利语、葡萄牙语、俄语等。
音频 · 转写
获取样例语音识别
阿拉伯语与印地语
阿拉伯语、印地语等语种的朗读与对话。
音频 · 转写
获取样例语音合成
普通话女声音色库
专业发音人棚录,音素边界与韵律标注。
棚录 · 音素边界 · 韵律
获取样例语音合成
普通话男声音色库
专业发音人棚录,音素边界与韵律标注。
棚录 · 音素边界 · 韵律
获取样例语音合成
多情感语音
同一发音人以高兴、悲伤、愤怒等情感朗读同一批文本。
棚录 · 情感标签
获取样例语音合成
客服与直播风格
客服应答、直播讲解等口语风格语音。
棚录 · 风格标签
获取样例语音合成
平均音色
多名发音人录制相近脚本,适合训练基础模型。
多发音人 · 文本对齐
获取样例语音合成
中英混读
中文句子中自然夹带英文单词的朗读。
棚录 · 混读文本
获取样例语音合成
英语音色库
英语母语发音人的男声与女声。
棚录 · 音素边界
获取样例语音合成
方言与日语音色
粤语等方言及日语发音人录制。
棚录 · 文本对齐
获取样例语音合成
TTS 前端文本
多音字、韵律边界和文本正则化标注。
文本 · 注音 · 韵律边界
获取样例OCR
文档版面
书籍、报告的版面区域、文字行和阅读顺序。
图像 · 版面框 · 行级转写
获取样例OCR
表格结构
表格单元格、行列结构与内容转写。
图像 · 单元格 · 结构
获取样例OCR
票据卡证
发票、小票和证件的字段位置与内容。
图像 · 字段框 · 键值
获取样例OCR
手写体
中英文手写行与段落转写。
图像 · 行级转写
获取样例OCR
试卷
印刷与手写混排的试卷,标注题号和作答区域。
图像 · 区域框 · 转写
获取样例OCR
自然场景文字
招牌、路牌、商品包装上的文字。
图像 · 四边形框 · 转写
获取样例OCR
互联网图像文字
截图、海报等网络图片中的文字。
图像 · 框 · 转写
获取样例OCR
多语种文字
日语、韩语、越南语、印地语等文字图像。
图像 · 框 · 转写
获取样例发音词典
普通话发音词典
词条、拼音和声调,多音字分开标注。
词条 · 拼音 · 声调
获取样例发音词典
粤语发音词典
词条与粤拼注音,附例词录音。
词条 · 粤拼 · 录音
获取样例发音词典
方言发音词典
上海、四川、武汉、长沙、昆明方言及闽南语词条,注明方言点。
词条 · 注音 · 地区
获取样例发音词典
英语发音词典
词条、音标和重音位置。
词条 · 音标 · 重音
获取样例发音词典
日语与韩语词典
词条与读音标注,附录音。
词条 · 读音 · 录音
获取样例发音词典
俄语及其他语种
俄语、印地语、维吾尔语等语种的词条与注音。
词条 · 注音
获取样例自然语言理解
中英平行语料
句级对齐的中英双语文本,覆盖通用与专业领域。
句对 · 领域标签
获取样例自然语言理解
多语种平行语料
中文与日语、韩语、俄语等语种的句级对齐文本。
句对 · 语种
获取样例自然语言理解
意图识别
智能助手和客服场景的用户意图与槽位。
文本 · 意图 · 槽位
获取样例自然语言理解
多轮对话状态
多轮对话中的槽位变化和当前意图。
对话 · 状态标注
获取样例自然语言理解
命名实体识别
人名、地名、机构、产品等实体的范围与类别。
文本 · 实体范围
获取样例自然语言理解
文本分类与情感
主题分类和情感极性标注,类别体系可定制。
文本 · 类别标签
获取样例