拓数科技TUOSHU DATA 申请试标

训练数据集

覆盖具身智能、大模型、视觉、语音和文本,共 73 类数据样例,均可申请样例评估。

全部数据集

类别

共 73 类数据样例

具身智能

第一视角家务操作

头戴相机记录叠衣、收纳、清洁等家务过程,标注动作起止和操作对象。

视频 · 动作分段 · 对象标签
获取样例
具身智能

桌面抓取与摆放

多机位同步记录抓取、递送和摆放,逐帧标注手部关键点与物体框。

多视角视频 · 手部关键点 · 物体框
获取样例
具身智能

灵巧手操作记录

数据手套同步记录手指关节角度与操作画面,按统一时间戳对齐。

视频 + 关节角 · 时间对齐
获取样例
具身智能

机械臂遥操作轨迹

遥操作过程中的画面、关节状态和末端位姿,按任务成功或失败分段。

图像 + 本体状态 · 任务分段
获取样例
具身智能

工业与仓储操作

分拣、装箱、上下料等流程的第一视角与固定机位视频。

视频 · 工序标签
获取样例
具身智能

室内场景采集

家居、办公场景的 RGB-D 数据,标注房间区域和常见物体。

RGB-D · 语义标签
获取样例
具身智能

移动导航记录

移动底盘巡游时的画面、位姿和障碍物标注。

视频 + 位姿 · 障碍物框
获取样例
具身智能

语言指令与动作对齐

自然语言任务指令与对应操作片段配对,适用于 VLA 模型训练。

文本 + 视频 · 指令对齐
获取样例
大模型

中文预训练文本

百科、书籍、新闻和专业领域文本,完成去重、清洗和质量分级。

文本 · 去重 · 质量分级
获取样例
大模型

多轮对话

覆盖闲聊、客服和知识问答的多轮对话,人工撰写并审核。

JSONL · 多轮 · 人工审核
获取样例
大模型

指令问答对

写作、改写、摘要、推理和代码等任务的指令与参考答案。

JSONL · 指令 + 答案
获取样例
大模型

学科试题与解析

K12 与高校学科试题,附标准答案和解题步骤,可单独作为评测集。

题目 · 答案 · 解析
获取样例
大模型

图像描述与图文问答

图片的整体描述、区域描述和多轮问答。

图像 + 文本 · 描述 · 问答
获取样例
大模型

视频内容描述

按时间片段描述画面、动作和事件,附起止时间。

视频 + 文本 · 时间戳
获取样例
大模型

安全与拒答样本

按风险类别整理的敏感提问、安全回复和拒答示例。

提问 · 回复 · 风险类别
获取样例
大模型

情感与观点文本

评论和社交文本的情感极性与情绪类别标注。

文本 · 情感标签
获取样例
计算机视觉

多姿态人脸

多角度、多光照、多年龄段的人脸图像,采集人均已签署授权。

图像 · 身份 ID · 属性标签
获取样例
计算机视觉

人脸关键点

人脸轮廓和五官关键点逐点标注。

图像 · 关键点
获取样例
计算机视觉

遮挡人脸

口罩、眼镜、帽子等遮挡条件下的人脸图像。

图像 · 遮挡类型
获取样例
计算机视觉

年龄与肤质

人脸年龄段,以及痘痘、色斑、皱纹等肤质问题标注。

图像 · 属性 · 区域框
获取样例
计算机视觉

活体检测

真人与打印照片、屏幕翻拍、面具等攻击样本。

图像 / 视频 · 真假标签
获取样例
计算机视觉

表情识别

自然表情与引导表情的图像和视频,按表情类别标注。

图像 / 视频 · 表情类别
获取样例
计算机视觉

手势识别

静态和动态手势,含手部框与关键点。

图像 / 视频 · 手部关键点
获取样例
计算机视觉

人体关键点与姿态

室内外场景的人体骨架关键点。

图像 · 骨架关键点
获取样例
计算机视觉

人体语义分割

人像与服饰的像素级分割。

图像 · 分割掩码
获取样例
计算机视觉

行人 Re-ID 与跟踪

跨摄像头的行人图像与轨迹,同一身份跨镜头关联。

视频 · 轨迹 · ID 关联
获取样例
计算机视觉

人体行为

监控与室内场景的行为片段,标注行为类别和起止时间。

视频 · 行为类别 · 起止
获取样例
计算机视觉

车辆与道路

车辆检测、车牌、车道线和交通标志。

图像 / 视频 · 框 · 折线
获取样例
计算机视觉

物品检测与垃圾分类

日常物品和垃圾类别的检测框与分类标签。

图像 · 检测框 · 类别
获取样例
计算机视觉

宠物识别

猫、狗等宠物的检测、品种和关键点。

图像 · 检测框 · 品种
获取样例
计算机视觉

火焰烟雾与异常事件

监控场景中的火焰、烟雾等异常事件。

视频 · 事件类别 · 起止
获取样例
语音识别

普通话手机朗读

多地区说话人在安静环境下用手机朗读,逐句转写。

音频 · 句级转写 · 说话人信息
获取样例
语音识别

普通话自然对话

双人自由对话,标注说话人、起止时间和转写文本。

音频 · 时间戳 · 说话人
获取样例
语音识别

口音普通话

带地方口音的普通话朗读与对话。

音频 · 转写 · 口音地区
获取样例
语音识别

方言语音

粤语、四川话、上海话、闽南语等方言的朗读与对话。

音频 · 方言转写
获取样例
语音识别

儿童语音

监护人授权下的儿童朗读与对话。

音频 · 转写 · 年龄段
获取样例
语音识别

电话信道语音

电话信道下的客服、金融场景对话。

8kHz 音频 · 转写 · 角色
获取样例
语音识别

噪声环境语音

车内、家居、街道等噪声环境下的录音,附噪声类型。

音频 · 转写 · 噪声标签
获取样例
语音识别

唤醒词与命令词

不同距离、不同设备采集的唤醒词和控制指令。

音频 · 指令文本 · 距离
获取样例
语音识别

英语语音

美式、英式及多国口音英语的朗读与对话。

音频 · 转写 · 口音
获取样例
语音识别

日语与韩语语音

日语、韩语母语者的朗读与对话。

音频 · 转写
获取样例
语音识别

东南亚语种语音

泰语、越南语、印尼语、马来语、缅甸语等。

音频 · 转写
获取样例
语音识别

欧洲语种语音

德语、法语、西班牙语、意大利语、葡萄牙语、俄语等。

音频 · 转写
获取样例
语音识别

阿拉伯语与印地语

阿拉伯语、印地语等语种的朗读与对话。

音频 · 转写
获取样例
语音合成

普通话女声音色库

专业发音人棚录,音素边界与韵律标注。

棚录 · 音素边界 · 韵律
获取样例
语音合成

普通话男声音色库

专业发音人棚录,音素边界与韵律标注。

棚录 · 音素边界 · 韵律
获取样例
语音合成

多情感语音

同一发音人以高兴、悲伤、愤怒等情感朗读同一批文本。

棚录 · 情感标签
获取样例
语音合成

客服与直播风格

客服应答、直播讲解等口语风格语音。

棚录 · 风格标签
获取样例
语音合成

平均音色

多名发音人录制相近脚本,适合训练基础模型。

多发音人 · 文本对齐
获取样例
语音合成

中英混读

中文句子中自然夹带英文单词的朗读。

棚录 · 混读文本
获取样例
语音合成

英语音色库

英语母语发音人的男声与女声。

棚录 · 音素边界
获取样例
语音合成

方言与日语音色

粤语等方言及日语发音人录制。

棚录 · 文本对齐
获取样例
语音合成

TTS 前端文本

多音字、韵律边界和文本正则化标注。

文本 · 注音 · 韵律边界
获取样例
OCR

文档版面

书籍、报告的版面区域、文字行和阅读顺序。

图像 · 版面框 · 行级转写
获取样例
OCR

表格结构

表格单元格、行列结构与内容转写。

图像 · 单元格 · 结构
获取样例
OCR

票据卡证

发票、小票和证件的字段位置与内容。

图像 · 字段框 · 键值
获取样例
OCR

手写体

中英文手写行与段落转写。

图像 · 行级转写
获取样例
OCR

试卷

印刷与手写混排的试卷,标注题号和作答区域。

图像 · 区域框 · 转写
获取样例
OCR

自然场景文字

招牌、路牌、商品包装上的文字。

图像 · 四边形框 · 转写
获取样例
OCR

互联网图像文字

截图、海报等网络图片中的文字。

图像 · 框 · 转写
获取样例
OCR

多语种文字

日语、韩语、越南语、印地语等文字图像。

图像 · 框 · 转写
获取样例
发音词典

普通话发音词典

词条、拼音和声调,多音字分开标注。

词条 · 拼音 · 声调
获取样例
发音词典

粤语发音词典

词条与粤拼注音,附例词录音。

词条 · 粤拼 · 录音
获取样例
发音词典

方言发音词典

上海、四川、武汉、长沙、昆明方言及闽南语词条,注明方言点。

词条 · 注音 · 地区
获取样例
发音词典

英语发音词典

词条、音标和重音位置。

词条 · 音标 · 重音
获取样例
发音词典

日语与韩语词典

词条与读音标注,附录音。

词条 · 读音 · 录音
获取样例
发音词典

俄语及其他语种

俄语、印地语、维吾尔语等语种的词条与注音。

词条 · 注音
获取样例
自然语言理解

中英平行语料

句级对齐的中英双语文本,覆盖通用与专业领域。

句对 · 领域标签
获取样例
自然语言理解

多语种平行语料

中文与日语、韩语、俄语等语种的句级对齐文本。

句对 · 语种
获取样例
自然语言理解

意图识别

智能助手和客服场景的用户意图与槽位。

文本 · 意图 · 槽位
获取样例
自然语言理解

多轮对话状态

多轮对话中的槽位变化和当前意图。

对话 · 状态标注
获取样例
自然语言理解

命名实体识别

人名、地名、机构、产品等实体的范围与类别。

文本 · 实体范围
获取样例
自然语言理解

文本分类与情感

主题分类和情感极性标注,类别体系可定制。

文本 · 类别标签
获取样例

没有匹配的方向。

按项目交付的训练数据

选好方向后告诉我们场景、数量和交付格式。

获取方案