脚本式与自发式语音、双人对话、方言录制。受管的说话人招募,配合严格技术规格——采样率、声道配置、录制环境、说话人画像——每批次验证。
7 个语对已在生产交付,另有 7 个可启动——语音 AI 当下的前沿,也是大多数供应商难以规模化获取自然母语语码转换的地方。
生产级规模的多语言转录与验证 QA,按批次周转、按客户准则执行——原始音频到可用训练数据之间的质量关口。
由母语评测员进行充分性、流畅度、排序和 LQA——对模型输出的人类判断,跨语言、成规模地一致执行。
批次导入、音频-参考对齐检查、范围确认——不匹配在开工前就退回。
固定语言团队在受管平台上领任务——语境逐批累积,而非每次归零。
按准则作业、per-file 工时记录,产能可预测、问题文件早暴露。
对照书面变体指南做二次复审,指南在每轮修正后更新。
一键导出,附工时报告和修正闭环追踪——同一问题不再复发。
语音 AI 至今仍在语码转换语音上失灵——众包平台也无法稳定获取,因为天然会语码转换的人,没法靠筛选"母语"这一项找出来。传为以管理型母语者团队运作:7 个语码转换语对已在生产交付,另有 7 个可启动,每一位贡献者都有书面同意与来源记录。
粤语–英语(香港)· 普通话–英语(中国大陆)· 台湾华语–英语 · 日语–英语 · 韩语–英语 · 他加禄语–英语(Taglish)· 土耳其语–英语
印地语–英语(Hinglish)· 马来语–英语 · 泰米尔语–英语 · 印尼语–英语 · 泰语–英语 · 越南语–英语 · 海湾阿拉伯语–英语
有单一责任主体的受管生产——不是匿名众包。经筛选的贡献者、严格的规格合规、按批次的质量确认。
香港粤语、台湾国语、简体普通话及地区变体——外加韩语、日语、菲律宾语、土耳其语等,且在增加。通用供应商当作边缘情况的变体,正是我们的核心。
固定语言团队提供稳定内核、语境逐批累积;万人级译员网络在每周量峰时吸收波动,无需每次重新 onboarding。自助平台自动完成派发、交付与 QA 追踪。
每位贡献者书面知情同意、每批次来源可追溯——数据来源与授权可审计,而非开放网络抓取。
通过 ISO 17100 与 ISO 18587 认证,结构化审校内建于交付,而不是出了问题才补。
我们作为分包生产伙伴,支持领先的 AI 平台供应商和更大的数据公司——公司对公司的合作模式,而非众包市场。
为某全球性 AI 项目,在三周内把粤英语码转换录制项目从试点扩展到数百个脚本——批次通过、质量确认。
运行一条覆盖数十种语言变体的滚动式多语言转录验证产线,每周向某领先 AI 平台供应商的数据供应链交付批次。
客户项目均保密。以上描述的是工作的形态——受管生产、严格规格、按批次确认质量——而非相关方。
AI监管正在把数据文档化变成采购要求。在欧盟AI法案的透明度义务下,AI系统的提供方越来越需要证明训练数据的来源与授权。我们的生产从设计上就是"溯源优先"——每位贡献者的书面同意与来源记录、批次级台账、可审计的交付元数据——让你今天采购的数据,不会成为明天的合规问题。
传为按客户规格交付亚洲语言语音与语码转换数据集:16–48 kHz 采样,WAV/FLAC 格式,单声道或分离双声道,覆盖照读、半照读到自然对话语域;说话人构成按性别、年龄段与地区口音配比。每个批次附带批次级技术 QA、可直接入库的元数据,以及书面的说话人同意与来源记录,可支撑 AI 监管的文档化要求。
16–48 kHz WAV/FLAC · 单声道或分离双声道 · 照读/半照读/自然对话 · 按规格配比安静与嘈杂环境。
母语者按性别与年龄段配比 · 地区发音受控 · 语码转换组合含粤英、普英。
批次级技术 QA · 说话人 ID、批次 ID、环境与声道标签 · 可加转录验证作为第二层。
亚洲语言及其地区变体——香港粤语、台湾国语、简体普通话及其他中文变体——同时覆盖韩语、日语、菲律宾语、土耳其语等不断增加的语种。也处理粤英、普英等语码转换。
每位贡献者在书面知情同意下参与,来源按贡献者和批次追溯。作为通过 ISO 17100 与 ISO 18587 认证、采用受管生产的公司,数据来源、授权与处理均可审计,而非开放众包匿名获取。
能。语音采集遵循严格规格——采样率、声道配置、录制环境、说话人画像、脚本设计——每批次交付前验证。转录与评测按客户准则执行,以生产级规模做 QA。
可以——我们以公司对公司的方式,为领先的 AI 平台供应商和更大的数据公司提供受管产能,交付通用供应商难以获取的亚洲语言和语码转换音频。
我们做的是有单一责任方的受管生产,而不是匿名众包——经筛选的母语者、严格的规格合规、书面知情同意与来源追溯、按批次的质量确认。这在语码转换和低资源亚洲语言变体这类最难的场景里尤其关键。
每个批次都走入库对齐检查。不匹配(文件被重新剪辑、脚本被上游修改)在开工前就退回给你,而不是在花了工时对着错误文本"验证"之后才发现。
语音和验证工作通常按工时计费、per-file 记录,你能清楚看到时间花在哪;采集类按交付单元报价。固定团队提供稳定内核,更大的译员网络吸收每周量峰,无需每次重新 onboarding。
是。每位贡献者均签署书面同意;每次交付保留来源与批次记录;元数据可审计。我们不提供法律意见,但生产流程从设计上支持 AI 提供方履行透明度与溯源文档义务。
归委托客户所有,按项目约定的授权结构执行。说话人知情同意以书面收集,覆盖商业化 AI 训练用途;除非另有约定,我们不保留复用权。权利文档——同意范围、许可用途、来源记录——随每次交付一并提供。
音频为约定采样率的 WAV/FLAC,保留声道分离;转写与标注为 JSON、TSV 或客户自定义格式;逐条元数据含说话人 ID、人口属性分组、环境与声道标签,外加批次级 QA 结果。按你的管线节奏以安全传输分批交付。
只有你委托我们生产的数据才是训练数据——你自己的材料不会。为参考、规格说明或评测目的提供给我们的客户内容,均受标准保密条款约束;如流程中涉及任何 AI 工具,只经由已开启零数据留存(ZDR)与模型训练退出(opt-out)的企业级 API 层处理,我们绝不把客户材料放进免费或消费级 AI 工具。我们交付的数据集授权给委托方,并随附同意范围与来源记录。
对敏感或受监管的工作,我们可以走全程无 AI 参与的纯人工工作流。应要求,我们也可在 NDA 下披露所使用的具体引擎,并签署你方的数据处理协议(DPA)。
能——这是我们的核心线之一。语码转换语音无法靠"按母语筛选贡献者"的众包方式获取,因为天然会语码转换的人根本不是这样找出来的;它需要管理型母语者团队,并就场景与语域做过简报。目前已有 7 个语对在生产交付:粤语–英语、普通话–英语、台湾华语–英语、日语–英语、韩语–英语、他加禄语–英语、土耳其语–英语;另有 7 个可启动:印地语–英语、马来语–英语、泰米尔语–英语、印尼语–英语、泰语–英语、越南语–英语、海湾阿拉伯语–英语。
照读、自然口语、双人对话三种形态均可,每位贡献者都有书面同意与来源记录。可以先做一个免费试做批次,让你在正式合作前就按自己的规格检验切换点处理和转写规范。