智见未来 | AI企业深访——苏州核数聚信息科技有限公司:以数据治理打通数据孤岛,筑牢人工智能发展底座

创建时间:2026-08-07

在人工智能技术加速演进的大背景下,千行百业正经历前所未有的深度重塑。如何在充满不确定性的环境中探寻确定的增长路径,已成为产业各界共同聚焦的核心命题。

立足专业定位与行业使命,苏州赛迪产业研究中心深入人工智能领域头部企业开展实地调研与深度交流。我们期望以走访为纽带,搭建起领军企业与产业市场之间的信息桥梁,将一线真知灼见精准传递至行业各方。通过系列调研,我们力求向市场清晰呈现:头部人工智能企业当前的发展态势如何?其战略布局与演进逻辑是怎样的?在技术迭代与商业化落地中又面临哪些现实挑战?旨在通过这些源自产业实践一线的真实反馈,激发更深层次的行业思考。

同时,我们也将系统整合访谈成果与产业洞察,编制发布《2026年人工智能领域年度发展趋势报告》。该报告旨在为政府研判、企业战略规划及产业投资提供决策参考,助力各方在人工智能浪潮中明晰方向、找准定位,共谋高质量发展。

 
 
image.png

 

【精彩续篇】如何让海量数据转化为高质量的人工智能“燃料”?本期,让我们走进苏州核数聚信息科技有限公司,一起解锁他们在高质量数据集建设、数据治理等方面的探索与实践。
 
 
 
 
 
企业介绍
 

苏州核数聚信息科技有限公司(以下简称“核数聚”)2018年成立于苏州,是国内数据治理行业的领军企业。核数聚深耕AI数据服务领域,专注为人工智能企业提供一站式高质量数据解决方案,服务覆盖ASR语音识别、NLU自然语言理解、TTS语音合成、CV计算机视觉、多模态交互等全类型AI技术方向,自主研发的数据采集、数据标注、模型服务三大核心技术平台,可实现从需求精准分析、专属语料设计、多场景数据采集、精细化标注加工,到质量全维度评测、多语种语言学咨询的闭环服务,全方位满足不同客户的个性化数据需求。

 

 

 
本期访谈嘉宾
 
 

胡楠:现任核数聚CTO,拥有中国科技大学计算机系统结构专业博士学位,求学期间为国内最早一批AI(人工智能)算力研究者,在AI行业深耕逾15年。参与思必驰创始团队,及上市公司的AI芯片负责人,业务覆盖图像识别、辅助驾驶、工业可预测维护等领域,相关产品稳居细分市场领导地位。

 

 

 
核心观点
 
 

 

 

1.数据集质量的核心在于实现特定场景下成本与效益的最优匹配。在商业实践中,脱离成本谈质量是不切实际的。真正的“高质量”并非唯标准论,也不是死板的生产过程合规,而是基于客户特定场景的精准匹配,是在成本与质量间找到的最优解。最终,检验数据集质量的“试金石”是模型在实际业务中的应用效果。

 

2.具身智能的数据训练可采用仿真与真机相结合的金字塔式迭代策略。具身智能对数据规模的需求极为庞大,单纯依赖低成本数据难以满足复杂场景的训练需求,而高成本的真机数据又面临规模受限的瓶颈。因此现有的基本思路类似于金字塔式迭代,底层使用低成本仿真/合成数据训练基础能力,上层使用高成本真机数据微调以提升精度。

 

3.大模型时代的核心技术重心应向应用层场景创新转移。客观而言,大模型的出现确实弱化甚至抹平了传统标注企业在底层算法上的技术优势。因此,当前核心技术方向应聚焦于应用层场景创新。

 

4.大模型的竞争焦点应转向打通企业内部数据孤岛与多系统融合。大模型已成为类似Android/Windows的“操作系统”,通用能力由头部大模型企业提供,行业应用需各个行业的企业基于此进行微调和二次开发。大模型的竞争焦点将转向如何打通企业内部数据孤岛,使大模型能访问并利用多系统数据。

 

5.合成数据正推动物理仿真技术从传统数值计算向数据驱动范式演进。合成数据正推动物理模型的范式演进。传统的物理仿真主要依赖有限元分析等基于物理方程的数值计算手段,而当前的前沿趋势正转向利用合成数据驱动物理模型发展。

 

6.“模数共振”是应对多模态大模型融合趋势的必然选择。在传统的单模态时代(如单一的视觉质检场景),企业仅需交付单一模型服务即可满足需求。而在当前的大模型时代,系统需要处理多模态、全量业务数据,单一模型的边际价值正加速递减。因此,“模数共振”正是对多模态大模型融合发展趋势的精准回应。

 

 
对话精选
 
 

下文是访谈实录,有删节。

一、产品

问:
贵公司作为专业的数据服务商,能否系统介绍一下当前的业务版图?

公司的主营业务聚焦于人工智能高质量数据集的建设与服务,区别于传统大数据服务,公司专注于为人工智能算法与模型企业提供底层数据支撑。目前,公司主要布局以下三大核心赛道:一是智能驾驶与语音大模型赛道。该领域为公司的传统优势板块,已深度服务多家头部智能语音及自动驾驶企业,提供核心数据支持;二是具身智能赛道。作为公司的新兴增长引擎,目前主要服务于国内头部的机器人研发厂商,助力其模型训练与迭代;三是医疗与工业赛道。作为公司新拓展的业务版图,该领域的客户多为行业应用型企业。区别于纯算法研发企业,此类客户对数据隐私与安全合规要求极高,要求数据服务要在内部形成业务闭环,这也为公司带来了全新的业务挑战与能力要求。

 

问:
面向数据业务的全流程环节,贵公司布局了哪些核心产品?

公司目前的核心产品主要包含以下四个方面:一是数据治理平台。该平台为公司自主研发,集数据采集、治理等功能于一体,可面向机器人、智能语音等垂直行业提供定制化解决方案。此外,公司针对语音数据研发了专用的移动端采集应用(APP),支持多语种、多方言的高效采集;二是智能标注平台。主要赋能公司内部及外部客户的数据标注业务。目前已引入大模型辅助智能化标注,但鉴于大模型在复杂场景下的准确率尚无法达到模型训练所需的极高精度(需趋近100%),当前仍采用“AI预标注+人工复核校验”的人机协同模式,以严格保障数据质量;三是高质量数据集。依托日常业务开展过程中的数据沉淀与深度加工,公司持续产出高质量数据集,并将其封装为标准化数据产品进行商业化销售;四是数据引擎。面向医疗、工业等数据隐私敏感型行业,提供院内/厂内私有化部署方案。该引擎旨在打破企业内部数据孤岛,保障数据安全合规,进而赋能大模型在垂直业务场景的安全落地。

 

问:
高质量数据集是人工智能模型性能的关键底座,贵公司在建设高质量数据集时,如何定义“高质量”的标准?

高质量数据集具备“即插即用”的特性,能够直接赋能并提升人工智能模型的训练效果。当前,尽管行业内已出台相关国标与行标,但这仅构成了数据集建设的“最低门槛”,客户对数据质量的实际诉求往往远超基础标准。在商业实践中,脱离成本谈质量是不切实际的。真正的“高质量”并非唯标准论,也不是死板的生产过程合规,而是基于客户特定场景的精准匹配,是在成本与质量间找到的最优解。最终,检验数据集质量的“试金石”是模型在实际业务中的应用效果。

 

问:
贵公司于近日完成数千万元A轮融资,融资用于加速构建面向下一代机器人产业的数据基础设施,请问这一战略方向是基于怎样的行业判断和时机考量?机器人产业的数据需求与其他领域相比有哪些本质差异?

从公司自身发展来看,当前语音与智能驾驶行业的市场格局已趋于稳定,传统业务的增长逐渐放缓。与此同时,大模型技术的爆发正在重塑行业生态,固守传统算法的企业将面临被时代淘汰的风险。因此,公司必须敏锐洞察并布局下一个业务增长点。基于此,大模型和具身智能就是我们所关注的重点方向。对于具身智能,我们有着更广义的理解,它不仅是机器人,智能驾驶汽车同样是具身智能的重要载体,都会基于大模型重构。展望未来三到五年,各类机器人将在工业制造等场景中实现大规模落地应用。

具身智能对数据规模的需求极为庞大,单纯依赖低成本数据难以满足复杂场景的训练需求,而高成本的真机数据又面临规模受限的瓶颈。因此现有的基本思路类似于金字塔式迭代,底层使用低成本仿真/合成数据训练基础能力,上层使用高成本真机数据微调以提升精度。

 

二、技术

问:
Agent时代对数据采集提出了新的要求,目前在数据采集方面有哪些相应的技术优化?

过去,面对客户非标准化的数据,企业往往需要依赖重度定制化开发来实现格式统一。如今,只需将多源异构文档接入大模型平台,即可实现自动化解析与标准化转换。这表明,大模型在数据处理与平台化能力上已趋于成熟,不再是核心瓶颈。当前的真正挑战在于,大型企业往往建有大量分散的业务系统,形成了严重的“数据孤岛”。因此,如何打破系统壁垒,让大模型能够高效接入并深度“感知”这些碎片化数据,成为亟待解决的关键命题。

 

问:
从行业发展来看,目前智能化标注需要重点攻克哪些核心技术?

从行业发展来看,智能化标注的技术攻关重点正在发生根本性转移。过去,企业需要自研预标注模型,底层算法能力是核心壁垒。如今,通用大模型展现出强大的泛化能力,直接赋能预标注环节,大幅缩短了研发周期。客观而言,大模型的出现确实弱化甚至抹平了传统标注企业在底层算法上的技术优势。因此,当前核心技术方向应聚焦于应用层场景创新,如何基于智能体架构和思维,在极短时间内构建出适配不同行业(如医疗等垂直领域)的新型标注工作流。

 

问:
可信数据空间是当前数据要素流通的重要基础设施,可信数据空间建设需要重点突破哪些核心技术?

从底层核心技术维度来看,可信数据空间在联邦学习、隐私计算等领域仍需进一步突破。然而,就整体技术成熟度而言,其发展路径与大模型相似,关键技术已基本攻克,当前主要处于持续的工程化迭代与优化阶段,技术储备已具备支撑条件。然而,鉴于数据资产的高度隐私性与敏感性,企业是否愿意通过可信数据空间进行数据流通与交易,其核心仍取决于商业模式的构建及综合效益的审慎考量。

 

三、市场

问:
贵公司如何基于自身的数据能力构建产业生态体系?

在大模型发展初期,公司便已与相关企业开展合作,通过数据服务支持模型的迭代优化。当前,随着大模型技术趋于成熟,如何依托大模型构建应用生态,是现阶段需要重点思考的命题。整体思路上,我们基于大模型为客户构建数据引擎,旨在深度释放数据资产价值。过去主要侧重于系统和产品的创新开发,如今则致力于打通数据孤岛,数据运营成为核心工作。

 

问:
数据集作为产品形态,其商业模式仍在探索中,贵公司采用怎样的商业模式?

过去,数据集的商业模式主要依靠直接销售来形成业务闭环,这一传统模式目前依然有效且具备可行性。当前市场观点存在一种倾向,即试图将医疗、制造等垂直行业的数据共享出去用于大模型训练,但此举的实际商业价值相对有限。原因在于,当前大模型的参数规模庞大且通用知识储备丰富,试图通过数据流通与交易来进一步提升模型的基础能力,更多是头部大模型厂商的战略诉求。对于广大企业而言,真正的核心在于如何打破内部的数据孤岛,深化数据和大模型在自身业务中的应用,从而实现数据资产的实际价值转化。

 

问:
贵公司的长期市场竞争策略是什么?

短期内,公司聚焦于深耕现有客户,以提升服务交付质量为核心;中期来看,公司将紧密跟踪人工智能产业的演进趋势与投资风向,顺势布局,目前重点发力方向已锚定具身智能领域;长期而言,企事业单位依托大模型提质增效,其间存在的各类适配矛盾将尤为凸显。因此,弥补数据缺口、夯实数据底座将是公司长期投入的战略重心。

 

四、未来趋势

问:
如何看待大模型的发展趋势?

大模型已成为类似Android/Windows的“操作系统”,通用能力由头部大模型企业提供,行业应用需各个行业的企业基于此进行微调和二次开发。公司不从头训练基础大模型,而是基于开源或通用大模型,结合行业知识库进行微调和智能体开发。大模型的竞争焦点将转向如何打通企业内部数据孤岛,使大模型能访问并利用多系统数据。

 

问:
如何看待合成数据的发展趋势?

合成数据的核心优势主要体现在两方面:一是支持基于仿真思路构建虚拟环境,从而实现模型训练与验证的闭环;二是相较于真实物理环境,仿真环境下的训练成本大幅降低。基于此,合成数据在人工智能训练中具有重要战略价值,公司目前正将其作为重点业务方向进行布局与商业化推广。

此外,合成数据正推动物理模型的范式演进。传统的物理仿真主要依赖有限元分析等基于物理方程的数值计算手段,而当前的前沿趋势正转向利用合成数据驱动物理模型发展,这也是目前学术界与产业界共同探索的重要方向。

 

问:
如何看待国家提出的“模数共振”行动,这将为行业带来哪些发展机遇?

当前,模型与数据往往被割裂看待,但实际上,模型企业与数据企业必须实现深度融合与协同演进,即形成“模数共振”。这一理念旨在引导市场摒弃单一的数据或模型发展路径,强调两者的不可分割性。在产业落地层面,传统业务导向型企业往往面临一定的问题,即这类企业通常擅长业务运营,但内部缺乏数据或模型的底层技术基因,“模数共振”能够有效推动此类企业通过内外部协同,补齐相应短板。

从技术演进趋势来看,在传统的单模态时代(如单一的视觉质检场景),企业仅需交付单一模型服务即可满足需求。而在当前的大模型时代,系统需要处理多模态、全量业务数据,单一模型的边际价值正加速递减。因此,“模数共振”正是对多模态大模型融合发展趋势的精准回应。

 

 

 

 
 
#智见未来,聚焦AI——企业深度调研进行中#
 
 

如有合作或调研需求,敬请联系

 
 

时老师 13262558180

俞老师 18217170451

 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

 

 

 

END

 

 

 

 
2赛迪logo(1).png
 
 
 
 

赛迪工业和信息化研究院集团(苏州)有限公司(简称苏州赛迪)是工信部赛迪研究院在长三角设立的唯一综合性分支机构,致力于打造区域一流的高端智库与产业服务平台。苏州赛迪聚焦“数字化”与“信创”两大主线,构建“产业研究—产业赋能—产业集聚”一体化服务体系,面向政府与产业提供政策咨询、产业规划、评估认证、供需对接等全链条服务。依托中国软件评测中心,建有2个国家重点实验室和1个公共服务平台,具备从芯片到系统的测试验证能力,通过CMA/CNAS双认证。苏州赛迪策划举办“赛迪长三角高质量发展巡回讲堂”“工控大会”“产业链供需对接会”等高端活动,助力地方构建产业生态、培育新质生产力,推动科技创新与经济高质量发展。

 


电话:0512-66583022

地址:苏州吴中经济开发区越溪街道吴中大道1421号

 
 
 
 
图片1(1).jpg

扫码关注公众号了解更多

苏州赛迪原创 | 转载请注明来源 | 欢迎分享朋友圈