数据标注为AI发展加工“优质原料”

  随着人工智能迅猛发展,高质量训练数据短缺逐渐成为制约行业进步的一大瓶颈,而数据标注产业可为人工智能创新发展提供强大动力。国家发展改革委、国家数据局、财政部、人力资源和社会保障部四部门日前联合印发的《关于促进数据标注产业高质量发展的实施意见》(以下简称《实施意见》,提出到2027年的发展目标:数据标注产业专业化、智能化及科技创新能力显著提升,产业规模大幅跃升,年均复合增长率超过20%。

  我国数据标注产业现状如何?数据标注产业高质量发展还需要跨过哪些“门槛”?针对这些问题,科技日报记者进行了采访。

  原始数据变为可用资源

  “通俗地说,训练人工智能大模型的过程就像老师教学生识字。”华南理工大学计算机科学与工程学院副院长张通形象地解释道,数据标注就是给数据“贴标签”或者“做记号”,需要专业人员向大模型阐释各个数据的标签及需执行的相应任务。他们“教导”大模型参与训练的数据是什么,给图像、语音、文本等各种数据“贴标签”。高质量的数据标注,有助于机器精准理解、快速学习、高效训练,显著提升大模型的准确性和泛化能力。

  在训练ChatGPT时,美国开放人工智能研究中心(OpenAI就投入了大量资源用于数据标注。为确保标注任务高质量完成,使ChatGPT能更好地理解人类指令,保障大模型的准确性与可靠性,OpenAI聘请了众多“老师”。这些“老师”涵盖一般数据标注人员和专业人士,还包括博士级别的专家。

  数据标注是人工智能发展的核心基石之一。“数据标注产业是对数据进行筛选、清洗、分类、注释、标记和质量检验等加工处理的新兴产业,其核心任务是对原始数据进行加工,使之成为可用于训练人工智能大模型的优质原料。”张通介绍,数据标注作为训练大模型至关重要的一环,直接影响机器学习模型的性能,对支撑人工智能能力水平提升有重要作用。

  在张通看来,未经处理的原始数据只是潜在资源,而经过标注处理后沉淀的数据,才能在市场上进行有效交易和流通,从而充分释放数据要素价值。培育壮大数据标注产业,对于提升数据供给质量、推动人工智能创新发展不可或缺。

  业内人士认为,随着人工智能技术不断成熟、应用领域持续拓展,数据标注行业将迎来更广阔市场空间,尤其是在低空经济、智慧城市、自动驾驶、智慧医疗等新兴科技领域展现出巨大潜力。

  产业步入快速发展阶段

  全球数据标注市场目前正处于迅速增长期。近年来,我国数据标注产业已进入快速发展阶段,产业链条不断完善,技术创新成果逐步实现市场化应用。据测算,2023年我国数据标注产业规模已达800亿元左右。

  四川成都、辽宁沈阳、安徽合肥、湖南长沙等7个承担数据标注基地建设任务的城市,在大模型标注、自动化标注等领域取得重要突破。长沙信息产业园作为长沙首批数据标注基地之一,已吸引智能网联汽车、数据标注、网络安全等1万余家各类数字企业入驻,成功打造了人工智能创新中心算力服务平台。

  广东积极推进数据标注训练试点和基地建设,为大模型训练提供坚实数据支撑。2023年9月,广东省公共数据标注训练试点正式启动。在广东省公共数据标注基地(清远,百度、燕湖科技、好思达等一批在自动驾驶、政务公共标注领域表现突出的企业已率先入驻。凭借龙头企业的带动作用和数字经济产业的集聚效应,清远的数据标注产业蓬勃发展。

  “我们以数字经济产业为核心,与数字经济产业龙头企业紧密合作,致力于打造国家级数据标注产业集聚区和产教融合示范区。”广东省公共数据标注基地(清远负责人李艳康介绍,落户在此的百度智能云(清远人工智能基础数据产业基地已累计引进孵化数据标注企业5家,培育专业数据标注师超300人。未来,基地将持续培育孵化更多优秀数据标注企业,推动清远数据服务产业不断壮大发展。

  复合型人才缺口仍然较大

  《实施意见》的出台,将进一步提升数据供给质量,有效解决制约人工智能产业发展的高质量数据短缺问题。

  值得注意的是,随着人工智能应用的不断深化,对数据标注的需求也愈发细分化和专业化。2024年7月,张通团队和广州华银康医疗集团股份有限公司在人工智能与数字经济广东省实验室(广州共建AI病理研究中心,着手研发人工智能病理大模型,让人工智能模型能像专业医生一样看病问诊。在其中的数据预处理环节,中心特别聘请了3位资深的主任级医师进行数据标注。

  “医疗、材料等专业领域,涉及到专业对象和术语结合的标注过程,只有专业从业人员才能胜任标注工作。而且,标注任务极其耗时、耗力、耗资源。整个标注工作并非一蹴而就,而是需要在实际应用场景中优化、持续迭代,促使模型智能化水平不断升级。”张通说,当前我国数据标注行业人才缺口仍然较大,亟待培养复合型数据标注人才,这是我国数据标注产业高质量发展必须跨过的“门槛”。

  《实施意见》对加强标注人才队伍建设作出部署。以人才项目计划和科技项目等为抓手,培育和引进高端专业人才;制(修定人工智能训练、数据标注相关职业国家职业标准;支持数据标注领域职业资格与职业技能等级衔接互认……一项项举措,将为数据标注产业高质量发展提供支撑。

  完善的产业生态建设对数据标注行业发展同样重要。《实施意见》提出,畅通数据采集、标注、人工智能应用产业链,推动数据标注产业上下游协同发展;支持数据标注龙头企业和第三方机构等建设数据标注开源平台,助力中小企业发展;培育一批人力资源、供需对接、国际合作、法律审计等服务数据标注的第三方机构,完善数据标注产业生态。

  “未来数据标注行业的发展,也可考虑‘以人工智能促人工智能’的思路,即让已经完成学习的人工智能反哺数据标注工作,提高效率。这是值得深入探讨且极具价值的研究方向。”张通认为,数据标注行业的发展有望加速推动数字经济与实体经济深度融合,加快形成新质生产力。

张紫祎本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 support1012@126.com 举报,一经查实,本站将立刻删除。
标签: /
上一篇2025-01-27
下一篇 2025-01-27

相关推荐

  • 灰度迷你比特币信托自推出以来净流入超10亿美元

    灰度宣布旗下迷你比特币信托(BTC)2024 年净流入超过 10 亿美元。截至 12 月 17 日,该 ETF 资管规模超过 40 亿美元。 7 月份,灰度从其较旧的 BTC 和 ETH 基金中分拆出

    2025-01-27 12:03:10
    2022
  • 去年以工代赈吸纳就业总数同比增长31%

    2024年,国家发展改革委支持各地围绕农村小微型基础设施实施2726个以工代赈项目,吸纳36万名农村脱贫人口等低收入群众务工。各地围绕交通水利、农业农村、生态建设、

    2025-01-27 12:03:10
    2002
  • 2025年春风行动已举办4.1万场招聘活动

    人力资源社会保障部今天(3月13日)发布数据,截至3月5日,全国已累计举办各类招聘活动4.1万场,发布岗位3100万个;发出务工人员专车、专列、包机2.9万辆(列、架)次,输送劳

    2025-01-27 12:03:10
    2001
  • 落实增储任务、加强精益管理 中央储备粮安全保障能力增强

    增加小麦、玉米等品种收储规模,跨地区平衡、跨周期调节能力和应急保供水平进一步提升。不断加强储粮精益化管理,中央战略储备粮综合储存损耗率持续控制在1%以内。

    2025-01-27 12:03:10
    2001
  • 被动投资“大时代”来临!

    有公募人士认为,ETF大发展因素较为复杂,核心原因是曾经追捧主动权益明星基金经理的基民,大家的投资体验都不太好,进而也对主动权益的超额创造能力产生了一些质疑,因此

    2025-01-27 12:03:10
    2001
  • 证监会:权益类ETF规模突破3万亿元大关

    证监会19日发布的公告称,今年9月,证监会会同中央金融办出台了推动中长期资金入市的指导意见,着力打通社保、保险、理财等资金入市的堵点痛点,建设培育鼓励长期投资的

    2025-01-27 12:03:10
    2001
  • 宝莱特:前10个月已回购297.06万股股份 耗资2000万元

    针对产品研发和新业务布局,宝莱特还表示,2023 年,公司推出了S系列输注液 泵、电子尿量计量仪、遥测监护系统等全新系列产品,目前公司紧密推进G系列监护仪、CRRT、AED

    2025-01-27 12:03:10
    2001
  • 今年前10月新疆霍尔果斯口岸进出口货运量超3800万吨

    视频无法播放,请升级浏览器至最新版。 据霍尔果斯海关统计,霍尔果斯口岸今年前10月进出口货运量达3801.1万吨,同比增加10%。 从商品种类来看,进口商品主要为机电产品

    2025-01-27 12:03:10
    2001