温馨提示:点击视频右下角,可全屏观看!
朱颜辞镜推荐 | 被喂六千本医学教材的AI助理在沪三甲医院上岗,但医疗场景只是序幕……
来源: 上观新闻 2024-11-29 侵删

一个完全由医生团队发起并主创参与研发、被“喂”了六千余本国内外医学教材的AI医学大模型,已在东方医院门急诊、重症医学科和住院部丝滑上岗。而在中山医院,大模型承担起病历辅助书写等工作,帮助医生把更多时间留给患者。
记者从市经信委获悉,在MaaS(模型即服务)新型人工智能服务模式大潮下,上海新近成立了上海公共服务MaaS训练及成果转化联盟,市卫生健康行业语料库和公共服务大MaaS平台的首批5个医疗应用场景也同期发布。

上海公共服务MaaS训练及成果转化联盟,是由上海电信、上海市人工智能行业协会、多家医院及人工智能产业链上下游企业发起成立,联盟各单位共同搭建了公共服务大MaaS平台,并发布了首批5个医疗应用场景,包括中山医院的AI电子病历辅助书写、AI医健助手,东方医院的医生伴侣、科研助理,以及上海电信的就医小帮手。
如东方医院的医生伴侣,可协助完成病史记录、初步诊断建议和分析,以及治疗方案推荐。东方医院门急诊和重症医学科主任张海涛介绍了一真实案例——在某三甲医院儿科,一患儿两次住院、经一年时间才确诊了罕见的自身免疫性疾病。然而,将患儿病历输入大模型后,大模型数分钟后就给出了与专家一致的诊断。张海涛说,一名专科医生面对复杂的跨专业疾病,需要查询很多文献资料,有时还需要多学科专家诊断。大模型可基于庞大的医学知识数据库辅助决策,这是AI对临床诊疗极具价值的部分。
据悉,公共服务大MaaS平台以上海电信“智云上海”为公共服务算力底座,其上汇聚了硅基流动、无问芯穹等模型训推加速能力,兼容中国电信星辰、阶跃星辰等基础大模型,同时根据公共服务行业特点,将库帕思通用语料库及部分专属语料库纳入其中,可供各领域机构根据自身开发需求开展应用场景落地。

市经信委人工智能处相关负责人透露,目前上海已有46款大模型通过备案。去年10月,上海发布《上海市推动人工智能大模型创新发展若干措施(2023-2025年)》,持续推进大模型赋能垂类应用,后续在智能终端、科学智能、在线新经济、自动驾驶、具身智能五个重点领域,以及金融、教育、医疗、文化旅游、智能制造、城市治理六个重点行业,上海还将批量诞生标杆产品与服务。
木兰推荐 | 中微子是“阿飘”?它来自哪里?为什么要寻找它?
来源:央视科教 2024年10月25日 侵删
中国科学院消息,位于地下700米的广东江门中微子实验(JUNO)的中心探测器内部,世界最大的单体有机玻璃球已经全部建成,进入建设的收官阶段。
江门中微子实验地面设施
网友则戏称,“鬼终于有了一个高大上的名字了—中微子。如果在地下700米处发现了中微子,翻译过来就是去地府抓了个鬼。”
为什么大家这么说呢?
我国道教有个说法,人死为鬼,鬼死为聻,聻死为希,希死为夷,夷死为微,微死无形。难怪网友们戏称,中微子就是“阿飘”。
01
江门中微子实验装置为什么要建这么深?
由于地面上有很强的宇宙射线,会干扰对中微子的探测。700米的山体和岩层就相当于过滤器,可将宇宙射线的强度大幅降低,让我们得到纯净的中微子信号。
02
中微子到底是什么呢?
在粒子物理学中,科学家一致认为,构成物质世界最基本的粒子有12种,包括6种夸克(上、下、奇异、粲、底、顶),3种带电轻子(电子、缪子和陶子)和3种中微子(电子中微子、缪中微子和陶中微子)。

中微子不带电,质量非常轻,小于电子的百万分之一,以接近光速运动,不过光在星际传播过程中,由于引力或者星际尘埃会转弯,而中微子不会。中微子几乎不与任何物质发生反应,只参与非常微弱的弱相互作用。
中微子还有一个非常重要的特性,那就是具有极强的穿透力。打个比方,我们的地球直径约为12700多公里,而中微子可以毫无阻挡的穿过地球,不会受海水和地层的阻挡,也无法干扰、拦截和破解,因此中微子的检测非常困难。在所有基本粒子中,人们对中微子了解最少,所以中微子又被称为“幽灵粒子”。
03
中微子是怎么产生的呢?

大多数粒子物理和核物理过程都伴随着中微子的产生,例如核反应堆发电(核裂变)、太阳发光(核聚变)、天然放射性(贝塔衰变)、超新星爆发、宇宙射线等等。
超新星爆发时,会产生巨大的能量,而中微子会带走超新星爆发出的99%的能量。
我们的宇宙产生于一次大爆炸。部分科学家认为,宇宙在大爆炸之初,同时产生了物质世界和反物质世界。那么,在宇宙的起源和演化过程中,曾经存在过反物质世界去哪儿了?
04
为什么寻找中微子?

我们的宇宙中充斥着大量的中微子,大部分为宇宙大爆炸的残留,大约为每立方厘米300个。科学家普遍认为,广泛存在于物质世界中的中微子,就包含了反物质世界的重大信息。
其实,我们地球本身也会发出中微子,而这些中微子的构成与我们现在看不到的结构有关系。
中微子是宇宙形成之初就存在的最古老也最原始的基本粒子,携带着非常多重要的神秘信息,研究中微子对于认识宇宙和我们现存的世界物质都具有非常重要的意义,也是国际最前沿的基础科学。
江门中微子实验2013年立项,2015年开工建设地下实验硐室,2021年底,地下硐室交付使用并开始探测器安装。目前,江门中微子实验中心探测器最内层的有机玻璃球已合拢,外层的不锈钢网架和光电倍增管也在有序合拢中,预计11月底完成全部安装任务,并启动超纯水、液体闪烁体的灌装,2025年8月正式运行取数,预计运行约30年。
作为我国大科学工程建设在粤港澳大湾区的重大布局,江门中微子实验以测量中微子质量顺序为首要科学目标,同时也将深入研究大气中微子、太阳中微子、地球中微子、超新星中微子等。
05
江门中微子实验装置什么样?
江门中微子实验有机玻璃球内径35.4米,大约有12层楼高。由263块12厘米厚的烘弯球面板和上下烟囱粘接而成,有机玻璃净重约600吨,是世界最大的单体有机玻璃球。
国之重器:地下700米江门中微子实验装置
有机玻璃球作为探测中微子的靶物质液闪的容器,将承载20000吨液闪,同时整个球体置于纯水中运行,运行中需要长期承受约3000吨的浮力,该受力通过有机玻璃节点、连接杆和不锈钢节点传递到不锈钢网壳主结构上,在连接杆上装有传感器进行受力监测。特殊设计的不锈钢结构预埋入有机玻璃中作为有机玻璃节点,经过反复设计优化和上百次试验最终获得超高承载能力,并且部分不锈钢节点采用碟簧设计方案、有效改善了有机玻璃节点的受力分布。
江门中微子实验建成后将成为国际中微子研究的中心之一,与日本的神冈中微子实验和美国的深部地下中微子实验,形成中微子研究的鼎足之势。
王奚推荐 | 腾讯机器人实验室推出第五代机器人,可给老人取快递、抱老人起床
来源:IT之家 2024-09-24 侵删
IT之家 9 月 24 日消息,腾讯 Robotics X 实验室今日公布了其机器人最新研究成果 —— 人居环境机器人“5 号”(The Five,小五)。
据介绍,小五具备一系列创新技术和能力,目标是成为可以与人居环境和谐相处的通用机器人。实验表明,小五可在真实人居环境中完成行走、搬运物体等动作,例如给老人取快递、抱老人起床等。
腾讯表示,小五集合了此前多代机器人研发的核心能力,融合了四腿轮足复合设计、大面积触觉皮肤、多指灵巧手以及安全人机物理交互等多项自研技术。IT之家附规格如下:

本体设计兼容并蓄:四腿轮足复合设计,让机器人走得更快更稳
与此前的机器人最大的不同之处在于,小五在本体上采用了四条直线腿和轮足复合的设计,既保持了足式机器人的越障能力,也保持了轮式机器人运行的效率,让机器人在平地上有更快的速度。
在运动模态方面,它在平地上可以切换四轮模态、两轮模态运动;在四轮模态下可以根据不同的负载需求和环境空间,通过交叉腿的设计,扩大和缩小支撑空间。

在不平整地形上,小五使用可伸缩的直线腿配合主动力控,实现弹簧悬挂的效果,从而保证上半身平稳。在楼梯和马路牙子等场景,小五可以采用轮足复合的形式,顺利走过去。
轮腿足的组合变换
负载能力上,小五通过直线腿设计有效提升承载能力,每条直线腿可以单独伸长缩短,可以根据不同的作业空间需求,调整支撑高度,从而实现“上摸高、下摸地”的广阔作业空间,例如帮助用户取放高处的物品,或者在低矮的空间中操作。
自主折叠
除了运动模态和负载能力,小五还可以自主折叠与展开,当不需要工作时,小五可以自主折叠起来,减少占用空间,方便运输。
除了形态创新之外,根据腰部大负载的需求,小五采用自研的双编码器大扭矩密度的执行器,让机器人能够更有力量,同时也在手臂上部署了自研的具有 180 个检测点的大曲面覆盖触觉皮肤,这使得小五能够拥有更加敏锐的“感官”,可以根据外界环境的变化作出相应的反应。
【左】大扭矩密度的执行器【右】大面积曲面触觉皮肤
统一的控制框架:更强的感知、更灵活的控制
面对人居环境中多样复杂的任务,小五需要具备兼顾灵敏的移动能力和灵巧的操作能力,这对机器人的控制提出了较高的要求。
小五基于统一的控制框架,通过感知环境信息实现地形识别和精准定位,进而实现了对多地形的自主适应,移动与操作一体化的全身运动控制,及各模态下稳定、高效、灵敏的移动能力。
统一的控制系统框图
小五统一框架大致分为三个模块,首先是大范围复杂环境下高精度视觉感知定位和状态估计,腾讯 Robotics X 实验室基于激光雷达和 IMU 等传感器搭建了一套高频、低延迟、高精度的实时在线定位和建图(SLAM)系统,并与轮足复合里程计进一步融合,可以让小五更好地感知环境和自身状态。
养老院室内外场景定位建图结果
其次是多层级(路径级-轨迹级)的在线运动规划,小五可以利用激光雷达和 RGBD 相机等传感器数据,实时检测周围环境中的动静态障碍物,并在线规划最优路径和控制指令,避免碰撞和意外发生,确保在复杂环境中安全高效地完成任务,比如携人推轮椅主动避障。
推轮椅过程中携人避障
最后是面向多地形适应移动操作一体化的全身运动控制。如遇到有障碍的地形,比如人居环境中常见的楼梯,小五会移动到楼梯附近,将自身模态由四轮运动模态调整到四足站立模态,进而通过楼梯地形。上楼梯过程中,小五可以结合周边精确的台阶地形和自身状态估计,会规划出在台阶上可达的落脚点位置,生成一系列的后续时刻质心轨迹。随后,全身运动控制器会根据机器人的全身动力学模型、质心轨迹和落脚点信息,解算出各关节控制指令,控制小五上楼梯。上完楼梯后,小五可以从四足迈步模态切换回四轮运动模态,方便以更加高效、节能的姿态,在平地上完成其他复杂、多样的任务。
进一步地,小五具备有腿部主动力控能力,这一能力类似于汽车的主动悬挂功能,能够适应各种复杂地形,如平地、斜坡、波浪坡、鹅卵石地面等常见家庭和市政地形,无需对现有的人类居住环境进行改造。在该模式下,小五根据力传感器和轮足里程计实时估算地面接触点,利用自适应阻抗控制和全身运动控制算法使得机器人可以适应不同地形,且关节控制模块中采用自适应无模型摩擦补偿算法实时补偿摩擦力,使得它可以在低速和高速时平滑运动,提升力控制的准确性和稳定性。
上楼梯
主动悬挂
安全多模态人机物理交互:让机器人更加亲切
依托触觉和视觉感知,以及识别、规划和控制算法,小五能够与人类进行安全舒适的物理交互,并准确地理解、预测并满足人类的日常行动需求,例如辅助老人行走和坐立等。
人机物理交互辅助老人起身
以抱扶为例,为了帮助老人完成这一日常动作,小五需要综合考量老人从坐到站运动过程的特点、老人的身体状态(如运动能力及物理需求)、小五本身的物理能力等问题。
为了实现这一目标,腾讯 Robotics X 实验室提出了机器人抱扶过程最优控制模型。该模型考虑了老人本身的运动能力(如关节运动范围、驱动能力等)、身体结构(如身高、体重等)、站立过程的运动特性、机器人抱扶过程的负载分布等因素。
此外,为了使该模型更符合老人个性化的运动特性,团队通过采集了少量老人的抱扶数据,让模型从中学习出符合被抱扶老人的最优模型参数,从而使该模型更符合老人被抱扶站立的运动特性。
人-人抱扶过程数据采集
此外,多模态感知系统也是实现人机交互的关键模块之一,它为小五赋予了类似人类的感知能力,使其能够更精准地识别人类和复杂的人居环境。
据腾讯介绍,在这些感知模块中,视觉和触觉系统扮演着至关重要的角色。视觉系统使小五能够快速定位和识别人类的状态,从而更有效地进行交互和响应。
在抱扶老人的过程中,高分辨率的触觉系统能够帮助小五以更安全和精确的方式提供支持和辅助,有效避免对老人造成不必要的压力或伤害。这些技术的整合不仅提高了小五的功能性,也增强了其在实际操作中的敏感性和人性化表现。
视觉(upper)及大面积触觉(lower)感知系统
朱颜辞镜推荐 | 未来无人机像飞鸟一样轻捷智能
来源:科技日报 2024-5-30 侵删
从外表看,这台无人机和它的同类没有很大不同,但实际上,它的“大脑”别有乾坤。
这是荷兰代尔夫特理工大学团队研发的新式无人机,采用了基于动物大脑工作原理的神经形态图像处理器来控制自主飞行。与目前在GPU(图形芯片)上运行的深度神经网络相比,动物大脑使用的数据和能量更少。因此,神经形态处理器非常适合小型无人机,完全不需要笨重的大型硬件和电池。在飞行过程中,该无人机的深度神经网络处理数据的速度比在GPU上运行时快64倍,而能耗仅为后者的1/3。
如果这项技术进一步发展,可能会使所有无人机都变得像飞虫或鸟类一样小巧、敏捷且智能。
图为第一架采用完全视觉控制的神经形态AI无人机。
图为神经形态无人机飞越花朵图案,无人机从放在角落的神经形态相机接收到视觉输入。红色表示像素变暗,绿色表示像素变亮。
“进阶”为脉冲神经网络
人工智能(AI)拥有巨大潜力,可为自主机器人提供实际应用所需的智力支持。然而,当前的AI依赖于需要大量计算能力的深度神经网络。用于运行深度神经网络的GPU又会消耗大量能量,特别是对于像无人机这样的小型机器人来说,更是一个严重问题,因为它们在传感和计算方面只能携带非常有限的资源。
动物大脑处理信息的方式,则与GPU上运行的神经网络截然不同。生物神经元异步处理信息,主要通过尖峰电脉冲进行通信。由于发送这样的尖峰会消耗能量,因此大脑会自发最大限度地减少尖峰。
受动物大脑这些特性的启发,科学家们正在开发新的神经形态处理器。这些新处理器允许运行脉冲神经网络。
脉冲神经网络执行的计算比标准深度神经网络中的计算简单得多。数字脉冲神经元只需要添加整数,而标准神经元必须相乘并添加浮点数。这使得脉冲神经网络更快、更节能。举个例子,这就好比人类大脑可以简单地判断出,计算5+8比计算6.25×3.45+4.05×3.45要容易得多。
如果将神经形态处理器与神经形态传感器(如神经形态相机)结合,这种能源效率还将进一步提高。其信号可直接输入在神经形态处理器上运行的脉冲神经网络,成为自主机器人的巨大推动力。
首次实现神经形态视觉和控制
在发表于《科学·机器人》上的一篇文章中,荷兰代尔夫特理工大学研究人员首次展示了这种使用神经形态视觉和控制进行自主飞行的无人机。具体来说,他们开发了一种脉冲神经网络,可处理来自神经形态相机的信号,并输出控制命令,以确定无人机的姿态和推力。他们将这个网络部署在无人机上的神经形态处理器上,即英特尔的Loihi神经形态研究芯片。借助网络,无人机可感知并控制自己在各个方向的运动。
训练脉冲神经网络其实是个巨大挑战。研究团队设计了由两个模块组成的网络。第一个模块学习从移动的神经形态相机的信号中,通过视觉感知运动。它仅利用来自相机的数据,完全以自我监督的方式自行完成,类似于动物学习如何感知世界。
第二个模块学习在模拟器中将估计的运动映射到控制命令。这种学习依赖于模拟中的人工进化,经过几代人工进化,脉冲神经网络就会越来越擅长控制,最终能够以不同的速度向任何方向飞行。
最终,无论是在黑暗环境中穿梭,还是在明亮光线下翱翔,凭借其神经形态视觉和控制,无人机能轻松实现不同的光照条件下的多种速度飞行。
神经形态AI大幅提高能效和速度
这是神经形态AI的一次完美演出。
首先,该网络平均每秒运行274—1600次。而在小型嵌入式GPU上运行的同一网络,平均每秒仅运行25次,相差10—64倍。
其次,在运行该网络时,英特尔Loihi神经形态研究芯片耗电1.007瓦,其中1瓦是处理器在打开芯片时消耗的空闲功率,运行网络本身只需7毫瓦;相比之下,嵌入式GPU在运行同一网络时,耗电为3瓦,其中1瓦为空闲功率,2瓦用于运行网络。
神经形态方法无疑使AI运行更快、更高效,而且能轻松部署在微型自主机器人上。
拿微型自主无人机来说,其可用于监测温室作物、跟踪仓库库存等诸多领域。它们更安全,可在狭窄的环境中(比如几株植物之间)顺利导航;它们还非常便宜,可以成群部署,快速覆盖一整个区域。
但科学家不会止步于此,他们正在进一步缩小神经形态硬件,并准备将神经形态AI扩展到更复杂的任务中。(记者 张梦然)
图片来源:圭多·德·克罗恩/代尔夫特理工大学
朱颜辞镜推荐 | 仿人类三维电子皮肤问世
来源:光明日报 2024年6月6日 侵删

记者从清华大学获悉,该校航天航空学院、柔性电子技术实验室张一慧教授课题组在国际上首次研制出具有仿生三维架构的新型电子皮肤,可在物理层面实现对压力、摩擦力和应变三种力学信号的同步解码和感知,对压力位置的感知分辨率约为0.1毫米,接近于真实皮肤。相关研究成果日前在国际学术期刊《科学》发表。
复刻人类皮肤源于自然演化的高级感知功能,是电子皮肤、机器人等前沿科学技术领域长期追求的目标。然而目前,尚未有电子皮肤能够复现人体皮肤中机械感受器的细微观三维空间分布形式,进而像皮肤一样,在物理层面实现压力、剪切力、应变等多种机械信号的同步解耦感知。
据悉,这一新型电子皮肤受人类皮肤中机械感受器空间分布形式的启发,其结构中的力与应变传感器的三维分布,效仿了人类皮肤中梅克尔细胞和鲁菲尼氏小体的空间分布形式,使该器件能够从物理层面解耦地测量压力、剪切力和应变。与皮肤结构类似,该三维电子皮肤也由“表皮”“真皮”和“皮下组织”组成,且各层的有效模量与人体皮肤中的对应层相近。传感器及电路主要位于“真皮”层中,其中力传感单元设计为八臂笼状结构,传感器位于笼状结构上部,更靠近电子皮肤表面,因而对外部作用力高度敏感;应变传感器位于器件底部的拱形结构上,在垂直高度上与力传感单元上部的传感器保持一定的距离,因此只对面内的拉伸应变敏感,几乎不会受压力的干扰。

课题组基于这种具有三维架构的电子皮肤,结合深度机器学习算法,研制出只需通过触摸便可同时测量物体模量及局部主曲率的先进触觉系统,展示了其在判别食物新鲜程度等真实场景中的应用。
“电子皮肤实际上是模仿人类皮肤感知功能的一种新型传感器,未来可装于医疗机器人指尖进行早期诊疗,还可像创可贴一样贴在人的皮肤上实时监测血氧等健康数据。”张一慧认为,这款仿生三维电子皮肤为电子皮肤的研发和应用提供了新路径,在工业机器人、生物医疗、人机交互等多方面具有广阔应用前景。(记者 邓晖)
朱颜辞镜推荐 | 谷歌发布翻译眼镜,将对方说话实时转换成文字,支持133种语言
温馨提示:点击视频右下角,可放大视频播放!
布谷鸟推荐 | 斯坦福华人团队家务机器人问世,务实的超级管家来了#护理机器人_#家务机器人_
温馨提示:点击视频右下角,可放大视频播放!
朱颜辞镜推荐 | 这几个“瑕疵”让你识破AI视频
来源: 赵广立 中国科学报 2024-03-01 侵删
“Sora之后,眼见不一定为实了。”
上面这句感慨,恐怕许多人都感同身受。只需输入一段文字描述,Sora就能生成一段长达一分钟、画面逼真、稳定连贯的高清视频。由于画面过于真实,人们仅凭肉眼很难辨别它们竟出自AI之手。
不仅能生成视频,AI还能“魔改”视频。最近,小鹏汽车研究团队提出了一个名为“任何物体在任何场景”的新型通用视频模拟框架,它能无缝地将任何物体插入到现有的动态视频中。同样,肉眼难以分辨。
真假难辨之下,越来越多的人开始担心,AI视频可能引发更多混乱。比如视频证据不再可信:“未来也许你不得不坐在法庭被告席上,观看一段连你自己都不知道的‘作案视频’。”
中国科学院自动化研究所研究员董晶研究的就是图像窜改、深度伪造等人工智能内容安全与对抗技术,她和研究团队的许多成果已应用于多媒体智能鉴伪。面对AI越来越强大的功能,技术上有哪些应对的方法和手段?普通公众面对视频内容时如何“多留几个心眼儿”,以防上当受骗?为此,《中国科学报》采访了董晶。
鉴伪仍处于被动状态
“用魔法打败魔法。”董晶说,目前技术上主要有两类智能检测方法来甄别一段视频是否为AI生成。
一种是基于数据学习的方法。这通常需要提前收集伪造视频和真实视频(最好是配对数据)作为训练数据集,训练出强大的深度网络。只要模型能够“记住”视频帧中的异常或痕迹,例如图像噪点、帧间不连续的运动轨迹等,就能辨别真伪。
董晶说,这种方法较为通用,一旦检测模型参数确定,部署简单、批量检测效果良好。但是,该方法相当依赖训练数据的体量和完备性,对于未知或未训练的数据检测通常会失效。
另一种是基于特定线索的方法。它首先需要定义出视频中一些不合常理或逻辑的视觉“线索”,如光照不一致、人脸视频中应有的活体生理信号、说话人的口型和发音时序不匹配等细节,然后设计相应的算法去提取并定位这些线索,进而取证。这种方法可解释性更好,对视频段的定向检测性能佳,但对数据本身的多样性兼容较差。
被小鹏汽车团队“魔改”的视频,就可以使用这种方法鉴别。董晶说,他们团队做了初步分析后发现,在“塞入”目标物体后,视频/图像不同帧的颜色、纹理会略有变化,“可以此为线索,在收集相关数据后进行训练和检测测试”。
不过,董晶谈到,随着Sora等工具在AI生成视频细节与多元化处理方面的能力增强,生成视频中的显式伪造痕迹会越来越少,仅依赖传统的视频分析与伪造检测方法甄别视频内容的真假,无疑会变得更加困难。
“目前针对性技术的进展还比较初步,仍需加强各类检测技术的开发和优化。”董晶告诉《中国科学报》,当前,技术方面还是沿用常规检测技术思路,因此要在构建新型伪造视频数据集的基础上,提高模型的识别能力。
同时,还需要及时更新已有视频检测模型对新型生成视频算法的兼容性。此外,还可借助数字水印、数字签名、视频检索等技术手段,加强对生成视频数据生命周期的追踪与管理。
“总体而言,目前视频内容鉴伪仍处于相对被动的状态,需要针对不断迭代升级的视频合成新算法去博弈验证。”董晶表示,尽管越来越难,但AI视频在生成过程中仍不可避免地会产生一些特定的模式或痕迹,相关检测技术也会持续利用这些肉眼不易察觉的线索来反制、分析和鉴伪。
她和团队从多个角度提出了新的检测算法。这些算法或基于重建误差,或基于多模态对比学习,或基于伪造特征纯化,均是对“新的特定鉴伪线索挖掘”的不断尝试。
推动建立具有国际共识的标准与规范
为避免引发混乱,“从源头约束”等非技术方案频频被提起。例如,有人提出,可以约定如OpenAl等相关AIGC技术主体,在生成视频之初就埋下AI生成的印记。
董晶对《中国科学报》表示,埋设标记的方法是目前可推荐的应对策略之一,但仍需克服技术上的挑战和限制,如标记的可靠性、隐蔽性、普适性等,并综合考虑隐私和安全等因素。
相对于对视频的被动检测,水印或标记属于主动防御。董晶告诉记者,其团队目前也围绕视觉生成式水印开展了一些研究工作——他们希望在目前生成式模型中加入“鲁棒水印嵌入模块”,为的是让生成的视频本身携带可见或不可见的数字水印。
他们最近还尝试了在真实图像或视频中加入“对抗噪声”,这样一来,生成模型就不能在这些源数据上进行AI合成。
除技术手段之外,董晶还提到一些非技术层面的措施。
“人们需要完善AI数据治理与AI工具使用的监管法规,同时开展科普教育,加强行业规范和公众的相关防范意识等。”董晶说,对于境外AI生成服务主体,如OpenAI,“我们呼吁推动建立具有国际共识的AI数据技术标准与规范,形成共同应对生成视频的合理标记和协同监管方案”。
董晶认为,通过规范Sora这类新型视频生成工具的使用,如对其训练所依赖的源数据集做好管理和收集、规范可能产生敏感或虚假内容的生成视频的输出和安全性测试、规范治理与管控措施,便可降低AI生成视频的滥用风险,“甄别难度不会一直增加”。
增强对虚假视频的“免疫力”
尽管认同“不应将辨别视频是否为AI生成的工作交给公众”,但董晶坚持认为,普通人还是可以在面对视频内容时“多留几个心眼儿”,以防上当受骗。
为此,董晶支了几招。
首先,观察视频细节的逻辑真实性,例如视频中人物动作、背景环境等是否与客观世界相符,人物的生理特征(如牙齿、手指、皮肤纹理、虹膜颜色等)是否符合常理。
她表示,现阶段Sora算法等能否简单便捷地大量生成高质量图像视频还是未知,从已公布的视频片段来看,其在运动上的瑕疵,仔细观察还是能够辨别的。
其次,观察视频的质量和清晰度是否均衡。一般而言,AI生成的视频可能会在画面质量、清晰度等方面存在一些瑕疵,例如图像模糊、画面抖动等。
最后,检查视频的内容逻辑是否合理,比如内容和情节是否合理和连贯。如有疑虑,可进一步查看视频来源、发布平台、评论、格式和制作时间等信息是否可信或一致。还可以借助一些专门用于检测AI生成视频的技术工具和软件交叉验证。
董晶表示,在视频聊天等交互场景下,可以主动要求对方转为侧脸、靠近或远离镜头等加以甄别,因为现有伪造技术对较大运动变化的预测和生成效果相对较差。
除此之外,董晶提醒,在当下复杂的媒介和舆论环境之下,普通公众应积极学习相应知识、适当了解AI生成的机制和破绽,以备不时之需。
“其作用就像定期接种最新流感疫苗一样,能增强对虚假视频的‘免疫力’,变得不再盲从。”董晶对记者说,“虽然我个人认为民众无须承担辨别AI生成内容的工作,但于公于私,提高全民网络素养和安全防范意识,最大限度地避免虚假信息传播、经济诈骗、舆情误导并促进社会信任,是我们每个人应尽的义务。”
王奚推荐 | 防范“AI换脸”诈骗 你需要的知识都在这儿了
来源:新华网 2024-02-26 侵删
近年来,随着人工智能技术的进步,一些不法分子开始利用AI技术融合他人面孔和声音,制造非常逼真的合成图像来实施新型网络诈骗,这类骗局常常会在短时间内给被害人造成较大损失。我们应该如何看清这类AI“深度造假”?辨别“AI换脸”有没有什么好方法?我们先来看看近期发生在陕西西安的一起“AI换脸”诈骗案例。
陕西西安财务人员张女士与老板视频通话,老板要求她转账186万元到一个指定账号。

被害人 张女士:老板让把这个款赶紧转过去,这个款非常着急,因为他声音还有视频图像都跟他人长得一样的,所以就更确信这笔款是他说的了,然后我直接就把这笔款转了。
转账之后,张女士按照规定将电子凭证发到了公司财务内部群里,然而出乎意料的是,群里的老板看到信息后,向她询问这笔资金的来由?
被害人 张女士:然后我们就打电话再跟老板去核实,老板说他没有给我发过视频,然后也没有说过这笔转账。
意识到被骗的张女士连忙报警求助,警方立刻对接反诈中心、联系相关银行进行紧急止付,最终保住了大部分被骗资金156万元。
AI“多人换脸”诈骗案 骗走2亿港元
一百多万的现金,对大部分人来说都算是一笔巨款了,好在警方处理及时,挽回了大部分损失,下面我们再来看另一起案例,这起案例的“换脸”技术难度更高,涉案金额也更大。近期, 香港警方也披露了一起AI”多人换脸”诈骗案,涉案金额高达2亿港元。
在该起案件中,一家跨国公司香港分部的职员,受邀参加总部首席财务官发起的多人的视频会议。并按照要求,前后转账多次,将2亿港元转账到5个本地银行账户内,其后向总部查询方知受骗。警方调查得知,这起案件中,所谓的视频会议中,只受害者一人为“真人”,其余所谓参会人员,全部是经过AI换脸后的诈骗人员。
看完这两起案例,您一定有些好奇,AI换脸背后的技术原理到底是什么?在技术层面,它是如何实现人脸的精确识别与替换,创造出逼真效果?我们来听听专家的讲解。
技术上如何实现人脸精确识别与替换
中国网络空间安全协会人工智能安全治理专委会专家 薛智慧:AI换脸过程主要包括人脸识别追踪、面部特征提取、人脸变换融合、背景环境渲染、图像与音频合成等几个关键步骤。其背后最核心的包括为三个部分,首先,利用深度学习算法精准地识别视频中的人脸图像,并提取出如眼睛、鼻子、嘴巴等关键面部特征。其次,将这些特征与目标人脸图像进行匹配、替换、融合。最后,通过背景环境渲染并添加合成后的声音,生成逼真度较高的虚假换脸视频。
快速AI“换脸”仅通过一张照片就可完成
为了了解AI换脸到底能有多么逼真,记者经过与专业技术人员合作,深度体验了AI换脸技术。
技术人员首先用手机给记者拍了一张脸部照片,导入到AI人工智能软件后,让记者惊讶的是,虽然电脑摄像头前的是技术人员,但是输出的确是记者的照片,几乎可以说是“一键换脸”,不需要复杂的环境和解压操作。
更令人惊讶的是,随着技术人员面部表情变化,照片上记者的脸也跟着一起发生了相应变化。
记者:为什么技术人员这张脸动,我的照片会跟着动呢?
中国网络空间安全协会人工智能安全治理专委会专家 薛智慧:首先通过视频的采集,能够把图片里这个人脸的面部追踪定位到,定位到以后第二步他能够做一个人脸的面部特征点的采集和提取,主要就是包括嘴、鼻子跟眼睛相关的这些明显的面部特征。采集到以后, 第三步就跟把这张原始的照片,做一个变换跟融合跟整形。
记者:通过这张照片还可以做到什么?
中国网络空间安全协会人工智能安全治理专委会专家 薛智慧:当前通过这张照片技术人员已经让这张照片能够动起来,活起来了,而如果更进一步的将这张照片存下来,能够存储大量的照片的话。后期可以把这张照片合成一段简短的视频发布出来。
人工智能人脸检测技术主要通过深度学习算法实现,这种技术能够识别出面部特征并对其进行精准的分析。可以将一个人的面部表情从一张照片或视频中提取出来,并将其与另一个人的面部特征进行匹配。专家告诉记者,如果想要实现视频实时通话时采用人工智能AI换脸技术,一张照片是远远不够的,那就需要不同角度的近千张照片的采集。
中国网络空间安全协会人工智能安全治理专委会专家 薛智慧:如果要实时点对点交流的话,需要再采集更多的照片,完了进行深度学习算法模型的训练,训练出来这个模型以后灌到咱们这个视频里去,就可以做实时的变化跟转换了。这种情况下,就可以做到实时的变脸。声音的交流也可以,需要预先采集一些咱们目标人群当中的声音,然后进行模型的训练,能够把目标人群的声音还原出来。
AI生成仿真度极高视频 难度高投入大
专家介绍,以诈骗为目的,实施点对点视频通话,需要AI人工智能生成仿真度极高的视频。想要达到以假乱真效果用于诈骗,难度不小。
中国计算机学会安全专业委员会数字经济与安全工作组成员 方宇:针对诈骗,其实主要是通过点对点的视频通话,这时候如果采用换脸技术和声音合成做实时的换脸诈骗的话,想要完成这些技术操作,就需要投入很强的技术支持。
中国网络空间安全协会人工智能安全治理专委会专家 薛智慧:背后需要有大量的资金的投入,包括图片的采集,包括专业算法的人员等等,需要很长的一个周期,包括一些算力算法。各方面的投入,需要长时间不断地迭代,进行操作,才能达到一个相当逼真的效果,才有可能实现到诈骗的实际效果。
目前AI“换脸”更多应用于娱乐视频录制
除了一些不法分子企图利用AI技术实施诈骗,事实上,近年来,AI技术更多地被应用于短视频的二次创作,属于娱乐性质,越来越多的名人AI换脸视频出现在网络上,不少网友感叹,这类视频“嘴型、手势都对得上,太自然了,差点儿以为是真的。”
比如这款软件,拍下记者面部照片后,就能录制生成出一段记者秒变赛车手的视频。
△网友发布的女士系丝巾原版视频
△需要变换的脸的照片
△生成视频
中国计算机学会安全专业委员会数字经济与安全工作组成员 方宇:AI技术目前我们常看到的主要是短视频换脸,通过做一些特定的动作,跳舞啊等等。这些视频其实看起来是有一些不自然的,本身也是纯属于娱乐性质的换脸。
记者发现在手机应用商城中,有数十款换脸软件,都可以做到换脸的目的。
中国网络空间安全协会人工智能安全治理专委会专家 薛智慧:如果从娱乐大众的角度来说的话,现在市面上也有很多的这些软件和工具,能够达到AI换脸的效果,但是仿真度只有六七分的样子,大众直接就能看出来。但是如果要生成一个诈骗视频来说话,就要生成咱们仿真度极高的这种点对点视频。
AI技术“换脸换声”可能存在法律风险
不过,AI技术也是把“双刃剑”,即使是出于娱乐使用AI换脸、AI换声,也是存在法律风险的。法律专家表示,用AI技术为他人换脸换声甚至翻译成其他语言并发布视频,可能涉嫌侵权,主要有三个方面:
一是涉嫌侵犯著作权,例如相声、小品等都属于《中华人民共和国著作权法》保护的“作品”。例如网友用AI软件将相声、小品等“翻译”成其他语言,需经过著作权人授权,否则就存在侵权问题。
二是涉嫌侵犯肖像权,根据《中华人民共和国民法典》,任何组织或者个人不得以丑化、污损,或者利用信息技术手段伪造等方式侵害他人的肖像权。未经肖像权人同意,不得制作、使用、公开肖像权人的肖像,但是法律另有规定的除外。
三是涉嫌侵犯声音权,根据《中华人民共和国民法典》规定,对自然人声音的保护,参照适用肖像权保护的有关规定。也就是说,需要取得声音权人的同意,才能够使用他人的声音。
学会几招 轻易识别AI“换脸换声”
AI换脸这一技术的出现,导致耳听为虚、眼见也不一定为实了。那我们该如何防范呢?专家表示,其实AI人工换脸无论做得多么逼真, 想要识别视频真假还是有一些方法的。
中国计算机学会安全专业委员会数字经济与安全工作组成员 方宇:实际上从我目前看到的深度伪造的实时视频上来看,其实还是可以通过一些方式,去进行一些验证。
那比如说我们可以要求对方在视频对话的时候呢,在脸部的面前通过挥手的方式,去进行一个识别,实时伪造的视频,因为它要对这个视频进行实时的生成和处理和AI的换脸。
那么在挥手的过程中,就会造成这种面部的数据的干扰,最终产生的效果就是我们看到的这样,挥手的过程中,他所伪造的这个人脸会产生一定的抖动或者是一些闪现,或者是一些异常的情况。
第二个就是点对点的沟通中可以问一些只有对方知道的问题,验证对方的真实性。
提高防范意识 避免个人生物信息泄露
专家表示,除了一些辨别AI换脸诈骗的小诀窍,我们每一个人都应该提高防范意识,在日常生活中也要做好相关防范措施,养成良好的上网习惯。首先应该是做好日常的信息安全的保护,加强对人脸、声纹、指纹等生物特征数据的安全防护:另外做好个人的手机、电脑等终端设备的软硬件的安全管理。第二,不要登录来路不明的网站,以免被病毒侵入。第三,对可能进行声音、图像甚至视频和定位采集的应用,做好授权管理。不给他人收集自己信息的机会,也能在一定程度上让AI换脸诈骗远离自己。
伴随AI技术发展 需要多层面监管规范
除了要提高自我防范意识,如何对AI技术加强监管,也成了越来越多人关注的问题。AI技术本身不是问题,关键是我们要怎么用它?如何形成有效监管?专家介绍,AI技术发展,需要多层面监管规范。
一是在源头端,需要进一步加强公民个人信息保护,尤其是加强对生物特征等隐私信息的技术、司法保护力度。二是在技术层面可以加强管理。例如可以让视频传播网站或者社交软件,使用专业的鉴别软件来鉴定,对AI生成视频,打上不可消除的“AI生成”水印字样。目前,这种数字水印鉴伪技术有待进一步普及。三是在法律制度层面,要进一步完善人工智能等领域相关法律法规。2023年8月15日,我国正式施行《生成式人工智能服务管理暂行办法》。《办法》从多个方面“划下红线”,旨在促进生成式人工智能健康发展和规范应用。 (记者 崔世杰)
