新闻与深度文章
如果让今天最强的大模型去参加一场国家计算机等级考试(NCRE),它能拿多少分? 近期,微软亚洲研究院的研究员们把 NCRE 一、二级的 200 道 Word、Excel、PPT 实操题搬到 AI 面前,让 7 个前沿大模型作答,并用官方评分引擎逐条打分。然而,测试结果却与我们的直觉大相径庭:在普通考生普遍能拿满分的考试中,最强单轮模型只考了 36.6 分;即便是配上了能反复执行调试的“编程智能体”…
过去几年的AI发展史,可以说是一部“暴力美学”的进化史。从百亿参数到万亿参数,从千卡集群到万卡集群,行业笃信一条法则:只要算力够大、数据够多,模型的边界就会被不断打破。正是这条 Scaling Law(规模法则),让众多模型一次次迎来能力质变。然而,当单次训练耗电持续攀升,当模型在深度推理中显露不足时,我们不禁要问:单纯依靠算力堆砌的发展模式,是否已经走到瓶颈? 作为经过数亿年演化形成的生物智能系…
在刚刚落幕的计算机视觉与人工智能领域最具影响力的国际顶会之一 CVPR 2026 上,来自微软亚洲研究院的论文《Native and Compact Structured Latents for 3D Generation》(即TRELLIS.2)从全球 16,092篇投稿中脱颖而出,荣膺最佳学生论文奖(Best Student Paper Award)。 作为全新的 3D 资产生成范式,TREL…
《AI Next》是微软亚洲研究院推出的一档利用 AI 技术制作的播客,内容聚焦 AI 前沿技术、科研趋势与社会影响。第一季主要围绕当今智能发展的核心议题,探索前沿趋势。 作为本季收官之作,第八期节目请到了微软亚洲研究院院长周礼栋博士,与大家深度探讨 AI 与底层系统的协同进化,一起拆解智能时代基础设施的重构逻辑。周院长将通过解析系统…
在大语言模型 (LLMs) 的训练中,数据的高效利用是决定模型最终能力的关键。过去的很多研究将精力集中在“数据筛选”(Data Selection)上,也就是如何从海量互联网语料中挑出最高质量的子集。 如今,这个问题依然十分重要。当前大模型通常只在海量数据上训练一轮或少数几轮,模型很可能只“读”一遍教材,因此数据样本呈现的时间顺序直接决定了模型的学习轨迹。如果把训练过程类比为上课,那么数据选择决定…
体检偶然发现的肾脏小肿块,常常让患者和医生陷入两难:它究竟是良性还是恶性?是立即手术,还是继续观察?现实中,一部分术后证实为良性的肿块,意味着患者可能承担了不必要的风险和医疗成本。如果能够在术前更准确地判断肿块的性质,并进一步推演治疗方案,将对肾癌的精准诊疗产生重要价值。 现有的通用医疗 AI 模型虽然具有广泛的医学影像表征能力,但往往无法深入理解肾癌诊疗中那些细微但关键的专科信息,例如肿瘤的形态…
编者按:什么样的研究员能在AI浪潮中持续保持创造力?微软亚洲研究院高级研究员郭宗昱,习惯把一件事从构想到落地一路推进,尤其专注于完成从0到80分的关键跨越。清醒的自我认知,让他在流媒体浪潮下扎根视频编解码研究,又在生成式AI爆发后果断转向Agentic Media(智能体式媒体)这一前沿方向。在唯快不破的AI时代,这种拥抱变化、主动转身的勇气,以及对信息本质的追寻,或许正是每一位身处浪潮中的探索者…
编者按:欢迎阅读“科研上新”栏目!“科研上新”汇聚了微软亚洲研究院最新的创新成果与科研动态。在这里,你可以快速浏览研究院的亮点资讯,紧跟前沿领域发展态势。 6月3日至7日,全球计算机视觉领域的顶尖学术盛会 CVPR 将在美国科罗拉多州丹佛市举行。本期“科研上新”将为大家带来多篇微软亚洲研究院入选 CVPR 2026 的精选论文解读,具体方向包括生成式视频压缩、扩散图像压缩、3D空间理解及实时说话人…
当前,大语言模型智能体(agent)的真正难点已经不在于“能不能调用工具”,而在于“能不能稳定、可复用地完成任务”。过去,智能体的技能通常有三种来源:专家手写、由前沿大模型一次性生成,或者运行后进行松散的自我修订。这些方法虽然在某些场景下能勉强见效,但都普遍缺少深度学习优化器才具有的“训练纪律”。 由于缺乏稳定的步长控制、显式的验证集选择,以及对失败修改的负反馈记忆,智能体的技能往往越改越长、越改…