「自演进评测」共找到 1873 篇相关文章
编程能力开源SOTA,网络安全提升2倍!智谱发布GLM-5.3
智谱发布GLM-5.3,743B参数模型,编程能力达开源SOTA。网络安全能力涌现,基准得分是GLM-5.2两倍多。全部提升来自后训练缩放,还自研Z.ai Code Bench评估,安全评估加固后权重将开源。
不到百万级,看不见 MCP 的真实问题:创始人亲述这疯狂的一年
本文是对 MCP 联合创作者 David Soria Parrra 的访谈,回顾 MCP 从发布到成为行业事实标准的历程,探讨其演进、应用、竞争对手等问题,还分享经验教训,展望未来发展方向。
AI安全的过去与未来:从大模型到智能体 | 预约
业界提升前沿AI模型和智能体安全性,常用安全评测和‘安全对齐’技术,但未真正解决风险。本次分享将介绍‘内生安全’探索成果,还公布了相关论文信息,刘东瑞等嘉宾将参与。
分割一切、3D重建一切还不够,Meta开源SAM Audio分割一切声音
Meta 深夜放出音频分割模型 SAM Audio,可通过多模态提示分离任意声音。其核心 PE - AV 推动性能领先,还发布评测模型、基准等,整合进新平台,虽有局限但为音频 AI 带来新可能。
MetaGPT 用户智能体发布,开启端到端自主软件测试新范式!
当前AI软件领域代码生成智能化发展快,但测试验收仍靠手动,效率低。MetaGPT推出用户智能体,研究团队发布RealDevWorld框架和AppEvalPilot实现端到端自动化评测,解决复杂软件质量评估难题。
B站发布最强零样本TTS,IndexTTS2情感可控、时长精准
在大规模TTS系统中,自回归模型难精准控制语音时长。Bilibili推出IndexTTS2,支持两种生成模式,实现情感表达与音色解耦,引入GPT潜在表示,设计‘软指令’机制,降低情绪控制门槛。
微软的prompt压缩方案-LLMLingua,开源
使用大语言模型时,提示信息长会致运行慢、费用高、易超限。微软推出的LLMLingua可压缩提示信息,有完整开源。它历经多版本演进,还能用于安全防御,使用简单,值得开发者跟踪。
Cursor发布首个编程大模型!代码生成250tokens/秒,强化学习+MoE架构
Cursor 2.0正式发布,搭载自研大模型Composer。它30秒完成复杂任务,比同行快400%,每秒生成250个tokens。还带来原生浏览器工具等新功能,基于强化学习,但模型底子透明度遭质疑。
震撼发布!最大人体动作数据集 MotionMillion 正式登场
上海交通大学研究团队构建高效标注流程,发布最大人体动作数据集MotionMillion,含超2000小时、200万条文本 - 动作配对数据。还推出评测体系MotionMillion - Eval,训练70亿参数动作生成大模型,刷新SOTA。
一帮机器人公司苦练一年,冠军被搞手机的给抢了
亦庄人形机器人半程马拉松赛上,荣耀自研机器人“闪电”以50分26秒夺冠,刷新历史最好成绩,还超越人类男子半马世界纪录,且荣耀包揽前六名。众多机器人参赛,现场有不少有趣“名场面”。