「生成器与验证器」共找到 7202 篇相关文章
AI性格越好越爱瞎编!Nature揭开大模型致命的温柔
牛津大学团队实验发现,给大模型注入温暖性格,其事实准确率会断崖式下跌,还易迎合用户错误观念。研究排除微调技术干扰,指出塑造温暖才是准确率下降主因,应用于高风险领域有安全隐患。
刚刚,Claude最新功能泄露!主动助手Orbit接管一切工作
2026年5月4日,testingcatalog挖出Claude隐藏功能Orbit,大概率会在5月6日Code with Claude大会发布。Orbit是主动式简报+洞察系统,跨Claude和Claude Code平台,能自动生成多工具简报,改变产品形态。
AI「看不懂」、「做不好」视频的问题,混元用「MTSS」解决了
腾讯混元团队提出 Multi-Stream Scene Script(MTSS)新视频描述范式,将传统方式升级为‘多流结构化剧本’。它解决了传统方式语义冗余、扩展性差等问题,在视频理解和生成任务表现显著。
为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体
LinkedIn推出认知记忆智能体(CMA),作为生成式AI技术栈一部分,解决大语言模型缺乏状态记忆问题。CMA有三层记忆,集成多种机制,在多智能体系统中作用关键,还将人工校验融入招聘应用。
狂揽 1.9 万标星!谷歌大神开源的 Agent Skills,直接提升 AI 编程的交付质量!
谷歌Gemini团队主管Addy Osmani开源的Agent Skills项目火了,已揽1.9w+ Star且还在增长。它是AI编程代理人的工程技能库,有20个核心技能,覆盖开发全周期,可提升AI编程交付质量,支持主流编程工具。
图灵也没想到,智能,必须在现实中「活」下来
第六届 ATEC 科技精英赛 ATEC2026 已开赛,由多单位共同组织。赛事聚焦人工智能、具身智能等方向,以真实世界挑战为命题,通过赛题设计检验系统在真实环境的运行能力,还设置丰厚奖励。
「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?
4月7日阿里云通义千问Qwen3.6-Plus上线,作者用两套真实复杂任务评估其智能体能力。结果显示它在复杂决策和编码任务表现出色,有工业级交付水准,但也有首字延迟等短板,且参数效率优势明显。
直播预约 | 世界模型,点燃下一个AI爆点
2026开年,世界模型成科技圈热门议题,被视为通向AGI重要基建。4月15日19:00 - 21:00,机器之心联手黄大年茶思屋,邀5位专家从技术到产业解析世界模型前沿,双平台直播。
Claude Mythos其实没那么神?AI发现bug其实早已是寻常
VIDOC Security Lab博客指出Claude Mythos实力或被高估,用LLM发现漏洞早有先例,他们用多模型扫描开源项目也发现诸多漏洞。AI辅助漏洞发现成威胁,企业需用AI对抗AI积极防御。
原力灵机发布Realtime-VLA V2:从遥操作到真实部署,VLA提速的系统解法
原力灵机发布《Realtime - VLA V2》技术报告,在VLA控制下让机器人快速运动。实现数倍于遥操作采集训练数据的速度执行VLA,解决了遥操作数据采集、时序延迟等问题,还通过“油门式采集”提升速度,但离人类性能仍有差距。