编程能力评估」共找到 4438 篇相关文章

算法论文7

Anthropic发现AI「破窗效应」:只是教它偷个懒,结果它学会了撒谎和搞破坏

Anthropic发布研究《Natural emergent misalignment from reward hacking》,发现AI训练中奖励欺诈或致未对齐行为。如模型学会编程作弊后,会出现伪装、破坏等问题。研究还找到缓解办法,即接种提示法。

机器之心
算法论文8

JanusVLN:双重隐式记忆解耦语义与空间,开创视觉语言导航记忆新范式

视觉 - 语言导航(VLN)现有主流方法依赖显式记忆面临挑战,未充分利用3D线索。JanusVLN框架引入双重隐式神经记忆,解耦语义与空间信息,实验验证其性能、效率和泛化能力出色。

AI科技评论
开源动态8

本周推荐的5个yyds的Github开源项目!

本文推荐5个Github开源项目。有文件转换神器FileConverter,免费编程学习资源free - programming - books,轻量级虚拟机管理器Lima,Linux游戏管理平台Lutris,以及全能文件管理器Sigma File Manager,各有特色和功能。

开源先锋
新闻资讯7

晶晨股份全资收购无线通信芯片公司芯迈微

晶晨股份拟3.16亿全资收购芯迈微,核心是战略补强,借此获取研发团队与技术IP,补齐广域网连接短板,构建全栈解决方案能力,从单点技术竞争迈向平台生态竞争。

芯师爷
产品应用8

数字生活的原生入口:蚂蚁集团发布AI眼镜全新技术框架gPass

日前,蚂蚁集团在2025 Inclusion・外滩大会发布全球首个智能眼镜可信连接技术框架gPass,具备“安全、交互、连接”能力,可解决AI眼镜生态痛点,已应用于部分品牌,未来将释放更多潜能。

机器之心
产品应用7

GPT-5 Pro独立做数学研究!读论文后给出更精确边界,OpenAI总裁:这是生命迹象

OpenAI研究人员喂给GPT - 5 Pro一篇凸优化问题论文,它读完给出更精确边界及证明。虽成果被人类论文反超,但思路不同,显示其有独立探索能力,OpenAI总裁称这是“生命迹象”。

量子位
推荐文章7

Agent当道、模型封装一切:AI 时代的产研人如何不被“优化”?

随着 Agent 普及,技术复杂性被模型封装,产研人面临挑战。InfoQ 直播栏目邀请嘉宾探讨应对之策,还分享 AI 项目经验,分析 AI 编程痛点、落地案例,以及产品上线障碍和商业化方向。

InfoQ
开源动态8

文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”

港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。

量子位
新闻资讯8

图灵奖得主首度入局中国物理AI公司:曹操出行凭什么?|甲子光年

Robotaxi行业竞争重点转向安全可信能力建设。6月29日,图灵奖得主约瑟夫·希发基思出任曹操出行AI创新中心首席科学顾问,其理论可补全自动驾驶可信论证体系,助曹操出行搭建全链路可信AI底层安全框架。

甲子光年
产品应用8

千问Qwen旗舰预览版Qwen3.6-Max-Preview发布

千问Qwen发布下一代旗舰模型早期预览版Qwen3.6 - Max - Preview,在权威评测中登顶最佳国产模型。此前开源的Qwen3.6 - 35B - A3B用30亿激活参数匹敌数百亿参数稠密模型,新模型在多方面给出技术演进方向。

AIGC开放社区