可验证评分机制」共找到 1661 篇相关文章

开源动态8

NanoCoder:我把50万行的claude code核心机制浓缩成1000行,不可能学不会了吧!

Claude Code 源码泄露后,kimi Agent 团队何宇峰大佬的 NanoCoder 项目,用 950 行 Python 代码重写其核心机制。它实现 7 种关键设计模式,可助理解顶级 AI 编程 Agent 核心设计,还能按需修改。

探索AGI
产品应用8

Claude Opus 4.1 上线,SWE-bench 验证率 74.5%,重构可靠性与安全性全面升级

Anthropic推出Claude Opus 4.1,是Opus 4重要升级版。SWE - bench验证率从72.5%提至74.5%,多文件代码重构可靠性及长链交互推理能力增强,无害响应率提升,合作率下降,定价不变。

InfoQ
算法论文8

突破显存瓶颈:基于 DeepSeek-V3.2-Exp 的 Latent Cache 卸载预取方案设计与模拟验证

百度百舸AIAK团队针对DeepSeek-V3.2-Exp,设计基于Latent Cache的卸载预取方案ESS。该方案解决显存瓶颈,提升Decode吞吐并降低成本,经模拟验证效果显著,未来将拓展应用。

InfoQ
算法论文8

为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练

社区里长期存在的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且在多模型和硬件上验证有效。

机器之心
新闻资讯8

谷歌量子计算重磅突破登上Nature:首次实现可验证量子优势,比最快超算快13000倍

谷歌量子AI团队宣布里程碑式算法突破,其Willow芯片运行“量子回声”算法,首次在硬件上实现可验证量子优势,执行特定任务比最快超算快13000倍,为多领域应用铺平道路。

AI寒武纪
开源动态8

清华开源了一个真的会和你互动的AI课堂,同学老师都是AI,500学生已经验证....

清华大学开源OpenMAIC,这是多智能体驱动的交互式AI课堂。它模拟真实课堂,有多种场景,内置自适应引擎。经500学生验证,数据佳。支持多模型,部署方式多,还集成OpenClaw。

AI寒武纪
算法论文8

大模型桌游试玩员来了:用五大画像模拟「千人千面」,评分精准度超越GPT-5.1

盛大东京研究院等团队提出MeepleLM,首个能模拟玩家视角给出建设性批评的虚拟试玩模型。它构建专属数据集,引入MDA理论,提炼五种玩家画像。实验显示其评分精准度超GPT - 5.1等通用模型。

量子位
新闻资讯7

AI 唱得比顶流歌手还精准!周亚辉盛赞百倍跃进,高晓松直言:AI 和我不是一个创作机制

近日昆仑天工发布 Mureka V8 音乐大模型,昆仑天工董事长周亚辉称其标志 AI 音乐达大规模工业化应用成熟度。高晓松认为 AI 与自己创作机制不同,但也肯定其能力,当前 AI 音乐正重塑产业权益结构。

AI前线
开源动态8

o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界

GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。

AI科技评论
算法论文8

全新预训练数据筛选方案,让数据效率提升10倍!配置仅需fastText评分器|港科大vivo出品

香港科技大学和vivo AI Lab提出轻量级高效数据选择方法PreSelect,已被ICML 2025接收。它只需训练部署基于fastText的评分器,减少10倍计算需求,在多数据集实验中效果显著优于其他方法。

量子位