差评」共找到 374 篇相关文章

算法论文8

LLM规划能力飙升79%!Google:内在自我批技术拿下多项SOTA

Google DeepMind研究《通过内在自我批提升大语言模型的规划能力》,不借助外部验证器,让LLM反复“自+重写”,使Blocksworld准确率从49.8%升至89.3%,还介绍了方法及跨模型验证情况。

PaperAgent
新闻资讯7

Meta 用一个烂 Web 应用替换原生 WhatsApp:Windows 用户活该将就?

Windows 11 版 WhatsApp 升级后只是在 WebView2 容器加载网页版,性能糟糕、卡顿,与 Windows 通知兼容性。Meta 曾用原生应用替代 Web 版,如今又走回头路,让人担忧 macOS 版未来。

InfoQ
新闻资讯7

对话 Coddie 何鋡威:95 后,华为、传音、拓竹历练,用特斯拉的思路做母婴产品

Coddie创始人何鋡威,95后,曾任职华为等企业,后投身母婴赛道。他认为母婴行业产品、毛利高,缺乏极致产品。Coddie用AI改造该赛道,做育儿大脑和生态,欲成母婴界特斯拉,目标欧美市场。

Founder Park
产品应用7

Harness Engineering 时代的失败经验

作者分享在Harness Engineering时代使用Coding Agent的经验,指出虽Agent发展快且有成功案例,但实际应用有诸多问题,如部分模型体验、自然语言模糊影响长程工作等,还给出解决思路,文章会持续更新。

GiantPandaLLM
新闻资讯8

陶哲轩再爆:一个月三破18年未解难题!AlphaEvolve彻底改写数学研究规则

一项封尘18年的数学难题,在短短30天内被AlphaEvolve与人类联手三度突破,和集指数θ从1.173050提升至1.173077,刷新加法组合学天花板,展示了AI与人类协作的新范式。

新智元
推荐文章7

AI 一键生成网站之后,最残酷的距出现了:代码不再值钱,审美决定生死

知名前端开发者 Wes Bos 认为,2026 年将是“设计复兴之年”。当 AI 能让任何人快速生成网站,真正的异化将来自审美、取舍和打造独特体验的能力。如 Lando Norris 官网,靠精心设计吸引关注。

InfoQ
新闻资讯8

陶哲轩转发!华人数学博士后反超DeepMind AI,停滞18年数学问题1个月内3次突破

DeepMind的AlphaEvolve打破集合和问题18年纪录,华人博士后Fan Zheng等数学家出手反击。人类用测度集中性少量辅计算机,1个月内该问题3次突破,陶哲轩称不同方法可互补推动数学进步。

量子位
新闻资讯3

马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?

Grok 4公开基准测试有进步,但在高级推理测试表现,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。

AI寒武纪
推荐文章7

Agent架构搭建 ≠ 堆Skills

现在很多Agent架构以大量Skills为基础,但这种做法大概率会翻车。Skills机制让模型自行判断是否使用及何时使用技能,其判断不可靠,随着技能数量增多,系统可靠性变,设计上需平衡灵活性与可控性。

newtype AI
新闻资讯7

那位曾高喊「AI能接管一切」的CEO后悔了:宣布重启人工招聘!

Klarna CEO曾称AI能取代所有人类工作,公司也实施‘AI优先’战略,用AI客服取代人类、缩减人力。但AI客服实际表现不佳,服务体验,Klarna决定重启人工招聘,打造‘高质量人类支持’。

AI科技大本营