可验证性」共找到 4935 篇相关文章

算法论文7

Transformer学不会多位数乘法?MIT和哈佛的研究指出了一个简单漏洞

MIT、哈佛和谷歌DeepMind团队实验发现,Transformer做4位数乘法有软肋。用‘隐式思维链’(ICoT)训练的模型准确率达100%,传统方法仅1%。研究揭示了问题根源,还给出修复方案,但也引发诸多质疑。

AI工程化
新闻资讯7

Anthropic 研究员:强化学习将推动 Transformer 实现 AGI

在 AI Agenda Live 纽约活动上,Anthropic 强化学习团队技术负责人 Sholto Douglas 称,无需新架构突破,强化学习能让 Transformer 达人类专家级别表现,接近 AGI。但定义「好表现」是难题,Anthropic 或投 10 亿美元提升模型企业应用表现。

AGI Hunt
产品应用7

刚刚,这家0产品0模型就估值854亿的公司,终于发布了首款产品!

Thinking Machines Lab推出首款产品「Tinker」,这是专为语言模型微调而生的API,让开发者摆脱底层架构束缚,用简单Python代码专注创新。它功能强大,目前免费私测,已获普林斯顿、斯坦福等团队使用。

新智元
推荐文章8

麦肯锡调研了 50 个一线 AI 智能体的项目总结出来的六条经验

麦肯锡调研50个AI智能体真实项目,提炼出开发智能体的6个关键因素,如关注整体流程、明确适用任务、避免制造“AI垃圾”等,助企业从智能体中捕获价值。

宝玉AI
产品应用8

搜狐架构演进技术实践:我们如何用 MCP Registry 根治 AI Agent 的“千具之灾”

本文讲述搜狐团队在构建企业级 AI Agent 时遭遇‘千具之灾’,当前路由模型方案引发‘治理噩梦’。后通过研究 MCP Registry 获新思路,设计新架构,构建 PoC 原型,并对混合路由等问题展开思考。

InfoQ
新闻资讯8

刚刚,DeepSeek论文登上Nature,更多细节披露!

9月17日,梁文锋担任通讯作者的DeepSeek - R1推理模型研究论文登《Nature》封面,它是全球首个经同行评审的主流LLM。不靠人工标注,靠强化学习激发推理能力,学会‘自我反思’,在多任务上优于传统模型。

PaperAgent
推荐文章7

Claude 代码框架之战

开发者尝试让Claude做繁琐编码工作,自己担任高价值角色。当前开发者社区正进行“Claude代码框架之战”,文中给出设计Claude工作流的八个选择及搭配套餐,指出设定框架能让AI发挥最大效力。

宝玉AI
开源动态8

你的AI“体检”了吗?开源AI红队测试平台,一键自查三大风险

AI圈一边是顶尖模型发布,一边是大模型被“越狱”输出有害内容。腾讯朱雀实验室开源A.I.G平台,能模拟真实攻击对AI产品全方位风险扫描,有大模型体检、基础设施漏洞扫描、MCP Server风险检测三大核心能力。

腾讯技术工程
产品应用7

零代码、100%本地!三步生成企业级MCP,Postman这个新功能绝了~

作者发现Postman新增MCP Generator功能,拖拖点点就能构建MCP Server。以公共的HackerNews为例,介绍了筛选API、生成代码、配置Client三步生成企业级MCP的过程,还指出此功能适合快速接入标准化REST API。

探索AGI
开源动态8

设计师集体沸腾!阿里开源千问图像编辑模型,支持语义及外观的双重编辑!

阿里Qwen团队于2025年8月18日发布Qwen-Image-Edit模型,基于20亿参数的Qwen-Image模型,结合Qwen2.5-VL和变分自编码器,支持语义及外观双重编辑,能精准修改文字,已上线Qwen Chat等。

开源星探