可验证性」共找到 4857 篇相关文章

算法论文8

斯坦福华人研究火了:45分钟让你的论文变身AI智能体!

斯坦福大学研究人员提出Paper2Agent,将静态论文转化为交互的AI智能体。它提供自动化工作流,核心是封装成MCP服务器。通过三个案例展示其将不同论文转化为智能体的能力,提升科研成果易用复现

新智元
算法论文8

ACL 2025杰出论文!用能力显著向量让大模型下游任务能预测更精准

上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现预测

OpenMMLab
开源动态8

AutoDev CLI:打造 AI 生成的 AI Agent 质量保障与验证架构

文章介绍AutoDev CLI,它基于AutoDev MPP架构构建,旨在解决上一代AutoDev智能体测试难题。阐述其起步、迭代、演进、集成过程,实现从AI生成代码到验证、生成测试系统的转变,带来验证演化、移植的优势。

phodal
开源动态8

阿里开源14B电影级视频模型!实测来了:免费玩,单次生成时长达分钟级

昨夜阿里发布14B视频模型Wan2.2 - S2V,仅需一张图片和一段音频,就能生成电影级数字人视频。该模型发布即开源,在通义万相官网免费体验,单次生成时长达分钟级。

量子位
开源动态8

谷歌推出 LLM-Evalkit,为提示词工程带来秩序与衡量

谷歌推出基于 Vertex AI SDK 的开源框架 LLM - Evalkit,让大语言模型提示词工程更有序衡量。它整合实验、测试等环节,与谷歌云工作流集成,有无代码界面,已在 GitHub 发布。

AI前线
算法论文8

最具争议研究:大模型中间层输出 100% 反推原始输入

意大利罗马第一大学GLADIA Research Lab论文提出主流Transformer语言模型信息处理几乎不丢内容,是逆的。实验验证其单射,SIPIT算法能100%重建输入。研究有新视角,但也引发讨论。

AI科技评论
新闻资讯7

AI观测行平台Lightrun,获7000万美元

AI观测平台Lightrun获7000万美元B轮融资,由Accel和Insight Partners领投。它改变传统监测工具局限,实现实时调试修复。连续三季成G2领域领导者,获众多企业信赖,发展迅猛。

AIGC开放社区
算法论文8

条条电路通罗马:大模型解释的「唯一机制」能从一开始就不存在

长期以来,机制解释领域默认模型对同一任务的能力对应唯一内部「电路」。但被ICML 2026接收的新论文指出,「唯一电路」能不存在,同一任务由多个结构不同但能力相当的电路完成。

机器之心
新闻资讯8

刚拿诺奖就登Nature封面!谷歌“量子回声”算法计算提速13000倍,重复验证结果

刚获诺奖的谷歌量子团队登Nature封面,提出“量子回声”算法,计算提速13000倍且结果重复验证。解决了量子计算结果难确认问题,该算法在多领域有应用潜力,还依赖Willow芯片优势。

量子位
新闻资讯8

韦东奕论文登数学顶刊,将散焦方程的爆破研究扩展至d≥4

韦东奕和北大学者章志飞、邵锋合作的论文发表于数学顶刊《Forum of Mathematics, Pi》。他们将散焦方程的爆破研究扩展至d≥4,成果填补空白,证明方法推广到其他方程。

量子位