「可验证推理」共找到 6204 篇相关文章

算法论文8

工业级文本转SQL新思路:成本暴降、超3000列超大数据库依然稳健

华中科大与复旦联合发布AutoLink框架,引入自主智能体,模拟人类工程师工作流。在不输入全量数据库模式下,实现对超大规模数据库模式的高精准链接与筛选,以低Token消耗刷新两大榜单纪录。

AIGC开放社区
开源动态8

真没招了!Claude撞碎创业梦,华人博士开源逆袭

Claude Cowork发布砸了Guohao Li的创业梦,他将Eigent项目开源。他对multi - agent架构工程化重构,打造全栈本地Agent,其分布式设计、沙盒终端、推理层优势明显,引发社区关注。

新智元
算法论文8

CMU&NYU最新工作解释:存储在权重里的“智能”是从哪来的?

论文《From Entropy to Epiplexity》指出经典信息论在AI面前有三大悖论,提出用Epiplexity度量信息。它将数据信息拆为Time - bounded Entropy和Epiplexity,通过神经网络训练近似计算,实验验证其有效性,并给出启示。

深度学习自然语言处理
产品应用8

一个全新的世界模型,终于让AI视频进入了“无限流”时代。

AI视频公司PixVerse推出实时世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉时视频会自行延续。该模型为世界模型补上实时视频生成方向,实测体验乐趣十足。

数字生命卡兹克
算法论文8

浙大彭思达团队 × 理想最新研究:直面高分辨率深度的细节缺失

现有高分辨率深度估计方法在实际使用中存在局限,浙江大学彭思达团队联合理想研究团队提出论文《InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields》,构建实验验证了InfiniDepth在多方面的有效性。

AI科技评论
算法论文8

深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知

多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。

机器之心
新闻资讯7

Claude Code 一小时「复刻」谷歌一年成果,那一年能读完五年半的博士吗?

X博主Yuchen Jin感慨读博时若有AI工具,一年就能毕业。谷歌工程师称Claude Code一小时成果抵谷歌一年。网友对AI工具在工作积极认可,但在教育作用上看法不一,争论持续。

机器之心
推荐文章7

在 AI 增强的变革流中,架构师要承担何种角色?

数据显示多数组织采用AI却未获实质价值,技术进步但组织影响参差不齐。架构师可弥合组织目标与开发速度的鸿沟,利用AI增强架构实践,案例展示了架构流动性在实践中的体现。

InfoQ
算法论文8

拒绝「盲修」:JarvisEvo 如何让 Agent 像人类一样拥有「视觉反思」能力?

现有 Image Editing Agent 缺乏视觉反馈,易致「指令幻觉」和 Reward Hacking。JarvisEvo 应运而生,它通过 iMCoT、SEPO、On - Policy Reflection 等技术,结合 ArtEdit 数据集和三阶段训练,在修图上表现出色,意义超图像编辑。

机器之心
开源动态8

智谱 GLM-4.7,Coding 开源第一,其他也很强

智谱正式发布并开源专为 Agentic Coding 打造的 GLM-4.7 模型,编程、推理、Agent 能力成绩亮眼,价格比 Claude Sonnet 4.5 更优。还推出 Coding Plan 套餐,使用方式多样。发布前几天,智谱港股招股书挂网。

AGI Hunt