推理任务」共找到 3606 篇相关文章

开源动态7

视频生成1.3B碾压14B、图像生成直逼GPT-4o!港科&快手开源测试时扩展新范式

香港科技大学联合快手可灵团队推出 EvoSearch 方法,支持图像和视频生成。该方法无需训练和梯度更新,能提升模型生成质量,展现了 test - time scaling 补充 training - time scaling 的潜力,目前论文和代码已开源。

机器之心
开源动态8

给Agent加上知识图谱,开源版Palantir

Semantica是LLM、向量库与Agent框架下的语义/上下文层,能把碎片化企业数据变成结构化、可查询的上下文图与知识图谱。介绍了其面向对象、功能、优势、使用方法、架构等内容。

GitHubStore
推荐文章8

模型不是企业的护城河,那什么才是?

文章指出企业AI进入深水区后,真正的竞争是将AI变成企业自己的智能引擎。衔远科技创始人周伯文提出泛化基础上的深度专业化是企业竞争力来源。衔远发布EnterpriseClawBench,揭示企业需私有化评估和可持续进化能力。

量子位
7

Anthropic顶级Claude模型被逆向开源,这几个模块借鉴了DeepSeek

22岁开发者逆向开源Anthropic的Claude Mythos Preview模型架构,名为OpenMythos。其核心模块借鉴DeepSeek,采用带混合专家路由机制的循环Transformer,有独特设计和稳定机制,重新框定扩展性争论。

PaperAgent
算法论文8

CVPR 2026|AI开始会拍电影了:一分钟十镜头,全程不崩剧情

多镜头视频生成要求模型处理不同镜头间稳定信息和变化信息,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,建立跨镜头记忆机制,设计关键模块,实验表现好,为视频生成打开新可能。

机器之心
算法论文8

东方理工团队提出HiDrop:重构MLLM计算路径,压缩90%视觉Token实现2.2倍加速

东方理工大学沈晓宇团队提出HiDrop,基于MLLM不同层功能差异,设计出延迟注入、凹金字塔式剪枝和提前退出的视觉Token压缩策略。实验显示,它能压缩约90%视觉Token,保持98.3%性能,实现训练和预填充加速。

机器之心
开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论
推荐文章8

“每给 Claude Code 提一个请求,我就点上一根烟,放松下”

OpenFGA 核心维护者 Siddhant Khare 写博客吐槽使用 AI 编程的‘疲惫感’,指出 AI 带来职业疲惫却被行业回避,还分析了原因,如任务量膨胀、角色转变等,并给出应对建议,引发工程师共鸣。

InfoQ
算法论文8

从需求分析到代码生成,LLM都能干点啥?一文读懂291个软工Benchmark!

大语言模型重塑软件工程各环节,但缺乏评估其在该领域表现的系统工具。浙江大学等机构团队首次对291个软件工程Benchmark系统综述,分析现状、痛点并给出改进方向。

新智元
算法论文8

通义实验室最新成果WebDancer:开启自主智能Deep Research的新时代

通义实验室推出 WebDancer,解决自主信息检索智能体构建难题。它创新合成训练数据,采用两阶段训练策略应对开放网络训练挑战,在多个基准测试中表现卓越,未来还将拓展能力。

机器之心