任务感知能力」共找到 4764 篇相关文章

开源动态8

GPT-Image-2平替!最强开源生图模型来了

OpenAI推出GPT Image 2引发AI生图大战,国内厂商商汤反击,推出多模态理解生成模型SenseNova U1并全面开源。它通过自研架构实现理解、推理、生成统一,实测表现惊艳,能力全维度,与GPT-Image-2范式不同。

新智元
新闻资讯7

IMO题库“过时”了!OpenAI内部模型挑战最新First Proof,做了7天错了一半

谷歌发布Gemini 3 Deep Think爆火后,OpenAI用未发布内部模型,一周内尝试解答10道来自数学家科研现场的真实问题,5道基本正确。这些题取自真实研究,切断模型“背答案”可能,意味着自主推理能力进化。

量子位
算法论文8

清华新框架让大模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍

清华等团队提出全新框架RAM,受人类阅读认知启发,将“精读+略读”混合策略引入上下文压缩,突破现有方法效率瓶颈,在多任务上表现出色,实现12倍端到端加速,为长上下文LLM部署提供新范式。

量子位
算法论文8

从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现大模型高效沉默推理

复旦大学等机构团队论文提出SIM - CoT技术,解决隐式思维链推理准确率低、不稳定问题。该技术引入步骤级监督,提升性能、效率和可解释性,在多模型和任务测试中表现出色,让大模型高效沉默推理。

AIGC开放社区
产品应用7

Kimi K2:唯一能稳定准确生成时钟的AI模型

AI World Clocks项目让9个大模型按提示词生成每分钟更新的时钟,以观察稳定性。国产Kimi K2是唯一能稳定保持表盘与指针正确平滑转动的模型,测试显示了模型在时空概念上的能力差异。

AI工程化
产品应用8

模型即 Agent 的含金量:Kimi深度研究功能详评

作者分享Kimi深度研究功能体验。其基于端到端自主强化学习技术,会开源模型。在测试中,分析Labubu爆火原因、检索小米发布会内容,展现出强逻辑分析、搜索准确性和数据处理能力,可视化网页也出色。

歸藏的AI工具箱
推荐文章8

Anthropic:这样构建Agent,性能提升90%!

Anthropic分享从0到1构建多智能体DeepResearch系统的方法,该系统是Claude内置Research功能。干货多,涵盖架构设计、Prompt工程等。多智能体性能比单模型高90.2%,但烧钱,适合高价值复杂任务

探索AGI
算法论文8

何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升

何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。

量子位
新闻资讯7

MMAR与AudioTrust技术解读,音频大模型评测前沿进展分享 | AI Bench Talk直播预告

司南评测集社区 CompassHub 收录多维度评测集。此次 AI Bench Talk 直播聚焦音频大模型,将分享评估其深度推理能力的 MMAR 及全方位可信评估框架 AudioTrust,还设圆桌讨论多模态/音频大模型相关议题。

OpenMMLab
开源动态8

首创TTFA指标!港大团队开源FASTER,让VLA模型真正实现「即刻响应」

港大团队提出FASTER,重新审视动作分块策略的反应延迟问题,提出快速动作采样方法。它即插即用,已开源。通过Horizon - Aware Schedule等创新,降低TTFA、提高闭环频率,实验显示能显著提升VLA反应能力

机器之心