「性能模型」共找到 8399 篇相关文章
AI们数不清六根手指,这事没那么简单。
作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。
一天 15k 星,代码生成碾压 Claude,连 Cursor 都慌了?谷歌 Gemini CLI 杀疯了
谷歌发布 Gemini CLI,有慷慨免费使用配额,开源且不到一天获 15.1k 星。它连接 MCP 服务器,具备 Agentic AI 能力,接入 Gemini 2.5 Pro 模型,在代码生成等方面表现出色,谷歌认为通用模型更优。
DeepSeek们越来越聪明,却也越来越不听话了。
论文《When Thinking Fails: The Pitfalls of Reasoning for Instruction - Following in LLMs》用实验验证,模型推理能力变强时,提示词遵循能力变差。研究团队对15个模型测试,发现用CoT推理后执行准确率下降,还提出4种提升指令遵循效果的方案。
华为攻克AI推理「想太多」问题!新方法让大模型推理提速60%,准确率还高了
华为提出高效推理方法S - GRPO,突破思维链「冗余思考」瓶颈。通过“串行分组 + 衰减奖励”设计,在Qwen3上有效,推理提速60%,生成答案更精确有用,在多个推理benchmark测评中表现出色。
经纬领投2000万美元,Aether AI让机器人学会举一反三|甲子光年
6月18日,Aether AI获约2000万美元首轮融资。创始人黄碧薇认为主流大模型学的是相关性而非因果性,她将LLM和因果算法结合,打造因果世界模型,搭建“因果大脑”,并选择具身智能作为落地场景。
3B激活参数,干翻GPT-5.4和Opus4.6,商汤绝影把龙虾塞进了车里
商汤绝影发布端侧多模态大模型Sage,32B总参数、3B激活参数,在PinchBench评测超Claude Opus4.6等。自研SCOUT和ERL技术助力,从多维度领先同量级端侧模型,为座舱智能体提供支撑。
UserBench 与 UserRL 带来的交互智能范式转向
当下大模型在与用户交互时存在不足,来自UIUC与Salesforce的UserBench和UserRL两篇新作,将‘用户价值’量化,把‘可测的交互’转化为‘可训练的策略’,从评测和训练层面推动模型向‘懂用户’转变。
大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间
随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。
章鱼动力再获5000万美元融资,以世界模型驱动「手脑一体」的物理 AI 基础设施
AI科技评论获悉,物理AI基础设施公司章鱼动力近日完成5000万美元融资,过去3个月累计融资近10亿。本轮由锦秋基金等领投,下轮5亿融资也接近完成。公司以SYNTH架构构建闭环,目标推动物理AI进阶。
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。