「优化问题」共找到 4163 篇相关文章
多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!
来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。
如何管理和调度Dify工作流?
文章介绍Dify这一开源大模型应用开发平台,指出其工作流存在无定时调度和监控报警、执行记录过多致性能差等痛点。给出Dify Schedule和XXL - JOB两种集成Dify工作流方案,并分析各自优缺点。
模型宣称的“百万字处理能力”是真本事,还是营销噱头?LongCodeBench揭露真相
近年来大模型号称有百万字处理能力,但这是真本事还是噱头存疑。论文用LongCodeBench测评工具揭开长上下文模型真实表现,测试顶尖模型发现长文本能力‘翻车’,还分析了长上下文难的原因及面临的瓶颈。
一个记忆库,N 个 AI 助手用!mem0 OpenMemory MCP 打通 Cursor/Claude/Windsurf ~
OpenMemory MCP是本地运行的共享记忆系统,基于MCP协议,让多个AI工具共享上下文记忆。它通吃主流MCP客户端,提供标准API,数据私密,有可视化面板且一键安装。官方列举应用场景,虽扩展性待考,但方向值得关注。
二十年老牌 IDE 栽在 AI 上?JetBrains 被差评逼疯批量删除评论,用户怒打 1 星抗议
JetBrains的AI助手插件下载超2200万次,但评分仅2.3分。用户不满其自动安装、速度慢、bug多等问题,负面评论被批量删除引发抗议。公司虽推出免费套餐和新AI智能体Junie,但仍面临成本、竞争等难题。
Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!
Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。
亚马逊 CTO 要来中国了,说实话,这比泛滥的 AI 发布会值得关注
本文梳理亚马逊CTO Werner Vogels从业多年的技术思考路径:从供给侧造工具降低开发门槛,到转向关注使用者与真实需求,反思当前AI热潮下的行业焦虑,指出他本次2026年10月中国行,比泛滥的AI发布会更具关注价值。
传统企业 AI 转型的最短路径,藏在研发部门
文章指出在AI时代,传统企业研发部门正从成本中心转变为AI转型发动机。分析转型从研发出发的原因,介绍传统企业转型面临的难题及Agent的作用,还通过海信、三一重工、孩子王案例展示AI应用路径。
长程 Agent 越跑越乱?ContextPilot 用细粒度 RL 教会模型主动管理上下文
长程 Agent 推理时,传统方法使上下文臃肿、推理成本高。清华、腾讯等团队提出 ContextPilot 框架,扩展管理工具集、采用新采样和信用分配方法。实验显示其用短上下文获高分,降低推理开销。
智能体时代EDA工具革新,比昂芯科技专注AI驱动电路仿真及Chiplets设计
近期,AI+芯片设计生成成全球资本热门赛道。比昂芯科技早在2024年就启动AI在EDA领域的底层技术探索,形成AI原生EDA完整技术闭环。其研发总监吴晨博士在IDAS 2026分享实践,公司还有四大核心产品及服务。