「长上下文问题」共找到 4102 篇相关文章
Tool-Star:赋予大模型结合多工具推理的能力
文章提出Tool - Star框架,旨在解决大模型多工具协作推理难题。它从数据端到训练流程优化,让模型调用多种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来多模态及多工具扩展方向。
GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题
上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。
多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!
来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。
终于不用羡慕老外了!美团竟然做出了类似V0&Bolt的AI编程神器
美团推出零代码应用生成工具NoCode,类似V0&Bolt。它功能强大,能生成复杂网页应用,支持提示词生成、自动优化、快速部署等,还自带数据库服务,免费且无需邀请,为国内Vibe Coding带来曙光。
如何管理和调度Dify工作流?
文章介绍Dify这一开源大模型应用开发平台,指出其工作流存在无定时调度和监控报警、执行记录过多致性能差等痛点。给出Dify Schedule和XXL - JOB两种集成Dify工作流方案,并分析各自优缺点。
DeepSeek发布最新论文,5大杀手锏让大模型训练、推理暴涨
全球著名开源大模型平台DeepSeek在huggingface发布超强开源模型V3的论文,从硬件架构和模型设计双视角探讨高效训练和推理,提出DeepSeek - MoE、多头潜在注意力等创新技术,解决内存、计算效率等难题。
二十年老牌 IDE 栽在 AI 上?JetBrains 被差评逼疯批量删除评论,用户怒打 1 星抗议
JetBrains的AI助手插件下载超2200万次,但评分仅2.3分。用户不满其自动安装、速度慢、bug多等问题,负面评论被批量删除引发抗议。公司虽推出免费套餐和新AI智能体Junie,但仍面临成本、竞争等难题。
Agent记忆系统:6大核心操作全景解读
自LLM进入Agent时代,记忆模块成研究重点。以往研究有缺憾,作者提出全面AI记忆研究框架,对记忆表示分类,引入六种基本记忆操作,并映射到多方面,还阐述各部分具体方法。
Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!
Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。
传统企业 AI 转型的最短路径,藏在研发部门
文章指出在AI时代,传统企业研发部门正从成本中心转变为AI转型发动机。分析转型从研发出发的原因,介绍传统企业转型面临的难题及Agent的作用,还通过海信、三一重工、孩子王案例展示AI应用路径。