「长任务智能体」共找到 5322 篇相关文章
国内首个免费提供的深度研究,反而有市面上最好的体验
秘塔深度研究(https://metaso.cn/)上线,是首个将深度研究作免费基础功能的产品。它在算法、交互等多方面优化,降低成本、保障准确,还创新交互形式,搜索结果清晰有条理,体验佳。
快慢Reasoning综述!
大型语言模型在复杂推理任务中有‘无差别计算’缺陷,阻碍其在多场景应用。本文提出双层效率优化框架,梳理两类前沿技术,通过实验揭示瓶颈,为轻量化推理指明路径。
一年上线超 10 款产品,AI 时代如何做独立开发
ThinkAny&MCP.so 创始人艾逗笔分享独立开发感悟与经验,介绍多款 AI 产品,如 ThinkAny、ShipAny 等。还给出 AI 应用出海 SOP、可 all in 的创业方向,如 AI Coding、Agent 等,为开发者提供参考。
半天16.5k Star,谷歌AI Agent强势开源,AI编程变天了!
Google推出轻量级且功能强大的开源AI Agent——Gemini CLI,能将Gemini带入用户终端,可利用Gemini 2.5 Pro编写代码等,半天获16.5k Star,还具备多种强大功能。
The Btch:838 | 苹果加强生成式 AI 布局
苹果更新 Apple Foundation Models(AFM)系列,含设备端和服务器端版本,还发布 Foundation Models 框架。AFM 模型架构特别,训练有优化,测试表现有差异。此前苹果论文引争议,此次或是其重启 AI 战略之举。
LLM进入「拖拽时代」!只靠Prompt,几秒定制一个大模型,效率飙升12000倍
新智元报道,NUS、UT Austin等机构研究人员提出「拖拽式大语言模型」(DnD),它基于提示词生成模型参数,无需微调适应任务,效率最高提升12000倍,零样本泛化能力出色。
Kimi新模型拿下代码开源SOTA,仅仅72B,发布即开源
深夜,Kimi发布新开源代码模型Kimi - Dev,在SWE - bench Verified上以60.4%成绩获开源SOTA。参数量72B,编程水平强。采用MIT协议,权重和代码已发布。官方透露了部分关键技术,更多细节待后续报告。
刚刚,OpenAI开放GPT-4.1偏好优化DPO,ChatGPT能真正学会你的「品味」了!
OpenAI宣布GPT - 4.1全系列模型支持DPO微调,可让AI通过对比回答学会用户偏好。介绍了DPO原理、适用模型、数据格式、创建任务方法等,还提及开发者反应与技术要点。
华为攻克AI推理「想太多」问题!新方法让大模型推理提速60%,准确率还高了
华为提出高效推理方法S - GRPO,突破思维链「冗余思考」瓶颈。通过“串行分组 + 衰减奖励”设计,在Qwen3上有效,推理提速60%,生成答案更精确有用,在多个推理benchmark测评中表现出色。
SOTA大模型遇上加密数据评测:Qwen3未破10%,o1也栽了丨上海AI Lab等联合研究
当前推理模型在基准测试中性能卓越,但在密码学领域推理能力待探索。上海AI Lab等推出CipherBank评测,用海量真实隐私场景数据和多类型密码算法挑战SOTA大模型,结果显示模型表现不佳,还分析了模型“犯难”原因。