「长程任务能力」共找到 4566 篇相关文章
从少样本到千样本!MachineLearningLM给大模型上下文学习装上「机器学习引擎」
新研究 MachineLearningLM 提出轻量可移植「继续预训练」框架,突破 LLM 在上下文学习局限,能学上千示例,在多领域分类任务超基准模型。它有三项核心创新,效果惊艳且应用潜力大,还指明未来研究方向。
肖涵:2026 年的 AI 搜索就是智能体记忆 | Elastic 中国 AI 搜索技术大会
2026 年智能体记忆成 AI 基建新战场,虽概念不新但获前所未有的紧迫感。因智能体任务变长但记性差,加记忆后又有记不住该记、忘不掉该忘的问题,遗忘成最大难题,产品分三条技术路线。
Artificial Analysis 榜单第二,SkyReels-V4 宣告 AI 视频进入「全栈统一」阶段
昆仑天工的 SkyReels-V4 在 Artificial Analysis 文生视频榜单排第二,ELO 评分 1090。它有「运动参考」能力,能覆盖视频创作全工作流,背后靠统一拼接框架和双流 MMDiT 架构,体现 AI 行业「统一」趋势。
成本降70%!清华、阿里通义带来智能体长程任务新解法
AI智能体处理长程任务常遇上下文超载问题。清华与阿里通义研究人员提出MemPO算法,赋予大模型主动管理记忆能力,准确率提升,计算资源消耗降近七成,不过评价机制有局限。
刚刚,MiniMax直接让龙虾学会自我进化,也认识「马嘉祺」了
在 GTC 2026 大会上,英伟达推出 NemoClaw。国内 MiniMax 加快‘AI 养虾’布局,推出 MaxClaw 模式。新发布的 M2.7 能力升级,在多方面表现出色,还在科研评测中获佳绩,实测效果良好,开启自我进化。
Gemini 3“超前点映”效果炸场,巴菲特305亿重仓谷歌
Gemini 3还未正式发布,“超前点映”已亮相,网友实测其表现超强,能完成多种复杂任务。关注度火热,谷歌CEO还转发相关猜猜乐消息。同时,巴菲特305亿重仓谷歌,据传因提前体验Gemini 3。
我用MiniMax Agent开发了个带后端的全栈网站,全程0代码
2025年Agent成AI领域焦点,大厂纷纷布局。作者测试MiniMax Agent,发现其有四大特点:深度研究和上下文管理强,多模态输出出色,编程能力超预期,能执行定时任务,还能开发带后端的全栈网站。
「边思考、边搜索、边写作」WebThinker开启AI搜索&研究新纪元!
大型推理模型有推理能力,但静态知识限制其在复杂任务表现。WebThinker 让 LRM 推理中自主搜索、导航及写报告,集成探索器,有自主策略和训练工具,实验显示性能强,还指明未来探索方向。
告别“一眼定生死”:Agent-as-a-Judge 开启 AI 评估的下半场
过去两年,LLM-as-a-Judge成评估界“黄金标准”,但面对复杂任务力不从心。论文《A Survey on Agent-as-a-Judge》指出,应从单一的大模型裁判进化为具备行动能力的智能体裁判,还阐述了其优势、发展阶段等。
实测Kimi全新Agent模型「OK Computer」,很OK
Kimi发布全新Agent模型「OK Computer」,依托Kimi K2,能搭网站、做PPT、处理大量数据。实测显示它在设计、生成、分析类任务表现不错,设计无需找素材,分析无需想角度,生成还能推荐风格。