「AI Agent 模型」共找到 14126 篇相关文章
DeepSeek押注的Harness,被这篇最新综述彻底讲透了
这篇综述讲透了Agent Harness Engineering,CMU等联合提出ETCLOVG七层架构,证明Harness Engineering是LLM Agent工业落地主战场,介绍了其发展阶段、各层架构及作用等。
最新 AGI 暴论:强化学习的「GPT-3 时刻」实现,还需要 1 万年?
国外AI初创公司Mechanize三位创始人联合撰文称,RL或迎“GPT - 3时刻”,但需数千至上万年“模型处理任务所用时间”训练。还提出“复制训练”新范式,能磨炼模型能力,补足短板。
谷歌AI连发6篇数学论文!Gemini攻入博士级科研,91.9%刷爆SOTA
谷歌DeepMind放出多篇重磅论文,Gemini Deep Think成「科研合伙人」,攻克多领域难题。谷歌打造基于Gemini的「AI数学家」Aletheia,在博士级难题获科研里程碑,首批6篇论文成果斐然。
里程碑!Artificial Analysis:Mac能跑的两款开源模型正式追上GPT-5
据Artificial Analysis报告,32B以下开源模型比肩GPT - 5。Qwen3.5 27B、Gemma 4 31B分别与GPT - 5中杯、小杯智能水平相当,虽知识全面性落后,但智能体表现和批判性推理进步大,硬件门槛低。
pdf2skill:让计算机视觉初学者把PDF文档变成AI技能包
pdf2skill技术是“文档转技能编译器”,能将PDF知识转化为AI可调用技能包。它解决了计算机视觉研究和工程中的痛点,介绍了原理、实战案例、代码实现,还对比性能、给出使用指南。
学生3年投稿6次被拒,于是吴恩达亲手搓了个评审Agent
机器学习大佬吴恩达为投稿屡被拒的学生,做了免费AI论文评审智能体。它在ICLR 2025审稿数据训练,与人类审稿相关系数达0.42,能按会议风格评审,还提修改建议,可体验。
AI点外卖哪家强,美团LongCat团队做了个全面评测
美团LongCat团队发布贴近生活场景的大模型智能体评测基准VitaBench,以三大高频生活场景为载体,构建含66个工具的评测环境。评测显示现有智能体与应用需求差距大,该基准已全面开源。
英伟达全新开源模型:三倍吞吐、单卡可跑,还拿下推理SOTA
英伟达推出专为复杂推理和agnet任务打造的开源模型Llama Nemotron Super v1.5,实现SOTA表现,吞吐量提至前代3倍,可单卡高效运行。它采用NAS优化架构,经多数据集训练,现已开源。
基于百万亿 Token 的 AI 使用模式分析:趋势、拐点与未来|PPT分享
近期OpenRouter报告《人工智能现状:基于OpenRouter的100万亿Token实证研究》,分析超100万亿个token的真实世界LLM交互数据,弥补LLM实际使用情况证据不足,揭示2024年转折及多方面发现。
24张图,从GPT-2到gpt-oss,看OpenAI开源模型技术演进
2025年8月OpenAI释出gpt-oss-20b与gpt-oss-120b两个开源权重模型。文章梳理了从GPT - 2到gpt - oss的技术演进,拆解关键创新点,对比了与Qwen3的差异,介绍训练推理细节、实测体验及与GPT - 5跑分对比情况。