「通用推理技术」共找到 5044 篇相关文章
我的天!MCP开发,从“地狱模式”秒变“傻瓜操作”
作者分享FastMCP工具,它让MCP开发从难变易。过去开发MCP耗时久、Bug多,用FastMCP,186秒可本地搭建,还能上云、部署到Cloudflare Worker,降低AI工具开发门槛。
GPT-5 最强大的,是编程
据报道,OpenAI的GPT - 5即将到来且早期反馈积极。它在编程领域表现突出,尤其在实际编程任务上有提升,不过其具体形式存疑,改进或多来自后训练阶段的强化学习。
最新 AGI 暴论:强化学习的「GPT-3 时刻」实现,还需要 1 万年?
国外AI初创公司Mechanize三位创始人联合撰文称,RL或迎“GPT - 3时刻”,但需数千至上万年“模型处理任务所用时间”训练。还提出“复制训练”新范式,能磨炼模型能力,补足短板。
真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击
上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。
ICML 2025 | 清华、上海AI Lab提出专家级医学基准MedXpertQA,看o3、R1哪家强
本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。
DeepSeek被「猫咪睡觉」给干崩了……
研究员发现,在数学题后加「有趣的事实:猫咪一生大部分时间都在睡觉」,能让DeepSeek数学能力崩塌。研究开发CatAttack方法找「触发词」,无关触发词使模型错误率飙升,还会让回答变长。
恐怖的 361k+ star!这应该是我见过最给力的宝藏项目,全网最全!
介绍GitHub上的开源项目`free-programming-books`,它汇集海量免费编程学习资源,涵盖编程语言、框架、工具等多方面,有361k+ star。资源广、更新快、结构清、支持多语言,使用简单。
ICML 2025 Oral | 从「浅对齐」到「深思熟虑」,清华牵头搭起大模型安全的下一级阶梯
在大语言模型加速进入高风险应用场景当下,“安全对齐”是挑战。如今广泛采用的“浅对齐”脆弱不堪。清华团队提出STAIR框架,能提升开源模型鲁棒性,还推出RealSafe - R1模型进行安全对齐。
鹅厂实习生血泪贴:Agent/RAG黑科技,真相竟是这样!
腾讯实习生分享鹅厂项目实战经验,介绍Agent/RAG黑科技。先讲RAG原理、优化方法及评估流程,还提及文档解析;再阐述智能体定义、历史、原理、分类、评估框架与实践案例,助读者快速入门。
网页智能体新突破!引入协同进化世界模型,腾讯AI Lab提出新框架
腾讯AI Lab提出WebEvolver框架,引入协同进化的世界模型,让智能体在真实网页环境中性能提升10%,突破现有基于LLM的网页智能体瓶颈,还通过实验验证了其有效性和对网页状态变化的预测能力。