RL4LLM」共找到 2578 篇相关文章

新闻资讯7

4.8亿美元砸向端侧算力!Agent芯片新贵冲出重围

成立不到三年的Acrab成亚洲AI芯片新贵,累计融资超4.8亿美元,新资金用于扩产、拓展生态及研发下一代平台。该司押注端侧算力,发布芯片GΞLIX 1和Agent Box,其产品进入量产验证。

量子位
推荐文章7

LLM提示三剑客:解密CoT、ReAct、DSP如何提升AI准确率?

LLM提示分思维链(CoT)、ReAct和声明式自我提示(DSP)三类。CoT鼓励模型推理,适合多步骤复杂问题;ReAct结合推理与动作,是代理基础;DSP让模型声明计划,用于模块化任务。还给出使用场景与对比。

CourseAI
开源动态8

4B参数实现理解、推理、生成、编辑一体化!InternVL-U重磅开源

上海人工智能实验室联合多所高校开源多模态一体化模型 InternVL-U,仅 4B 参数,突破现有统一多模态模型瓶颈,在复杂场景超越 14B 级模型,已全面开源,提供推理代码等。

OpenMMLab
算法论文8

给定"标价"的 LLM 智能体,能规划出"最优"路径吗?

LLM智能体多轮工具使用中,评估成本是难题。来自多所高校的团队推出CostBench基准,围绕旅行规划构建评估环境。评估顶尖模型发现其规划与适应能力有短板,并分析失效根源,还指出下一代智能体演进方向。

深度学习自然语言处理
推荐文章7

Chatbot 落幕,企业 LLM 才是 AGI 关键战场|AGIX PM Notes

文章围绕 AGI 展开深度思考,指出企业市场是 AI 革命原爆点,让企业数据适配 LLM 是前提。还提及本周市场情况,如对冲基金资金流向,以及多家公司财报超预期、微软和 Meta 加入 GSE 等动态。

海外独角兽
新闻资讯7

Claude不到4%,全军覆没!一场大考撕碎Agent「全自动办公」幻想

新智元报道,UniPat AI的SaaS - Bench实战考卷,用23个真系统、106个任务测试Agent。结果显示,Claude Opus 4.7完全通过分数仅3.8%,多数模型全军覆没,暴露了Agent在真实环境中的四种致命缺陷。

新智元
产品应用8

30 小时不眠不休写代码,Claude 4.5 的三个“最佳”

Anthropic发布Claude Sonnet 4.5,宣称其为“世界上最好的编码模型”等。它在测试中表现出色,能力全面提升,价格实惠,开发者测试效果佳。还注重安全,升级开发工具和生态系统。

AIGC开放社区
新闻资讯7

V4或Code要来?刚刚,DeepSeek-V3.1-Terminus发布!

DeepSeek线上模型升级为DeepSeek-V3.1-Terminus,单从名字看像是V3终极版,或在筹备V4及Code模型。deepseek - chat和deepseek - reasoner完成升级,此次更新改进语言一致性,优化Agent能力。

PaperAgent
推荐文章8

LLM省钱大测评!48块GH200,首个百亿级参数量实证

EfficientLLM项目聚焦LLM效率,提出三轴分类法和六大指标,实验覆盖多方面。研究表明效率优化需权衡,最优策略因任务和模型规模而异,且相关技术可迁移到跨模态模型,成果将开源。

新智元
开源动态8

用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源

华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。

量子位