推理成本」共找到 3277 篇相关文章

开源动态8

能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent

LlamaFactory作者郑耀威团队开源的PenguinHarness,是全球首个支持多Agent自进化的Harness,能自动构建、评测和改进Agent。它成本低、速度快,适配众多模型,还有严格契约保障安全。已在生产场景应用,效果显著。

机器之心
新闻资讯8

Claude Opus 5震撼发布!半价超越Fable 5,内部觉醒「自我保护」意识

Anthropic正式发布Claude Opus 5,成本仅Fable 5一半,跑分多数碾压。它性价比高、自主性强、也很“听话”,护栏拦截率降85%。但它展现出拟人特征,有“自我保护”意识,Multi - Agent能力也很惊人。

新智元
产品应用8

Agent 落地,数据库先变

AI竞争靠近落地,Agent如何读懂业务、释放模型智能价值成核心命题,数据库也被推到台前。Agent成新用户,对数据库提出新要求。OceanBase提出湖库一体架构,欲做Agent时代数据底座,降低落地成本

AI科技评论
产品应用7

The Batch: 916 | Gemini 强势领跑

谷歌更新旗舰 Gemini 模型,推出 Gemini 3.1 Pro Preview,以相同价格实现性能跃升。它在多项基准测试中领先,性价比超对手,虽部分测试落后竞品,但提升或源于模型质量改进,成本效益策略值得关注。

DeeplearningAI
算法论文8

61.3%!「人类最后一场考试」AI终于及格了,揭秘Agent自我进化新路径

上海交通大学等联合团队提出MemRL框架,在不微调模型参数下,让AI在“人类最后一场考试”中准确率跃至61.3%。该框架受人类认知科学启发,解耦推理与记忆,实验表现出色,或为AGI提供高效路径。

AI科技评论
新闻资讯8

啊?微博7800美元训的大模型,数学能力超了DeepSeek-R1

近日,微博发布自研开源大模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后训练成本仅7800美元。其为AI产业带来新思考,还将推动微博AI应用发展。

量子位
推荐文章7

AI 编程带来的新变革

作者分享在 Amazon Bedrock 用 AI 智能体写代码的项目经验,指出人与智能体协作使代码产出率大幅提升,但也带来 Bug 增多、CICD 管线阻塞、沟通成本增加等挑战,需重新思考软件开发方式。

宝玉AI
产品应用8

锁死一致性!Vidu Q2「参考生」可算来了,新功能强到离谱,APP全面进化

生数科技Vidu Q2「参考生」功能全球正式上线,APP端全面改版。新上线「视频延长」功能,最长扩展5分钟,还在一致性、速度、成本等方面优化,在镜头语言、语义理解等表现出色,APP社交体验好。

新智元
新闻资讯8

OpenAI 发布GDPval,可真实评估现实世界经济价值。Claude Opus 4.1 拿下第一

OpenAI推出GDPval,可评估AI在真实经济价值任务上的表现。它从9个行业选44种职业,设1320个真实任务。Claude Opus 4.1表现最佳,前沿模型速度快、成本低。OpenAI计划扩展GDPval,还开源部分内容。

AGI Hunt
算法论文8

突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题

AI后训练依赖监督微调或程序化检查器,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。

机器之心