多智能体大语言模型」共找到 9542 篇相关文章

开源动态8

模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源

微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。

AIGC开放社区
新闻资讯7

DeepSeek新大招曝光:下一步智能

知情人士爆料,DeepSeek正开发有更强AI Agent能力的新模型,预计年底推出。此前DeepSeek-V3.1已具备更强Agent能力,在工具使用与智能体任务中表现提升。业内对其入局智能体看法不一。

量子位
推荐文章7

具身智能中的 VLA 技术及其应用

文章围绕具身智能中 VLA 技术展开,介绍其现状、挑战、架构、数据方案及部署等内容。指出 VLA 虽推动具身智能发展,但面临数据、模型结构等挑战,还探讨了不同架构优劣及未来探索方向。

InfoQ
新闻资讯7

OpenAI新模型,被曝秘密训练中!万字硬核长文直指o4核心秘密

SemiAnalysis爆料,OpenAI正训练规模介于GPT - 4.1和GPT - 4.5间的新模型,下一代推理模型o4基于GPT - 4.1训练。强化学习成推理模型进步功臣,但面临基础设施瓶颈,奖励函数难定等问题。

新智元
开源动态8

打破大模型编程「数据污染」与「能力虚胖」困境,Meituan-M17团队构建新一代AI编程评测新标准——OIBench

当前大语言模型编程能力评估体系问题多,如评测集饱和、数据泄漏等。Meituan - M17团队推出OIBench数据集,对18个主流大模型评测,揭示模型真实水平,还将举办人机协作编程竞赛。

机器之心
7

模型如何赋能 Web 渗透测试?

文章指出传统Web安全检测有局限,而大语言模型(LLM)可提升漏洞发现覆盖率与准确性。以mcp server为基础介绍自动化漏洞检测方案,还分享实践操作、遇到的问题及解决办法,分析其优缺点并给出拓展思路。

阿里云开发者
产品应用7

安全垂类小模型效果能超过大模型?看看以色列Novee的效果

跟踪AI渗透测试等开源应用发现,通用大模型成本高、功能受限。以色列Novee融资5150万美元并发布4B小模型,测试效果超Claude 4 Sonnet。其靠两阶段训练和浏览器反馈提升能力,有投资说明有价值。

AI与安全
算法论文8

沉默的进化:LatentMAS 如何通过“潜意识通信”重塑多智能体协作?

这是对多智能体协作领域突破性研究的深度解读。论文提出LatentMAS框架,让智能体直接交换“思维向量”,实现“机器心灵感应”,在性能、速度和Token消耗上全方位碾压传统文本交互模式。

深度学习自然语言处理
算法论文8

模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!

随着大语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力。

深度学习自然语言处理
新闻资讯8

首个转型AI公司的新势力,在全球AI顶会展示下一代自动驾驶模型

上周,小鹏 G7 亮相,首发自研芯片与 VLA - OL、VLM 模型。同时,小鹏在 CVPR 2025 分享研发进展。其世界基座模型展现高智能,还将结合世界模型迭代。此外,小鹏验证 Scaling Laws,转型 AI 公司,全链路优化技术。

机器之心