「多AI Agent」共找到 12362 篇相关文章
含全文!OpenAI发布GPT-5官方Prompt指南
OpenAI 发布《GPT-5 prompting guide》,介绍新模型变化及使用方法。新增 `reasoning_effort` 和 `verbosity` 参数,还有 Responses API。Cursor 分享实战心得,同时提及控制 Agent 积极性、解决指令冲突等内容。
21 页 PDF 实锤 Grok 3“套壳”Claude?Grok 3 玩自曝,xAI工程师被喷无能!
网友 GpsTracker 爆料,xAI 公司的 Grok 3 在“思考模式”下自称是 Anthropic 公司的 Claude 3.5。多种模式测试显示异常回应仅在“思考模式”触发,21 页 PDF 记录也证实其“自曝”。此事引发热议,有人吐槽预训练团队水平差。
开源多模态推理「破壁」时刻:MMFineReason助力4B逆袭30B
长期以来,开源多模态模型在复杂推理任务上与顶尖闭源模型有差距,核心痛点是高质量推理数据匮乏。上海AI实验室OpenDataLab团队开源MMFineReason框架及大规模数据集,小模型凭此实现性能逆袭。
V4或Code要来?刚刚,DeepSeek-V3.1-Terminus发布!
DeepSeek线上模型升级为DeepSeek-V3.1-Terminus,单从名字看像是V3终极版,或在筹备V4及Code模型。deepseek - chat和deepseek - reasoner完成升级,此次更新改进语言一致性,优化Agent能力。
Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理
本文介绍发表于Nature Machine Intelligence的最新研究,系统探究语言模型与人脑推理表征的对应关系,验证人脑信号可引导提升语言模型推理鲁棒性,为脑启发AI提供了新研究路径。
MiniMax M3 实测:第一流的模型,已经对执行层动手了
文章对 MiniMax M3 模型进行多维度实测。它强化 Coding 与 Agent 能力,能完成长任务,与 Sonnet 4.6 竞技各有优势,多模态能力强,价格有竞争力,MiniMax Code 意在争夺开发者工作流入口。
世界模型来了因果技术标杆!具身大脑真要长脑子了
具身智能有泛化能力瓶颈,构建‘世界模型’成热门赛道。Aether AI获2000万美元种子轮融资,走因果世界模型路线,创始人黄碧薇认为这是世界模型‘终局形态’,能让机器人理解物理规律。
DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测
文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。
The Batch: 940 |Claude Mythos Preview 引发安全担忧
Anthropic为即将推出的Claude Mythos Preview采取特别预备措施,因其会带来网络安全风险。该模型能力强大,能发现众多代码漏洞。Anthropic组建联盟增强防御,其表现也优于多个知名模型。
谷歌430万颗TPU暴击CUDA护城河!Meta「割肉」助攻
Global Semi Research研究显示,2026年谷歌TPU总产能将达430万颗,主要因Meta释放CoWoS产能及台积电扩充产能。这显示谷歌欲降低成本、挑战英伟达,也预示AI巨头重塑算力格局。