测试框架」共找到 3128 篇相关文章

算法论文7

Theory of Agent:构造知行合一的智能体

当前AI(如ChatGPT)存在行为随机性、效率黑洞等问题,论文指出AI缺乏认知地基,需明确认知框架。还提出革命性等式“推理 = 行动”,分析了知识与决策边界,给出最优行为四象限,介绍落地路径和未来发展方向。

深度学习自然语言处理
开源动态8

大模型结构化推理优势难复制到垂直领域!最新法律AI评估标准来了,抱抱脸评测集趋势第一

多个机构研究人员联合发布全新多语言法律推理基准数据集LEXam,它含4886道题,每道长篇题有答案和推理路径。研究显示现有大模型应对法律推理难,LEXam引入评估新模式,还对不同模型做了测试

量子位
产品应用8

Skywork AI | 发布Super Agent,一站式搞定写作、开发、分析与创意内容生成

去年谷歌定义了Agent,如今随着大模型发展其能力升级。Skywork AI推出Super Agent平台,有5个专家AI agent和1个通用AI agent,能生成多类型内容且支持溯源。它突破行业瓶颈,还开源相关框架和MCP。

AINLPer
算法论文8

字节最新大模型秘籍:只挑能有推理潜力的数据训练!1.3B模型无需标签自动挑选

字节Seed团队发布AttentionInfluence成果,用1.3B模型给7B模型选数据,无需训练和标签。通过比较基础与弱化模型损失差异评估数据影响,在多基准测试提升模型性能,还能结合分类器全面提升表现。

量子位
新闻资讯7

给龙虾定MBTI、发工牌,还让龙虾偷技能…打工人得适应新环境了

AI圈掀起“养龙虾”热潮,智谱、腾讯纷纷发布相关产品。极客和开发者对龙虾进行实测,它不仅能用于打造赛博宠物、线上办公室,还能完成视频剪辑、教辅、营销等工作。同时,Agent框架让大模型进入业务线,飞书成合适的工作台。

量子位
新闻资讯7

6分钟狂掉750亿市值!苹果发布会发啥了…

苹果发布会开场6分钟市值缩水750亿美元,因Siri更新推迟。此次发布有新设计、AI更新等,但用户和投资者不满。苹果虽有AI动作,如集成ChatGPT、推新框架等,但战略难有重大突破,已考虑与第三方合作。

量子位
开源动态7

一键式训练端到端Agent,Qwen3+MCP工具集高效集成!

RLFactory是开源的端到端RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。

GiantPandaLLM
新闻资讯8

刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代

OpenAI官宣下一代旗舰模型GPT - 6 Astra,定义其为「世界上最智能、对齐程度最高」的模型。它多项基准测试成绩惊人,在编程、计算机使用等多领域表现卓越,还改写科研纪录,不过因安全能力强暂未全开放。

新智元
算法论文8

流式意图检测+永久记忆,NUS&NTU发布Pask:把贾维斯AI拉进现实

南洋理工大学谢之非团队提出Pask,采用「底层小模型流式意图检测」+「上层Agents执行」架构,实现实时、有深度、基于个人全局记忆自进化的主动智能体。它包含需求检测、长期记忆和主动系统模块,经测试效果良好。

新智元
新闻资讯7

OpenAI新模型Day0就被嫌弃!排名拉垮,不如一月底发布的国产模型

OpenAI推出GPT - 5.4 mini和nano模型,主打快速经济,针对编程等优化。但评测中GPT - 5.4 mini排名不佳,不如国产Kimi 2.5,且价格对比有争议。不过与自家旧版比有提升,网友测试有亮点。

量子位