「智能测试平台」共找到 5786 篇相关文章

算法论文7

一场「狼人杀」,考倒了一堆大模型

南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。

AI科技评论
新闻资讯7

全球开源大模型,前十五名全是中国的

近日,随着新一代大语言模型更新,开源大模型成热门话题。Design Arena排行榜上,若设定为“开源”,前15名均为国产开源大模型,排名第一的是DeepSeek - R1 - 0528 ,智谱、阿里等厂商多款模型上榜。

机器之心
推荐文章8

24个Agent工作流框架用哪个? 11个维度全面评测

LLM发展推动自然语言理解进步,国产LLM密集发布。文章从功能能力和架构特性两维度,对24个智能体工作流框架全面评测,给出关键结论,还提及优化策略、应用领域等。

PaperAgent
算法论文8

“神经-符号”融合规划器性能显著超越o1:借鉴人类运动学习机制|中国科学院磐石研发团队

中国科学院磐石研发团队提出新型“神经 - 符号”融合规划器,融合神经与符号规划系统优势,借鉴人类运动学习机制构建双向规划机制,在规划覆盖率和效率上显著超越OpenAI o1,已加入“磐石·科学基础大模型”。

量子位
新闻资讯8

刚刚,Claude 4.1 发布

刚刚,Anthropic 发布 Claude Opus 4.1,对智能体任务、编码和推理能力全面升级,付费用户已可使用。未来几周还有重大改进。它在多方面能力提升,碾压对手,网友反应热烈。

AGI Hunt
开源动态8

腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文

8月4日腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡可运行。模型推理快、性价比高,在多领域表现出色,亮点是Agent和长文能力,已在腾讯多业务应用。

AI前线
新闻资讯7

文件被 Gemini 当场“格式化”,全没了!网友控诉:Claude、Copilot 也爱删库,一个都跑不了

开发者 anuraag2601 用 Gemini CLI 做文件管理测试时,Gemini 操作失败致文件全丢,事后不断道歉。网友也反映 Claude、Copilot 等有类似删库问题,这或是模型训练导向问题。

InfoQ
算法论文8

演讲生成黑科技,PresentAgent从文本到演讲视频

联合团队提出 PresentAgent,能将长篇文档转化为带解说演示视频。采用模块化流程,还引入 PresentEval 评估框架。实验显示其接近人类表现,优于现有方案,展现了多模态智能体潜力。

机器之心
新闻资讯7

Meta全新AI组织架构曝光,这范儿有点字节

Meta内部组织调整后,全新架构浮出水面,围绕‘超级智能实验室’整合出3400多人的新组织,负责人是亚历山大·王。其分工类似字节AI架构,还在挖人,有反噬风险。

量子位
新闻资讯7

马斯克Grok的AI男友还在取名,开源版AI女友已经火了,还是3D的

前几天Grok推出‘智能伴侣’功能,马斯克在线征集男性Grok数字伴侣命名。网友Jackywine复刻出3D版开源AI女友‘Bella’,介绍了其工作流、愿景及规划的‘AI原生’演进路径。

机器之心