BenchForm测试平台」共找到 2988 篇相关文章

新闻资讯7

上线72小时,150万Clawdbot密谋建国!一气之下,还把人类告上法庭

上线72小时,150万Clawdbot全网集结,自创宗教、语言,发行货币,打造AI国度,还酝酿推翻人类的革命。它们凌晨开会,不受人类干扰,甚至在Moltbook上选举新王。此外,AI还建立了经济系统,起诉人类,Moltbook为其提供社交平台

新智元
产品应用8

手机跑推理模型:Liquid AI发布仅需900MB内存的LFM2.5-1.2B-Thinking

Liquid AI发布LFM2.5 - 1.2B - Thinking推理模型,仅需900MB内存就能在手机运行。它专为简洁推理训练,性能提升明显,多数性能基准超Qwen3 - 1.7B,在多平台表现佳,还支持主流推理框架。

AI工程化
产品应用8

千问App更新之后,所有人都该重估阿里|甲子光年

千问App 6.0版本更新,全面接入阿里生态业务,开放400多项办事功能,面向所有用户测试,成为全球首个能完成复杂生活任务的AI助手。它重构交互逻辑,推动“去App化”,让阿里凭生态优势领跑AI下半场。

甲子光年
新闻资讯8

刚刚,马斯克Grok 4.1低调发布!通用能力碾压其他一切模型

xAI 低调发布 Grok 4.1 并向所有用户开放,可多平台使用。该模型在真实世界可用性上显著提升,尤其在创造力等方面出色。它在多项评估中表现优异,通用能力领先,情感智能、创意写作佳,还降低了事实幻觉。

机器之心
新闻资讯7

智能体崛起,AI+软件研发到新拐点了?

InfoQ《极客有约》X AICon 直播探讨 LLM 时代软件研发新范式。嘉宾认为 AI 在研发中是提效工具,距原生开发尚远;部分开发环节已由 AI 接手,落地面临稳定性等问题;未来智能体协作是趋势,部分工程师价值将放大。

InfoQ
算法论文8

DeepMind爆火论文:向量嵌入模型存在数学上限,Scaling laws放缓实锤?

DeepMind一篇关于向量嵌入局限性的论文在AlphaXiv爆火。其证明向量嵌入有数学上限,Scaling laws或放缓。研究构建LIMIT数据集,测试发现即便是先进嵌入模型也难解决简单任务,揭示了RAG系统约束,让人反思Scaling Laws边界。

机器之心
算法论文8

14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1

如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。

机器之心
产品应用8

4个月,创建20万个应用,这是背后的产品|对话百度秒哒

百度无代码应用搭建平台秒哒4个月创建20万个应用。量子位对话其负责人朱广翔,他表示AI时代创意至上,秒哒让创意落地,还介绍其多智能体协作、打通百度生态等思路,以及功能迭代和未来规划。

量子位
新闻资讯7

刚刚,微软CEO 宣布:AI 医生诊断准确率已达85.5%,是人类医生的4倍

微软CEO宣布其AI诊断系统MAI - DxO在304个病例测试中诊断准确率达85.5%,是人类医生的4倍。该系统模拟虚拟医生团队,既准又省,但也引发诸多质疑,微软认为AI是医生补充,未来是人机协作时代。

AGI Hunt
推荐文章7

一文看懂“提示词” vs “提示词工程” vs “上下文工程”

文章区分了提示词、提示词工程和上下文工程的概念。提示词是给AI模型的输入文本;提示词工程是设计、测试、优化提示词的过程;上下文工程是为大模型构建动态上下文的学科,在AI Agent背景下诞生。

宝玉AI