「大模型测试」共找到 9855 篇相关文章
下一代AI需要「思想微积分」!华人团队重磅揭秘,AI方法论三连发
来自美国两所大学的华人团队发布「AI方法论三部曲」,提出「能力实现率(CRR)」模型、「认知几何学」框架,指出处于AI的「元语言时刻」,未来迈向「思想微积分」时代,从多维度构建理解AI的世界观。
10%训练数据超越100%表现,机器人学习领域迎来重要突破
密歇根大学和瑞典皇家理工学院团队提出 ViSA - Flow 框架,能从人类视频提取语义动作流,提升机器人数据稀缺时学习效率。在 CALVIN 测试中,用 10% 训练数据超越 100% 数据方法,有技术优势也存在局限。
「AI黑客」来袭,Agentic AI如何成为新守护者?
AI 发展带来网络安全新威胁,如生成式 AI 诈骗、深度伪造等。业内共识是以 AI 对抗 AI,有模型防护、行业应用、政府协作三类尝试。青藤云安全推出全栈式安全智能体「无相」,革新安全思维。
李飞飞做AI游戏,拿了4个亿
李飞飞联创的AI游戏公司Astrocade获5600万美元A+B轮融资。该平台让用户用自然语言描述就能生成游戏,上线8个月有2000万用户、月1.4亿次游玩。其用专门AI模型降低创作门槛,未来发展待察。
AI 驱动的多代理金融工作台
Vibe-Trading 是 AI 驱动的多代理金融工作台,能将自然语言请求转化为交易策略等。它有自然语言转策略、多数据源、专家团队等核心能力,具备面向交易的深度研究等功能,还介绍了安装方式、环境变量和推荐模型。
ICRA 2025 获奖名单出炉,卢策吾、邵林等人获分类最佳论文奖
2025年IEEE国际机器人与自动化大会(ICRA 2025)落幕,公布最佳论文等奖项。上海交大卢策吾团队获人机交互最佳论文奖,新加坡国大邵林团队获机器人操作与运动最佳论文奖,大会竞争激烈,共收3000余篇投稿。
AGI倒计时,OpenAI首席研究官重磅表态:留给人类的窗口「很小」
OpenAI首席研究官Mark Chen称AGI即将到来,模型能自主研究。他反对‘预训练已死’,认为Scaling曲线未到头。还提出‘Vibe Researcher’概念,不过通往AGI有评测和持续学习等问题待解决。
英伟达把8个AI和8台机器人关在一起,它们学会了自己做实验
英伟达高级研究科学家公布“ENPIRE”项目,8个AI与8台机器人组成科研团队,能自主做实验。研究测试三种coding agent,Codex表现最佳。系统分两阶段,虽有局限但有新发现。
揭秘与评测 30K+ Star 的 Graphify:企业存量系统 AI 编码的"第二大脑"。
文章揭秘评测 30K+ Star 的 Graphify,它能将分散材料转为结构化知识图谱,助 AI 编程助手理解代码。介绍其使用方法、原理,经测试它能提升综合质量、降低探索成本,不过并非万能解药。
天塌了,Pro用户用不了Claude Code,除非100美元买Max
Anthropic 悄悄修改价格页面,将 Claude Code 从 20 美元 Pro 套餐剔除,变为 100 美元 Max 套餐专属。开发者反应激烈,官方称是针对 2% 新用户的定价测试,OpenAI 借机拉踩,网友质疑,开发者开始物色下家。