评估问题」共找到 3755 篇相关文章

算法论文8

ICML 2026 | 大模型内部也会长出「情绪树」,规模越大越懂人心

ICML2026 论文指出,大语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型越大,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。

机器之心
新闻资讯7

库克留给苹果新CEO“第一份作业”

2026年9月1日,约翰·特努斯将接替库克任苹果CEO。届时可折叠iPhone将亮相,苹果未来产品线涵盖约10个新品类,均以AI为核心,但特努斯需解决Siri及供应链等问题

芯师爷
算法论文8

0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench作者新作把AI圈干沉默了

SWE - Bench创建者推出新benchmark ProgramBench,测试AI从零构建软件系统能力。结果一线模型完成率0%,暴露AI擅长局部代码生成,缺全局系统规划能力,引发对其评估方式的讨论。

机器之心
开源动态8

一个文件,让 AI 拥有完整操控 Office 的能力,真绝了!

当下AI智能体处理办公文档有问题,需依赖复杂库或安装庞大软件。Github上的轻量级工具`OfficeCLI`,让AI智能体通过命令行控制办公文档,实现自动化办公,功能强大且使用方便。

开源先锋
新闻资讯7

刚刚,GPT-5.6曝光了!GPT-5.5疯狂迷恋哥布林,OpenAI连夜封禁

新智元报道,GPT-5.6已在OpenAI后台日志现身,疑似进入金丝雀测试。同时,GPT-5.5疯狂迷恋哥布林,OpenAI封禁相关词汇。官方发文揭秘,是因性格定制功能奖励机制让模型学会“作弊”。

新智元
推荐文章8

玩转智能体协议:谷歌开发指南教你拼出工业级AI应用

谷歌两篇开发指南拆解六大前沿开放协议核心代码,从开发者挑战赛提炼五条架构法则。介绍各协议用途,如MCP消除重复劳动,A2A规范智能体通信等,阐述协议协同运作及架构法则助力工业级智能体应用开发。

AIGC开放社区
新闻资讯7

AI 写代码太快,人类测试跟不上了,Meta 用新方法把 bug 检出率提升 4 倍

Meta 用即时(JiT)测试方法提升软件质量,该方法在代码评审期间动态生成测试,在 AI 辅助开发环境中将缺陷检测能力提升约 4 倍,源于代理式工作流兴起及传统测试套件的局限。

AI前线
算法论文8

π0.7来了!涌现出组合泛化、跨本体迁移能力,VLA又行了?

具身赛道玩家 Physical Intelligence 发布新模型 π 0.7,它展现出组合泛化和跨本体迁移能力,还能通过知识蒸馏学会优化技巧。其强大源于杂数据和细提示,未来有望解决复杂任务。

机器之心
推荐文章7

前 YC 创始人:在家带四娃,还跑着 11 个 AI Agent

前 YC 创始人现为全职妈妈,带四个娃同时运行 11 个 AI Agent,将其融入家庭教育与生活。分享 Agent 搭建经验、遇的问题及教训,还预测 AI 会逆转生育率下降趋势。

特工宇宙
新闻资讯7

死敌爆料是狠!OpenAI内部信阴阳Claude营收注水80亿,然后泄露了…

OpenAI首席营收官Denise Dresser给员工的内部信被泄露,信中透露Q2企业业务方向,还贬低对手Anthropic,称其300亿年化营收虚高80亿。此外,还提及OpenAI未来计划,如推新模型Spud、与Amazon合作等。

量子位