「高可用机制」共找到 2818 篇相关文章
不止修bug:Agentic Coding评测走向复杂feature交付新阶段
中国科学院自动化研究所联合华为提出 FeatureBench,构建端到端基础设施并开源。它从单元测试出发构造评测任务,引入多种机制保障任务可执行、可验证,能有效区分模型能力,还提供易用的评测流程。
走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则
文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。
视觉强≠能干活!清北普林斯顿等开源WorldArena,世界模型评测被颠覆
2026 年 2 月 13 日,清华、北大等顶尖机构联合推出的 WorldArena 面向全球开源。这是首个‘功能 + 视觉’统一评测体系,撕开了‘美丽视频’伪装,让评测从‘审美导向’走向‘功能导向’。
我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准
在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。
Anthropic员工效率碾压谷歌1000倍!打工人想进,必须先「杀死自我」
新智元报道,一位硅谷老兵与Anthropic近40人深聊后揭示其成功公式,即工作量碾压人数能带来创新井喷。Anthropic无部门壁垒,产品10天可从想法到上线,员工效率远超谷歌,2026年或击垮大量企业。
Clawdbot 之后,我们离能规模化落地的 Agent 还差什么?
OpenClaw爆火,但在企业和商业环境中存在昂贵、不可控等问题。Monolith砺思资本技术沙龙探讨Agent规模化落地难题,指出需关注稳定性等指标,还分析了数据成本、训练速度、基础设施、状态管理等方面的困境与解决思路。
我如何用 Codex 在 5 天内"找回"丢失的源代码
作者早年写的 Electron 画图程序源码丢失,只剩编译版本。受 OpenAI 博客启发,用 Codex 逆向还原,5 天得到能运行的 TypeScript 代码。过程中解决了 Codex 删减内容、上下文有限等问题,还分享了经验。
「熟悉的陌生人」才是「好老师」?复旦提出简单指标,找出推理蒸馏中真正有教学价值的数据
复旦大学和上海人工智能实验室研究者提出 Rank - Surprisal Ratio (RSR) 度量方法,综合考虑样本信息量与对齐程度,在蒸馏实验中与学生模型后训练性能相关性高,可用于筛选推理轨迹和选择教师模型。
硅谷真实「无间道」!OpenAI前CTO怒斩泄密联创,奥特曼打包收了
硅谷AI圈上演“无间道”,Thinking Machines Lab掌门人Mira Murati开除被指泄密的CTO Barret Zoph,OpenAI迅速接人。这重创了TML,Mira宣布“PyTorch之父”Soumith Chintala出任新CTO。
通用级PixVerse P1的技术突破,揣着进入平行世界的密码
PixVerse R1 突然上线,带来「即时响应、即看即创」新体验。它是全球首个支持最高 1080P 分辨率通用实时世界模型,实现从「静态输出」到「实时交互」跨越,本文将解析其技术突破。