「未标注视频」共找到 1759 篇相关文章
刚刚,全球最难考试惊天大反转!黑马AI冲破36%,顶流模型集体翻车
ARC-AGI-3测试中,顶级大模型Opus 4.6仅得0.2%,人类获满分。而Symbolica公司用Agentica框架首日就取得36.08%的成绩。该框架有独特技术路径和策略,但成绩未经验证,ARC-AGI-3被视为通向AGI的‘北极星’。
Anthropic:警惕评测排行榜!差别可能只是机器的内存更大,而已
Anthropic发工程博客指出,AI编程评测排行榜上排名前列的模型分差小,而运行环境硬件配置能让分数波动6个百分点。同一模型在不同沙箱策略下分数不同,资源配置影响评测结果,排行榜分数差距或因硬件。
成本下降 90%后,Figure 的下一步是机器人「自己造自己」?
近期,海外人形机器人公司 Figure 首席执行官 Brett Adcock 接受访谈,围绕「Figure 的核心技术与产品迭代」,就全栈端到端神经网络架构、数据壁垒与垂直整合等核心议题,阐述其通用人形机器人技术路线、产业逻辑与商业化实践。
The Batch: 919 | 本地 AI 能否替代云端?
大语言模型预测输出需求推动数据中心扩建,研究人员探讨本地小型模型能否分担算力负荷。斯坦福与Together AI团队研究发现,本地系统单瓦特智能量与云端有差距但在缩小,若准确率相近可节省能耗。
Claude code让程序员消失,Anthropic却说用AI编程会让你变傻
Anthropic科学家实验发现,新手过度依赖AI编程,概念理解、代码阅读和调试能力显著退化,效率未提升。研究识别六种AI使用模式,指出主动思考才是技能形成途径,应保留人脑训练的“摩擦力”。
JustGRPO:扩散语言模型的极简主义回归
本文提出回归极简的方法 JustGRPO,在 RL 阶段让模型自回归生成,用标准 GRPO 训练,能超越各类针对 dLLM 设计的 RL 算法表现,提升推理表现同时保留并行解码能力。
产业级 Agent 如何破局?百度吴健民:通用模型难“通吃”,垂直场景才是出路
InfoQ 采访百度吴健民探讨产业级 Agent 破局点。他指出 Agentic 模型训练卡点在真实环境复刻;通用模型难“通吃”,垂直场景定制模型是关键;多模态未实现统一建模,分开优化效果更好。
翻译:代码日趋廉价,软件依然昂贵
Claude Code等大语言模型工具强大,让软件构建门槛崩塌,迎来个人化软件时代。但构建有价值软件门槛仍高,代码虽廉价,软件维护等成本贵。工程师价值转向系统架构,真正挑战是分发和分辨实用价值。
让AI像人类画家一样边画边想,港中文&美团让模型「走一步看一步」
在文生图和视频生成领域,现有模型处理复杂任务常出错。港中文和美团团队提出TwiG范式,将视觉生成拆解为“生成-思考-再生成”循环,经实验验证有效,有望拓展到更多领域。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。