「循环类型」共找到 300 篇相关文章
3B模型性能小钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学
上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。
谁不想要一条会飞的鱼呢?他们造了个会捣蛋的机器人,拿下了最佳论文奖
庆应义塾大学徐铭阳和香港城市大学李彦衡发表论文Floating Companion,获ACM DIS 2026最佳论文奖。他们研究软体浮空机器人,探讨其与人的关系、交互可能,虽面临浮力 - 质量循环等挑战,但对其未来充满期待。
13小时不眠不休,300个分身狂敲代码!开源第一易主了
4月20日深夜,Kimi K2.6出道即开源,展示了强大的「全栈交付」能力,跑分超GPT - 5.4等。它能完成多类型官网制作,300个Agent协作能力强,还能复刻高盛研报、交付三件套,其Claw群组开启小范围测试。
小白必读:到底什么是FP32、FP16、INT8?
文章介绍FP32、FP16、INT8等数字存储格式类型。指出它们是评估算力前提,不同格式在精度、范围、内存占用和计算速度上有差异,还提及多精度与混合精度计算,以及不同硬件对格式的支持情况。
如何通俗的读懂算力?
文章以拼图比赛作比,介绍了通用、科学、智能、AI专用这四种算力类型及其作用,指出摩尔定律失效下工程师探索创新提升算力。还阐述算力生态各环节,最后点明未来AI成算力市场核心引擎,中国算力发展亮眼。
多模态长文本理解测评首发:46款模型无一攻克128K难关
香港科大等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5大类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。
Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
Claude Code 新功能 Agent Teams:4 类活效率翻倍,4 类活纯烧 token
Claude Code v2.1.32 后新增实验性功能 Agent Teams,可将其从单个 AI 助手升级为 AI 团队,但会使 token 用量线性放大。文章总结了适合和不适合用此功能的任务类型,还给出决策清单、实战避坑建议。
震撼!0人类,16个Claude全自主开发,2万美元十万行代码成功运行Linux
Anthropic研究员用Claude Opus 4.6智能体团队自主编写超十万行代码的C语言编译器,能运行《毁灭战士》、编译Linux内核。团队用拉夫循环等机制让Claude自主开发,虽有局限但全自动软件开发时代已提前降临。
Google 发布 142 页年度DORA 报告:90% 开发者每天花 2 小时使用AI,比去年增长14%
Google发布142页年度DORA报告,显示90%开发者每天花2小时用AI,比去年增14%。开发者对AI代码信任谨慎,看法分化,速度提升比质量改善明显。报告还分析团队类型、采用时间等,指出技术限制和就业现状。