「测试驱动」共找到 2261 篇相关文章
AI Coding 生死局:Spec 正在蚕食人类编码,Agent 造轮子拖垮效率,Token成本失控后上下文工程成胜负手
本文为《2025 年度盘点与趋势洞察》系列之一,聚焦 AI Coding 在程序员群体的演进与落地。探讨了 Spec 驱动开发、Agent 崛起、Token 成本等问题,指出上下文工程是 AI Coding 成败关键。
谷歌2025年终回顾:Gemini 3领衔,六大领域全线突破
本文回顾谷歌2025年发展,从Gemini 1.5 pro开始有变化,到Gemini 2.5 pro质变。谷歌在模型、产品、创意、科学等六大领域突破,如Gemini 3系列模型表现出色,但Sam Altman仍认为谷歌失败。
Gemini 3 Flash 发布,多、快、好、省,Coding 能力不输大哥Gemini 3 Pro
Google DeepMind 发布 Gemini 3 Flash,成本极低。它在多项测试表现出色,速度快、效率高,代码能力超 Gemini 3 Pro,获企业客户好评,今日起向全球开发者和普通用户推送。
全球功能最全的视频生成模型来了
阿里发布新一代通义万相2.6系列模型,是全球功能最全的视频生成模型,覆盖文生视频等多种模式。它在视频创作和文生图方面能力提升,虽有小瑕疵,但日常短视频和二创已可用。
AAAI 2026 Oral | 拒绝「一刀切」!AdaMCoT:让大模型学会「看题下菜碟」,动态选择最佳思考语言
多语言大模型面临语言选择难题,现有跨语言推理方法存在缺陷。新加坡研究团队推出AdaMCoT框架,通过自适应路由机制动态选语言推理,提升跨语言事实推理准确性与一致性,效果超越传统方法。
奥特曼恩师力挺19岁少年!比AlphaFold快4倍,只杀害虫不伤人
2024年,18岁的Tyler Rose和19岁的Navvye Anand创办Bindwell,将AI药物研发技术用于农业,构建基础模型,研发出比AlphaFold快4倍的模型。奥特曼恩师Paul Graham建议卖知识产权授权,公司获600万美金融资。
金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%
2025年6月以来多模态文档解析成前沿课题。MonkeyOCR v1.5是全新框架,在OmniDocBench v1.5等基准上全面突破,复杂表格等场景提升9.7%,采用两阶段解析管道和复杂表格处理方案。
短视频刷多了AI也会变蠢!“年度最令人不安的论文”
最新研究显示,大模型灌多垃圾内容会‘脑损伤’,研究人员用不同维度定义垃圾数据并训练模型,测试其核心能力,发现垃圾数据致认知下降,且损伤不可逆,还给出行业启发。
拜拜了GUI!中科院团队“LLM友好”计算机使用接口来了
中科院软件所团队研究指出,现有LLM智能体成功率低、效率差的瓶颈在于GUI。其设计与LLM能力错配,团队提出声明式接口GOI,实现策略 - 机制分离,经测试性能提升显著。
ACMMM 2025 | 北大团队提出 InteractMove:3D场景中人与可移动物体交互动作生成新框架
北大团队在ACMMM 2025发布InteractMove,首次提出含可移动物体3D场景中基于文本的人 - 物交互生成任务,构建数据集与创新框架,在多指标领先,代码与模型已开源。