「测试范式」共找到 2602 篇相关文章
北航领衔发布300页代码智能综述:从基础模型到智能体,一次读懂Code LLM全景图
北航领衔联合近30家机构撰写《From Code Foundation Models to Agents and Applications》,系统梳理代码智能领域,串联模型、任务等成完整技术链路,还通过实验等给出实践指南。
五源袁野:理解AI创业的五个视角 |5Y View
文章是五源合伙人袁野在五源2025创始人年会演讲,从五视角审视AI时代创业变化,如技术范式切换、供给边界演进等,为理解AI创业带来启发,强调创新要敢于走新路。
豆包也开始抢程序员饭碗了,首个编程模型来了!
字节给豆包升级编程能力,推出首款编程模型Doubao - Seed - Code。它刷新国内编程模型上下文长度,支持视觉理解,API价格良心。经测试,虽未达全球顶尖,但弥补国产编程模型短板。
用更一致的轨迹、更少的解码步数「驯服」掩码扩散语言模型,扩散语言模型的推理性能和效率大幅提升
扩散大语言模型发展迅猛,或成下一代大语言模型基础范式有力竞争者。复旦大学等团队发布论文,提出高效解码策略与强化学习训练组合,解决MDLM解码和训练问题,提升推理性能与效率。
英伟达发射了首个太空AI服务器,H100已上天
11月2日,英伟达首次将H100 GPU送入太空,搭载于Starcloud-1卫星测试AI处理应用。太空数据中心能源成本低、不占土地、少排温室气体,Starcloud计划未来大规模部署,还筹划后续任务。
AI版盗梦空间?Claude竟能察觉到自己被注入概念了
Anthropic最新研究发现LLM有内省迹象,Claude能察觉概念注入。研究用概念注入测试,虽模型内省能力有限且不可靠,但能力强的Claude Opus 4和4.1表现好,未来内省或更复杂。
英伟达Thor芯片屡屡延期:车企被迫转身,供应链迎来机遇
英伟达原计划的Thor芯片因架构和设计缺陷多次跳票,性能大幅缩水至约700TOPS,打乱国产车企规划,小鹏、理想等厂商回调旧方案或加速自研。同时,也为国产芯片企业带来机遇,推动市场走向多元竞争。
清华姚班团队,开源具身智能视觉语言动作(VLA)模型工具箱,打造行业通用技术底座
清华姚班团队所在的原力灵机公司,开源了基于PyTorch的视觉语言动作(VLA)模型工具箱Dexbotic。它能打造通用底座,解决行业研发困境,其预训练模型表现出色,还与Hugging Face合作推出评测平台。
Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识
Meta推出「自由Transformer」新模型,打破自2017年以来GPT模型核心规则,在解码器引入潜在随机变量Z,增加“潜意识”。仅增约3%计算开销,在多测试中超越大规模模型,或开启后自回归时代。
刚刚,Anthropic 发布 Claude for Life Sciences,目标生物科研全流程
Anthropic推出Claude for Life Sciences,全方位布局生命科学领域。它配备Skills功能,生物学测试表现提升,能解读图像、分析数据。还深度整合科研生态,应用场景广,获众多药企、学术机构青睐,还有AI for Science计划。