「重排序器」共找到 1246 篇相关文章
2026 初的大模型,离电影 Her 还有多远?
作者重看电影《Her》后,对比 2026 年初现实 AI 与电影中萨曼莎的能力,从七个维度分析差距。指出功能性上已接近,但存在性层面差距大,还探讨了 AI 发展趋势与存在意义。
Science重磅:AI编程新手与资深开发者之间的差距巨大
《科学》杂志发表的AI编程全球调查研究显示,美国程序员提交的Python代码中29%由AI代笔,资深开发者借此拉大与新手差距。研究团队用GraphCodeBert模型分类器扫描代码,揭示技术扩散差异与隐忧。
Anthropic 再发长文:首次详细揭秘Agent的评估全过程「Claude code开发过程的经验总结」
Anthropic在Claude Code等开发及与客户合作中总结出AI Agent评估方法。文章介绍评估基本结构、构建原因、评分器类型、不同Agent评估法、应对不确定性指标、构建路线图及与其他方法协同方式。
SOP:具身智能在线进化新范式,为大规模真实世界部署而生
智元机器人具身研究中心提出SOP在线后训练系统,将VLA后训练重构为“在线、集群、并行”,可即插即用后训练算法。它有高效探索、缓解偏移等优势,实验显示能提升性能、效率,突破VLA瓶颈。
中美算力,站在2000亿美元的分岔路口
高盛报告称2025年全球人工智能投资规模或接近2000亿美元。中美算力发展站在分岔路,中国追性能,美国被能源限制。全球算力市场有新变化,中国本土芯片崛起,各方也在热议AI是否有泡沫。
NeurIPS 2025 | 告别全量扫描!浙大提出COIDO:破解多模态数据选择「高耗」难题
浙大提出 COIDO 框架解决多模态数据选择「高耗」难题。它摒弃全量扫描,用轻量级评分器和小样本采样,将重要性和多样性的优化统一。实验显示,它性能与效率双优且有强泛化性。
Vibe Coding 产品最大的错觉,是以为自己真的有护城河
Base44创始人Maor Shlomo认为Vibe Coding工具易被复制,技术护城河难寻。他指出真正的护城河是“垂直整合”,构建全栈平台很关键。还谈到市场竞争、软件发展趋势、公司策略等多方面内容。
1分钟跑出数百预测!WeatherNext 2把短时预报带入小时级
谷歌DeepMind发布WeatherNext 2,能1分钟从同一初始场生成上百种未来,分辨率达1小时级,超上一代。它已接入Search等,重写天气预报逻辑,让预测从确定变多可能,还将改变气象体系。
大厂CIO独家分享:AI如何重塑开发者未来十年
阿里云智能集团副总裁、CIO 蒋林泉分享 AI 时代开发者竞争力构建。探讨技术贡献衡量、全栈工程师发展、产研与业务提效顺序、知识协作及大厂招人要求等,指出 AI 助发现并解决软件工程问题。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
当谷歌Gemini 3将上线消息传得沸沸扬扬时,马斯克xAI更快一步上线最新大模型Grok 4.1,响应速率提升、幻觉率下降。它有两个“形态”,免费开放且有APP版。在LMArena测试中成绩亮眼,多方面能力提升。