「指令遵循率」共找到 612 篇相关文章
打破 AI 辅助开发碎片化困境,阿里巴巴 R2C Agent 的 AI 编程实践
文章围绕阿里巴巴 R2C Agent 的 AI 编程实践展开。指出当前 AI 辅助开发存在与生产链路结合难、协作碎片化等问题,介绍了 R2C Agent 如何驱动研发链路,阐述其框架、实施情况及未来提升 AI 渗透率的目标。
「注意力经济」下,AI 生活助手能否解锁生服「新」刚需?
今年不少国内大厂加码AI生活助手赛道。腾讯、阿里、美团、京东、滴滴等各有动作,如腾讯在微信上线「元宝」,阿里在电商业务开发助手。当前AI应用使用时长和留存率不佳,而助手或能过滤信息、缩短决策链路。
【一手实测】字节豆包 1.6 + Trae + 火山 MCP + FaaS:AI Agent 开发部署全流程体验!
本文作者实测字节豆包1.6系列模型,用其设计落地页,还借助Trae、火山方舟MCP等实现AI Agent开发部署全流程。测评显示豆包1.6多模态能力强,处理复杂指令效果好,价格实惠,字节AI云原生生态前景佳。
ICML 2026前瞻:投稿翻倍背后,机器学习正在换挡
第43届国际机器学习大会(ICML 2026)7月6 - 11日将在韩国首尔举行,主题为‘Machine Learning for the Real World’。今年投稿量翻倍,接收率26.6%,还做了两项制度调整。论文反映出LLM推理、AI安全、模型压缩等趋势,中国研究者表现亮眼。
谷歌IMO金牌级Gemini 3深夜上线!华人大神挂帅,OpenAI无力反击
谷歌DeepMind推出IMO最强金牌模型Gemini 3 Deep Think,以2.5倍暴力性能碾压GPT - 5.1。它在多项基准测试表现出色,已在Gemini App上线。谷歌还将在新加坡组精英团队,由华人科学家Yi Tay率队。此外,Gemini 3 Pro使网页端市占率创新高。
GPT‑5深夜发布:模型之战结束,Agent之战开始!
昨晚,炒作一月的GPT - 5正式发布,标志原生Agent时代到来。体验显示其压低幻觉、提升指令遵循与推理能力。文中还对比了GPT - 5、Gemini、Claude等模型在不同场景表现,指出御三家路线分化及三条反常识判断。
Claude团队用Qwen测试全新训练方法
Anthropic最新研究提出中训练(MSM),在预训练后、后训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。
第一章:AI 技术前沿全景
文章聚焦AI Agent技术前沿,阐述大语言模型三次能力跃迁,从涌现能力到对齐指令遵循,再到推理与行动。还提及Scaling Law变化,推理时计算扩展更划算,介绍代表性推理方案及多模态融合,指出Agent打破传统对话AI局限。
存储芯片领域又冲出一家IPO!年入37亿
AI驱动存储“超级周期”,行业巨头提价,国内存储芯片公司股价上涨。深圳晶存科技9月底递表港交所,此前募资超7.06亿,2024年末投后估值37亿。虽净利润为正,但经营现金流持续为负,全球嵌入式存储市场市占率约1.6%。
一个Dispatch Dtype引起的fp8 quant kernel性能问题
文章记录SGLang社区在sgl-kernel中解决的fp8 quant kernel性能问题,因错误使用`c10::Float8_e4m3fn`数据类型,未用硬件加速指令,通过软件调用致性能下降,现已修复,vLLM也应用此修复。