「准确率提升」共找到 3126 篇相关文章
ICML 2026 | 只用少量Thinking Tokens,大模型依然能深度思考
近年来,CoT 推理成为提升大模型复杂问题求解能力的重要路径,但带来效率问题。浙江大学等团队提出 Heima 框架,将冗长 CoT 压缩为少量 thinking tokens,在减少 token 数的同时保留推理能力,已被 ICML 2026 接收。
GPT-5.6曝光了!OpenAI砸钱宣战:换掉Claude Code
GPT-5.5发布三周,GPT-5.6曝光且进入开发全速阶段,预计下月亮相。OpenAI本周四将上线「ultrafast模式」,速度提升2 - 3倍。Codex与Claude Code全面开战,OpenAI砸钱吸引开发者,AI自我加速与商业化形成正反馈。
Claude Opus 4.7 配 Lovart:全套品牌设计只需点击 2 次,设计师可能不太需要了
Anthropic发布Claude Opus 4.7,作者用其搭配Lovart为公益项目「国宝回家」做品牌设计。Lovart上线新功能打通设计链路,Opus 4.7感知能力提升。二者配合完成海报、字体、视频等,虽有细节待完善,但已跑通工程化链路。
港大×复旦×上交:视触觉融合+闭环纠错,让机器人双臂协作不再「盲操」
港大联合复旦、上交大提出TAMEn,在UMI框架上全方位升级,构建视触感知融合等数据闭环,打通数据采集到再训练链路。其三层闭环让机器人学得更快准高效,在双臂协作任务中提升成功率。
BeyondSWE:AI编程80分是真的强,还是考卷太简单?
前沿模型在SWE - bench Verified测试中得分超80%,但该测试像开卷填空。中国人民大学提出BeyondSWE重新设计评测,规模是前者18倍,模型得分全跌破45%。还提出SearchSWE框架,结果显示搜索与编码能力融合待提升。
3年、1万人,快手技术团队首次系统披露AI研发范式升级历程
快手首次系统性披露自2023年以来的AI研发范式升级历程。其研发效能演进分三阶段,从平台化到智能化,虽遇个人提效难传导至组织提效的问题,最终仍找到提升需求端到端交付效率的路径。
预算有限、技术空白:最刁钻的AI用户,是中小企业老板
2026年大模型在中小企业办公环境中应用不佳,工具与场景脱节。华为云推出专为中小企业的Flexus AI智能体平台,它依托自研模型,在多场景准确率领先,已在多行业验证效果,还能辅助内容创作。
Node.js之父宣判“手写代码时代结束”!DHH明确反对“结束论”:大模型还差口气,手写更有竞争力
Node.js之父Ryan Dahl宣称人类写代码时代结束,而Ruby on Rails作者DHH反对,认为大模型还差口气,手写代码仍有竞争力。DHH分享AI使用体验,指出距AI带来明显优势的拐点还差一点,还探讨互联网和产品发布等问题。
数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手
文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。
基于AI大模型的故障诊断与根因分析落地实现
文章围绕基于AI大模型的故障诊断与根因分析展开,介绍项目背景、目标与原理,阐述要解决的运维痛点及技术架构、知识库构建,还提及ReAct模式实现、Dify工作流及ClaudeCode对比,目前根因定位成功率有所提升。