「专家级表现」共找到 3397 篇相关文章
深度解析 Claude Code 在 Prompt / Context / Harness 的设计与实践
本文深度解析Claude Code在Prompt、Context、Harness三方面的设计与实践。介绍了Prompt动态组装过程,探讨CLAUDE.md项目说明、上下文压缩体系和记忆系统,还阐述了系统级提醒、多Agent及安全体系等内容,文末分享了项目有趣彩蛋。
刚刚,豆包编程模型来了,我们用四个关卡考了考它!
2025年AI编程助手分化为IDE增强和Agentic两条路线。当前Claude Pro有使用限制,火山引擎推出豆包编程模型Doubao-Seed-Code。它在多项评测表现优异,具备长上下文等能力,经四关测试实力强,价格也实惠,或成完美平替。
新天终启,万象智生!从AlphaGo到GPT-5,新智元十年见证ASI创世纪
2025年AI迈向ASI,新智元迎十周年,9月7日将在北京举办峰会。众多大咖齐聚,探讨芯片、大模型等前沿突破。今年大模型发布密集,如OpenAI、谷歌等有新成果,中国造大模型也表现出色,未来智能体等将爆发。
一年从3B卷到0.xB:MonkeyOCRv2用0.7B拿下17语种文档解析开源第一
文档OCR正迈入小模型时代,MonkeyOCRv2以0.7B、0.6B参数在MDPBench上超越3B模型。它重新分配系统职责,采用互补预训练目标,还开源训练数据,且迁移到多任务表现良好。
阿里Qwen 3.7 Max:35小时自主编程,Claude跟不上了?
阿里云峰会发布的Qwen 3.7 Max,在优化平头哥芯片推理内核任务中,35小时让推理速度快10倍。它在多基准表现出色,编程、推理、办公自动化全面开花,但闭源且实验室场景与现实有差距。
阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了
阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。
内存一年疯涨170%,云账单里的“隐性成本”该算清了
2025年下半年存储价格成焦点,DRAM合同价同比涨幅达171.8%,致企业IT采购成本上升。华为云更新Flexus云服务器系列,基于柔性算力技术,打破CPU与内存固定绑定,减少浪费,还引入应用级加速,提升性能。
夸克“搜聊一体”新模式,难掩中国版ChatGPT的野心
夸克“C计划”首个落地项目对话助手引发热议。体验发现,它能完成复杂问答,还可用于图文识别、AI写作等场景。在回答逻辑性、辅助学习、理解模糊问题等方面表现出色,背后是阿里闭源模型。
刚刚,OpenAI开源2个推理模型:笔记本/手机就能跑,性能接近o4-mini
OpenAI深夜开源gpt-oss-120b和gpt-oss-20b推理模型,距上次开源已6年。模型亮点多,性能强,在多方面表现超专有模型。官方还放实测视频,展示其使用效果,同时解释了开源原因。
3D VLA新范式!CVPR冠军方案BridgeVLA,真机性能提升32%
中科院自动化所提出BridgeVLA模型,将3D输入投影为2D图像并利用2D热图进行动作预测。它训练分两阶段,在多仿真基准和真机实验表现卓越,仅3条轨迹基础任务成功率达96.8%,真机性能提升32%。