「任务性能」共找到 3565 篇相关文章
一个跑智能体,一个专门找漏洞:Google发布Gemini 3.8双版本
9月2日,Google发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。前者用于编程等,已稳定上线;后者专用于发现修复漏洞,仅向特定方开放。二者共享基础能力,采用不同安全限制和部署环境。
李飞飞发布:全球首个多模态世界模型
李飞飞团队的World Labs发布全球首个多模态世界模型Atlas,是多模态自回归扩散Transformer,能相机控制生成、3D重建等,已向部分伙伴开放早期访问,未来将成底层模型。
刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架
8月大模型厂商多上调API价格或收缩免费额度,因推理需求增长跑赢算力供给。阿里发布Qwen3.8-Flash并开源,成绩亮眼且价格低。它是Qwen4架构预演,有四大技术创新,提升了模型效率。
深度实测「豆包工作」+飞书:目前最接近企业Agent终局的答案
「豆包工作」作为面向生产力场景的Agent产品正式发布,与飞书深度打通,给出了目前Agent进入组织的最佳答案。主流办公Agent基础能力趋同,企业上下文正成办公Agent分水岭,豆包工作+飞书优势明显。
1周半写64个PR、完成30%项目重构:一家成熟SaaS公司把Agent塞进研发全流程后
Calendly公开Agentic Engineering实践,Agent嵌入研发全流程,如审查需求、写代码、测试等。一周半内,Agent为IAM团队生成64个PR,完成30%项目重构。研发瓶颈从写代码转为判断力,强调好需求与护栏重要性。
华师大智金院孵化金融原生基模Mint-Agent:超越GPT-5.6与Claude Opus 4.8,商业订单已超亿元
华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现超 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单超亿元,进入规模化金融场景验证阶段。
AI根本杀不死老语言,TypeScript和Python的王朝将会继续!TypeScript之父:没有编译器,AI连重构都不会
前 Meta 资深工程师 Ryan Peterman 对话 TypeScript 之父 Anders Hejlsberg,谈及 TypeScript 编译器从 JavaScript 移植到 Go 的考量,反驳‘AI 将写完所有代码’等论调,指出主流语言地位会因 AI 更巩固,初级工程师不会被取代。
上周 GPT 和 Codex 各有一个发布,很多人没注意吗?可以解锁 Codex 百万上下文了
最近基模发布多,OpenAI 俩更新被低估忽略。一是 GPT - 5.6 Sol 的 Ultrafast 模式,输出最高达每秒 750 Token,先向少量 API 客户开放;二是 Codex 为其开放百万上下文能力,不过大窗口有代价。
OpenAI失去了「CUDA内核之神」
近日热传Scott Gray已离开OpenAI。这位有「CUDA内核之神」称号的工程师声名起于Nervana Systems,加入OpenAI后贡献颇多。2026年OpenAI已流失不少人才,他的离开对公司影响值得关注。
泪崩!!!完啦,完啦 AI 编程,4k Star MonkeyCode!!!
现在很多AI编程工具,只让Agent“写出代码”。而MonkeyCode把AI编程任务接入完整链路,是面向专业研发团队的开源AI开发平台,本文介绍其特点、适用场景及注意事项。