「长程任务能力」共找到 4659 篇相关文章
1/10成本、Opus 4.7级表现,Cursor甩出了性价比之王Composer 2.5
Cursor推出新模型Composer 2.5,成本仅为Claude Opus 4.7的1/10,性能几乎追平。它更智能,擅长处理长时任务,遵循复杂指令更可靠。未来一周使用额度翻倍,还宣布与SpaceXAI合作训练新模型。
从最优传输角度训练奖励模型:让 RLHF 学会「忽略错误偏好」丨ICML 2026
浙江大学、小红书、北京大学等团队提出SelectiveRM,基于最优传输训练奖励模型。它重构训练目标,通过选择性分布对齐排除噪声偏好,解决了奖励模型训练中监督信号不可靠的问题,实验验证其有效且泛化能力好。
开源打破“AI黑箱”!集结全球大咖,GOSIM Paris 2026带你看懂Agent时代大变局
GOSIM Paris 2026在巴黎举办,是面向开发者的开源AI技术大会。大会由GOSIM主办,CSDN等联合打造,聚焦AI能力落地应用。首日Keynote多位大咖探讨AI相关问题,还有三大论坛、工作坊、Hackathon等活动。
华创七星微:为直流供电系统筑起一道防火墙
随着AI等领域设备迭代,电源保护重要性凸显。华创七星微依托六类量产芯片和将问世的集成模块,为直流供电系统提供防护,其产品覆盖供电链路关键节点,有完整解决方案,还具备多种能力优势。
哈萨比斯出的难题,GPT之父接上了:用一个知识停在1930年的模型
GPT之父Alec Radford等用1931年前数据训练13B模型Talkie,切断现代知识污染。研究者测试其能力,探讨它对未来的“预感”、规避污染问题及数据多样性等,同时训练中也面临时间泄漏、数据质量等难题。
Harness Engineering实践,做了一个平台让AI一晚上自动评测和优化你的系统
作者分享搭建小平台实现全自动化评测与系统优化的实践,包括创建评测任务、集、报告等,通过钉钉文档、绘报等案例展示操作,还能自动优化系统,不过需系统UI规范、AI Coding含量高。
让大模型理解真实医疗视频,全球首个开源技术方案来了!
AI 进入医疗领域需谨慎,此前美国引入不成熟 AI 致手术失误频发。全球首个医疗视频理解大模型元智医疗视频理解大模型发布并开源,解决了医疗视频领域的任务优化、数据缺失和无法评测痛点。
The Batch: 944 | Llama 之后的时代
Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。
Claude Opus 4.7 配 Lovart:全套品牌设计只需点击 2 次,设计师可能不太需要了
Anthropic发布Claude Opus 4.7,作者用其搭配Lovart为公益项目「国宝回家」做品牌设计。Lovart上线新功能打通设计链路,Opus 4.7感知能力提升。二者配合完成海报、字体、视频等,虽有细节待完善,但已跑通工程化链路。
扣子 2.5,过了体验那条红线
作者参加扣子Coze官方直播后分享使用感受,认为扣子2.5过了体验红线,普通人打开就能用且能解决问题。它继承龙虾优点,封装大模型能力,前端体验顺畅,还有云手机等功能,虽有不足但值得期待。