测试方法」共找到 3049 篇相关文章

算法论文8

牛津VGG、港大、上交发布ELIP:超越CLIP等,多模态图片检索的增强视觉语言大模型预训练

牛津VGG、港大、上交大团队论文提出ELIP方法,用学术界资源增强视觉语言大模型预训练,用于文字 - 图片检索。该论文被大会接受并获最佳论文提名。ELIP可应用于多个大模型,实验显示能显著提升图片检索表现。

机器之心
开源动态8

代码生成要变天了?被质疑架空后,Yann LeCun携320亿参数开源世界模型“杀回来了”

在新一代代码生成模型不断涌现的当下,Meta FAIR CodeGen团队由Yann LeCun领导发布了代码世界模型CWM。它有320亿参数,创新训练方式使它不仅会写代码,还能模拟执行,性能测试表现不俗,在圈内引发热议。

AI前线
开源动态7

从社区数据出发,再看大模型开源开发生态全景与趋势

蚂蚁开源先后在527蚂蚁技术日和外滩大会发布大模型开发生态开源项目全景图1.0和2.0版本。2.0版更新评估方法,呈现生态新变化,还分析技术趋势、开发者分布,提及项目进出情况及TensorFlow衰落等。

InfoQ
产品应用7

基于OpenAPI和AI coding的上云智能体构建实践

文章介绍基于OpenAPI和AI coding构建上云智能体的实践。分析不同编程范式,结合AI coding发展与Multi - Agent问题,阐述构建方案,包括业务场景、构建方法、技术实现、当前效果及后续展望,还提及文档智能与RAG构建LLM知识库。

阿里云开发者
算法论文8

细节直逼亚毫米级!港科广分层建模突破3D人体生成|CVPR 2025

港科广团队提出MultiGO创新方案,借助分层建模思路突破3D人体生成难题。该方案通过三级几何学习框架提升重建质量,在多个测试集上性能领先,且在多领域有应用优势,研究成果入选CVPR 2025,项目代码将开源。

量子位
产品应用7

6个电子牛马替我上班,腾讯马维斯好用吗?

5月20日腾讯上线AI助手马维斯,由六个AI Agent组成。经测试,它在定时任务、搜索整理、竞品分析等场景有表现,但也存在文件操作易出错、图片识别不稳定、分析深度不足等问题。其背靠腾讯生态有渠道优势,但需提升体验促使用户留存。

芯师爷
算法论文7

LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?

论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。

深度学习自然语言处理
推荐文章8

Life of a Token:像调试代码一样看懂大模型如何生成 Token

文章类比 Chrome 的 Life of a Pixel,追踪 LLM 里 token 从输入到输出的全程。以 GPT - 2 Small 为例,详细讲解其管线各阶段,如 Tokenization、Embedding 等,还介绍了残差流、KV Cache 等概念及 GPU 性能瓶颈和优化方法

AI前线
产品应用7

全网实测开玩Fable 5.1,听说写作说话和真人没区别?

Anthropic发布Fable 5.1后,第三方跑分和个人实测出炉。ARC Prize测试成绩佳且成本降32%,网友用它做出多款游戏。科技媒体Every全面测评,指出其多方面优势与设计等短板,并给出使用边界。

量子位
开源动态8

13小时不眠不休,300个分身狂敲代码!开源第一易主了

4月20日深夜,Kimi K2.6出道即开源,展示了强大的「全栈交付」能力,跑分超GPT - 5.4等。它能完成多类型官网制作,300个Agent协作能力强,还能复刻高盛研报、交付三件套,其Claw群组开启小范围测试

新智元