多模态代码生成」共找到 4181 篇相关文章

开源动态7

FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性

FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。

InfoQ
开源动态8

半天16.5k Star,谷歌AI Agent强势开源,AI编程变天了!

Google推出轻量级且功能强大的开源AI Agent——Gemini CLI,能将Gemini带入用户终端,可利用Gemini 2.5 Pro编写代码等,半天获16.5k Star,还具备多种强大功能。

PaperAgent
开源动态7

Lovart的开源平替产品,完全本地免费的AI设计Agent。

Lovart是热门AI设计Agent但使用成本高,现找到开源平替项目Jaaz。它接OpenAI绘图API,支持Comfyui等本地工具,能免费本地使用,功能丰富,还将推视频生成功能。

开源AI项目落地
新闻资讯8

Claude 4发布!世界最强编程模型来了

Anthropic发布Claude 4家族,含Claude Opus 4和Claude Sonnet 4,代码能力强,重新定义AI编程助手能力边界。有新功能,企业认可,Claude Code上线,记忆能力提升,立即可用且价格不变。

AGI Hunt
新闻资讯8

突发!Opus 5.2深夜上线,RSI真来了?

Anthropic在Claude Code开启Claude Opus 5.2灰度测试,跳开5.1版本,解决了以往AI“偷懒病”,响应速度、输出质量大幅提升,同时曝光内部已用核武级Model 2编写代码,RSI或已来临。

新智元
产品应用8

Claude Science几周干完两年活,10倍科研提速真来了?

2026年6月30日,Anthropic发布Claude Science,定位面向科学家的AI工作台。它将科研拆成可审计流水线,整合工具链,自带可追溯代码,有协调与审查智能体,首落生命科学领域,与Google、OpenAI玩法不同。

新智元
算法论文8

“这个怎么组装?”一句无害的问题,如何让AI产生危险输出

Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。

深度学习自然语言处理
新闻资讯7

刚刚,阿里官方认领神秘「欢乐马」,来自ATH郑波团队

周二晚间,AI评测平台Artificial Analysis上,‘欢乐马’空降榜首引热议。现阿里官方认领,它是ATH郑波团队模型,正内测,近期将开放API。其在多项排行榜表现出色,支持四种视频生成模式。

机器之心
推荐文章8

Anthropic用GAN思路解决AI产出质量问题

Anthropic工程师发现AI会自我欺骗,无法准确评价自己工作。他们借鉴GAN思路,让Generator生成、Evaluator验收。校准Evaluator使其严格,还为前端设计定审美标准,实验证明挑刺搭档能提升AI产出质量。

CourseAI
开源动态7

3.7k星星!爆火开源网站GEO检测工具,老外靠教别人玩这个工具赚麻了

今年315让GEO被更多人关注,虽GEO滥用不行,但正常宣传可用。推荐开源网站GEO审查工具geo - seo - claude,它能多维度检测网站,给出审计报告和优化方案,还具备报告生成等能力。

开源AI项目落地