「模型测试」共找到 8465 篇相关文章
西湖大学科研版NanoBanana开源!科研绘图从此自动化
西湖大学将科研版NanoBanana开源,其AutoFigure框架可自动化生成学术插图且能编辑,论文被ICLR 2026接收。该框架提出理性渲染范式,配套FigureBench基准测试集,表现超越人类预期。
ElevenLabs 发布“视频到音乐”:AI 读懂视频内容,为其创作氛围匹配的 BGM。
ElevenLabs推出“视频到音乐”功能,其“Eleven Music”模型能分析视频上下文、情绪和风格,一键生成匹配的定制背景音乐,还能添加画外音和音效,为创作者提供端到端音视频解决方案。
陶哲轩DeepMind梦幻联动,最强通用科学Agent来了!一口气解决芯片设计、矩阵乘法和300年几何难题
谷歌DeepMind与陶哲轩等打造的AlphaEvolve是LLM驱动的进化编码Agent。它能优化计算生态、调度数据中心等,还解决了数学难题,已在谷歌内部使用,现开启早期邀测试用。
继火爆全网的MCP后,Anthropic 推出全新整合功能,Claude再添连接利器
继MCP后,Anthropic推出全新Integrations功能,使Claude能与各种工具和应用无缝连接,提升协作能力,其研究能力也得到增强,新功能在部分计划测试,将惠及更多用户,助力高效完成任务。
我的AI订阅
作者分享四个AI订阅,介绍GitHub Copilot Pro+能在OpenCode调用模型,Perplexity Max准确性强、功能多,Grok多Agent编排出色,Gemini生态整合佳,还提及各产品优缺点及订阅费用。
DeepSeek|从零构建轻量级vLLM:Nano-vLLM,吞吐量逼近原版,代码仅需1200行
开源的vLLM能提升LLM推理速度和资源利用率。近日,DeepSeek AI俞星凯从零构建轻量级Nano - vLLM,代码仅1200行。它有离线推理等功能,基准测试显示吞吐量逼近原版。
AI实力榜大洗牌!OpenAI谷歌强势领跑,Anthropic节节败退
Poe最新报告显示,2025年1 - 5月AI各领域市场份额大洗牌。OpenAI和谷歌势头猛,Anthropic掉队。文本生成、推理、图像等各领域竞争激烈,企业需搭建评估体系,按需选模型。
Qwen2.5VL新玩法,看电影讲故事
本公众号关注AI前沿技术,分享实战案例与课程。介绍视觉叙事技术及挑战,基于Qwen2.5 - VL 7B模型微调Qwen Storyteller,构建StoryReasoning数据集,还给出实战代码及相关链接。
Windsurf 收购尘埃落定
Windsurf 收购尘埃落定,Devin 开发商收购其剩余人员和资产,Windsurf IDE 可重使用 Anthropic 模型。回顾收购时间线,此前 OpenAI 收购要约到期,谷歌获非独家许可权,现 Cognition 收购并计划集成平台。
Deepseek V4 Pro深夜上线,性能追平Fable 5,但价格只有它的2%
2026年8月12日,DeepSeek V4 Pro正式版上线。它是混合专家模型,规模居世界第一梯队。价格比Claude Fable 5便宜超98%,成本优势明显。其架构节省成本,API开放多模式,产品结构清晰。