「好表现定义」共找到 3238 篇相关文章
字节Seedream 4.0将全量开放!抢先评测来了,我们摸索出AI生图20种「邪修」玩法
近日,字节跳动内测豆包・图像创作模型 Seedream 4.0,支持多模态生图,核心能力显著提升。它将全量上线并开放给企业客户。实测显示其多模态融合出色,还与谷歌 Nano Banana 对比,各有优势。
腾讯开源WMT2025冠军大模型:拿下30个第一,同类最佳
昨晚腾讯开源WMT2025冠军翻译大模型Hunyuan - MT - 7B,它在31种语言测试中获30个第一,成同类最佳。文中介绍其架构、训练过程,还通过多场景翻译案例展现优势,有望推动高质量翻译普及。
社区供稿 | VibeVoice实现90分钟、多角色播客生成,拓展语音合成新边界
微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最多 4 人对话的高质量播客音频,在多方面有显著优势,未来潜力大。
凌晨战神Qwen又搞事情!新模型让图像编辑“哪里不对改哪里”
Qwen团队发布Qwen-Image-Edit,作为Qwen-Image20B图像编辑版,能精准修改文字,还可新增、消除、重绘、修改元素,支持IP编辑、视角切换等玩法,在多方面表现出色。
GPT-5认为这个模型是开源界的Claude 3.5——陈天桥朋友圈里的 MiroMind ODR 让我眼前一亮
陈天桥用GPT - 5评测自家开源模型MiroMind ODR,让其应对复杂问题。GPT - 5评价该模型是“开源界的Claude 3.5”,其能力让GPT - 5“点赞”,有闭源模型稳定性和可用性,还具全开放架构。
ICCV 2025 | HERMES:首个统一3D场景理解与生成的世界模型
本文介绍HERMES,首个统一3D场景理解与生成的世界模型。它由华中科技大学等团队合作研发,通过共享LLM驱动两大任务,解决了输入处理和任务融合难题,实验效果显著,为自动驾驶提供新范式。
JinaVDR: 一个图文混排文档搜索任务的基准集
现有文档检索基准大多只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含多语言、多领域数据,可评估模型在复杂视觉文档的检索性能。
基于聊天的 AI 编程高效实践
本文探讨 Agent 对软件开发和开发者工作流的影响,以 GitHub Copilot“Agent 模式”构建维基搜索应用为例,对比不同 LLM 模型性能,指出要发挥 Agent 效能,可采用人机协作流程,经验是掌控其成果的关键。
付费Mathpix公式识别不香了~不要钱舒服!
复杂科学文献中公式识别问题重要,但现有模型有局限。DocTron - Formula通过简单微调在多场景达先进水平,还引入CSFormula数据集。它基于Qwen2.5 - VL微调,在多个数据集上效果佳。
1.5B参数撬动“吉卜力级”全能体验,国产开源之光多模态统一模型,来了
GPT-4o引发“吉卜力”风暴,改变AIGC范式。昆仑万维开源多模态统一模型Skywork UniPic,1.5B参数就能接近甚至超越十几亿参数专用模型,可在消费级显卡运行,还公开全套资源。