「M1模型」共找到 8423 篇相关文章
交大系杀出具身赛道重围!1万台订单在手,以世界模型重塑万亿城市基建
物理AI成新征途,通用机器人面临工程难题。酷哇科技发布COOWA WAM 2.0世界模型,实现范式升级。其有四大技术支柱,助力机器人发展。酷哇预计2026年交付超万台机器人,还构想了“Robo City”图景。
1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!
在文本转语音(TTS)领域,生成长篇、多说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。
阿里开源PromptEcho:用冻结多模态大模型为文生图训练提供高质量Reward
阿里团队提出PromptEcho方法,无需标注和训练reward模型,仅通过冻结多模态大模型(VLM)的一次前向推理获高质量reward。实验显示其在文生图和电商海报文字渲染任务效果佳,且已开源相关代码等。
Google 发布 Gemini 3.1 Flash-Lite:每秒 363 tokens,百万 token 只要 $0.25
Google发布Gemini 3.1 Flash-Lite,输出速度达363 tokens/秒,比上一代快45%,首个token响应快2.5倍。价格降低,输入$0.25/百万tokens,输出$1.50/百万tokens。跑分不错,还有动态思考功能,支持多模态输入。
Fable5仅做对3.5%!大模型会看图,但还没有主动视觉
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。
从代码基座模型到智能体与应用:代码智能的全面综述与实践指南
北航、阿里等机构联合发布论文,系统梳理 2021 - 2025 年代码大模型发展。介绍代码基座模型、评测任务、对齐技术等,还提及软件工程智能体、安全防御及训练指南,预言未来编程走向。
世界模型的DeepSeek时刻!魔芯Flash World Model降本70%,跑出50FPS实时交互
魔芯科技发布全球首个超高帧率交互式世界模型 MoWorld,无需高端 GPU,实现影视级画质、50 FPS 实时交互,降本 70%。其技术架构先进,产业化路径清晰,获过亿美元融资。
ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心
近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北大团队用CoV-Eval评测20款主流大模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试。
识别1600+种人类语言,支持少样本扩展到5400+种语言,Meta自动语音识别模型开源
Meta AI发布Omnilingual ASR自动语音识别模型并开源。它能转录超1600种语言,含500多种首次被AI理解记录的语言,还可通过少样本扩展到5400多种,改变了多语言ASR构建范式。
字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。
字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。