「低保真数据」共找到 3360 篇相关文章
语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究
清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。
面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni
文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。
EMNLP 2025 | 动态压缩CoT推理新方法LightThinker来了
随着AI发展,大语言模型处理复杂推理任务能力提升,但推理产生大量中间步骤和文本,拖慢计算速度、增加资源压力。研究者提出LightThinker,模仿人类思考模式,动态压缩推理步骤,削减tokens数量,降低成本。
4 个月狂飙 22k Star,这本书凭什么?
Github上超火的开源项目《LLMs-from-scratch》中文版4月上市,4个月涨超22k Star。作者实操搭建类GPT - 2模型,涵盖大模型构建全流程。用PyTorch开发,代码少且有注释,对初学者友好,豆瓣评分9.3。
Github 4.1k star,SuperSonic AI×BI 大厂震撼开源
SuperSonic 是腾讯音乐开源的下一代 AI+BI 平台,融合 Chat BI 与 Headless BI 两种范式。它解决了传统 BI 工具复杂、数据口径不统一等痛点,有丰富功能和技术优势,适用于多业务场景,开源优势明显。
从繁杂技巧到极简方案:ROLL团队带来RL4LLM新实践
当前RL4LLM领域发展快但存在标准、结论不一及机制解释不足等问题。阿里巴巴淘天集团和爱橙科技联合高校基于ROLL框架研究,评估关键技术组件,提出简化算法Lite PPO,在多基准上表现佳。
北大ChatExcel,获得千万级新投资
北大团队研发的ChatExcel完成天使轮融资,获近千万支持。资金用于产品研发和全球化推广。它是中国首个生成式AI Excel与数据分析智能体,已服务超百万用户,还启动了PreA轮融资。
字节开源终身记忆多模态智能体,长时记忆+RL,实测超Gemini‑GPT4o!
字节开源全球首个带终身记忆更新的全多模态智能体M3 - Agent,给其装上‘长期记忆’大脑。它构建实体记忆图谱解决现有Agent问题,架构含两个流程,代码实现有特色,跑分数据出色。
Meta刚刚开源DINOv3,横扫60+任务,无标注封神!
今天凌晨,Meta开源视觉大模型DINOv3,采用自我监督学习,无需标注数据。它在60多个视觉任务测试中表现出色,超越同类模型。还引入后处理优化策略,扩展应用场景,能适应多种部署环境。
GPT-5编程成绩有猫腻!自删23道测试题,关键基准还是自己提的
有人发现OpenAI测试GPT-5编程能力时,用的SWE-bench Verified子集仅477题,自行省略23题。若这些题默认零分,其得分比Claude Opus 4.1低。且该基准还是OpenAI自己提出的。