分层赋能」共找到 5189 篇相关文章

开源动态8

DGM:首个可通过重写自己的代码来实现进化的AI Agent

Sakana AI发布Darwin Gödel Machine(DGM),可通过重写代码自我进化,突破了当前AI Agent智固定的局限。它在多测试中表现出色,力具通用性,但也有潜在风险和局限,团队已开源并提出未来研究方向。

AGI Hunt
产品应用8

Nano Banana Pro最全解析,设计师和开发者都用得上,附官方提示指南

Nano Banana Pro基于Gemini 3 Pro构建,将逻辑推理力注入像素生成,解决画面准确性、逻辑性问题。它在多方面实现飞跃,应用广泛,谷歌还给出提示词使用技巧,但在部分处理上仍有提升空间。

AIGC开放社区
算法论文8

北大联手通义实验室发布ZeroSearch:成本暴降88%,无需搜索即可激活大语言模型的检索力!

北大与通义实验室发布ZeroSearch框架,可无需真实搜索激活大语言模型检索力。它引入大语言模型模拟搜索、采用结构化模板等策略,成本降88%,多项实验显示其性超越基线与真实搜索方法。

深度学习自然语言处理
开源动态8

全球首个AI智体「自进化」开源框架来了!一次部署,终生可用

英国格拉斯哥大学团队发布全球首个AI智体自进化开源框架EvoAgentX,打破传统多智体系统构建与优化限制。它有自动化构建、自进化机制和系统性评估亮点,实验验证其性提升显著。

新智元
开源动态8

Meta开源多语言语音识别系统,支持1600种语言,可轻松扩展新语种!

Meta研究团队开源Omnilingual ASR,理解1600种语言,用几条语音 - 文本配对样本就零样本扩展新语种。提供三种架构,满足不同需求,性超现有多语种模型,应用场景广泛。

开源星探
产品应用7

ElevenLabs 发布“视频到音乐”:AI 读懂视频内容,为其创作氛围匹配的 BGM。

ElevenLabs推出“视频到音乐”功,其“Eleven Music”模型分析视频上下文、情绪和风格,一键生成匹配的定制背景音乐,还添加画外音和音效,为创作者提供端到端音视频解决方案。

AI进修生
产品应用7

1篇长文 = N张小红书爆款图?!Gemini 2.5 Pro 这效率,我跪了!

作者作为小红书小号主,苦于长文转图难,用Gemini 2.5 Pro Preview 05 - 06实现了一键转换。文章分享提示词结构、使用方法、修改方式,还介绍用AI调风格,指出系统有生成不稳定和下载问题。

AI产品黄叔
产品应用8

π0引用的中国团队,又出手了:世界仿真器新作发布

Current Robotics团队发布交互式世界仿真器CurrentWorld - 0,创始人祝毅晨履历亮眼。该仿真器跨本体、多视角、力 - 触觉预测,可用于评测机器人,还让人类接管以探索不同动作结果。

量子位
算法论文8

北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理力,在多场景测试中表现出色,为大模型基建提供新范式。

机器之心
算法论文8

让机器人学会「预判接触」:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题

它石智航联合四大顶尖机构发布论文 “TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation”,提出力条件触觉世界模型,让机器人提前预判接触变化,在真机验证中性优异。

机器之心