未分类
Soundwave – 开源语音理解大模型,重塑语音交互体验
Soundwave 是什么 Soundwave 是香港中文大学(深圳)开源的语音理解大模型,专注于语音与文本的智能对齐和理解。通过创新的对齐适配器和压缩适配器技术,...
Motia – 重构 AI 开发范式的智能框架
Motia 是什么 :Motia 是一款专为软件工程师设计的 AI Agent 开发框架,旨在简化智能体的开发、测试和部署过程。它支持多种编程语言,如 Python、TypeScript ...
InfiniteYou – 打造个性化数字分身的 AI 利器
InfiniteYou 是什么 InfiniteYou(InfU)是字节跳动智能创作团队推出的一款基于扩散变换器(Diffusion Transformers)的身份保持图像生成框架。它通过 Inf...
RuoYi AI – 全栈式 AI 开发平台,助力高效构建智能应用
RuoYi AI 是什么 RuoYi AI 是一个全栈式 AI 开发平台,基于 RuoYi 框架开发,采用 Java 17+SpringBoot 3.x 构建后端服务,搭配 ElementUI 管理界面,支持...
MoshiVis – 开源多模态语音模型,开启语音视觉交互新纪元
MoshiVis 是什么 MoshiVis 是由 Kyutai 推出的开源多模态语音模型,基于 Moshi 实时对话语音模型开发,新增了视觉输入功能,可实现图像的自然、实时语音交...
DeepMesh – 3D 网格生成的革新者
DeepMesh 是什么 DeepMesh 是由清华大学和南洋理工大学的研究人员共同开发的 3D 网格生成框架。它基于强化学习和自回归变换器,能够生成高质量的 3D 网格...
BlockDance – 扩散模型加速革命的创新利器
BlockDance是什么 BlockDance 是复旦大学与字节跳动智能创作团队联合推出的一种扩散模型加速方法。它通过识别重用相邻时间步中结构相似的时空特征(STSS)...
Reve Image – 重塑图像生成的 AI 领航者
Reve Image 是一款由 Reve AI 推出的全新 AI 图像生成模型,自 2025 年 3 月发布以来,凭借其卓越的性能和独特的功能,迅速在行业内崭露头角,成为图像生成领...
StarVector – 开源多模态视觉语言模型,引领 SVG 生成新潮流
StarVector 是什么 StarVector 是由 ServiceNow Research、Mila - Quebec AI Institute 和 ETS Montreal 联合开发的开源多模态视觉 - 语言模型,专注于将...
LHM – 单图生成可动画 3D 人体模型的开源解决方案
LHM 是什么 :LHM(Large Animatable Human Reconstruction Model)是阿里巴巴通义实验室推出的从单张图像重建可动画化 3D 人体模型的开源项目。它仅需一张人...