未分类
Ideogram 3.0 – 图像生成领域的重大突破
一、Ideogram 3.0 是什么 Ideogram 3.0 是由 Ideogram, Inc. 开发的一款先进的 AI 图像生成模型,于 2025 年 3 月正式推出。它在图像生成质量、真实感表现...
QVQ-Max – 视觉推理新纪元的开启者
QVQ-Max 是什么 QVQ-Max 是阿里通义团队基于 Qwen2.5-Max 模型打造的多模态视觉推理利器。它融合先进视觉编码技术和强大语言模型,使 AI 能从图像、视频中...
TxGemma – 谷歌 DeepMind 打造的高效药物研发 AI 模型
TxGemma 是什么 TxGemma 是谷歌 DeepMind 团队推出的一套专为医疗领域设计的通用人工智能模型,用于加速药物发现和治疗开发过程。它基于 Google 的 Gemma ...
TripoSG – 开启高保真 3D 形状合成新纪元
TripoSG 是什么 TripoSG 是 VAST-AI-Research 团队推出的一种基于大规模修正流模型的高保真 3D 形状合成技术。它通过大规模修正流变换器架构、混合监督训...
TripoSF – 重塑 3D 建模未来
TripoSF 是什么 TripoSF 是 VAST AI 推出的新一代 3D 基础模型,它突破了传统 3D 建模在细节、复杂结构和扩展性上的瓶颈。其采用 SparseFlex 表示方法,结...
DistilQwen2.5-R1 – 知识蒸馏赋能的小型化推理模型新选择
DistilQwen2.5-R1 是什么 DistilQwen2.5-R1 是阿里巴巴于 2025 年 3 月推出的基于知识蒸馏技术的小型化系列深度推理模型,包含 3B、7B、14B 和 32B 四个参...
PaddleSpeech – 开源语音大模型,赋能语音交互
PaddleSpeech 是什么 PaddleSpeech 是百度 PaddlePaddle 生态下的语音工具集,涵盖了语音识别、语音合成、声纹识别等多个语音相关的技术领域。它提供了简...
ChatAnyone – 阿里巴巴通义实验室的实时风格化肖像视频生成框架
ChatAnyone是什么 ChatAnyone 是阿里巴巴通义实验室推出的一款实时风格化肖像视频生成框架。它能够通过音频输入,生成具有丰富表情和上半身动作的肖像视频...
RoboBrain – 开源具身大脑模型,推动机器人智能进化
RoboBrain 是什么 RoboBrain 是由智源研究院开发的开源具身大脑模型,于 2025 年 3 月 29 日在中关村论坛上正式推出。它旨在推动单机智能向群体智能演进,...
RoboBrain – 开源具身大脑模型,推动机器人智能进化
RoboBrain 是什么 RoboBrain 是由智源研究院开发的开源具身大脑模型,于 2025 年 3 月 29 日在中关村论坛上正式推出。它旨在推动单机智能向群体智能演进,...