未分类

Vid2World – 从视频扩散模型到交互式世界模型的创新转变

Vid2World是什么 Vid2World是由清华大学与重庆大学联合开发的创新框架,旨在将全序列、非因果的被动视频扩散模型(VDM)转化为自回归、交互式、动作条件化...

Pixel Reasoner – 开启像素级视觉推理新时代

Pixel Reasoner 是一款由滑铁卢大学、香港科技大学、中国科学技术大学等机构联合推出的视觉语言模型(VLM),旨在通过像素空间推理增强模型对视觉信息的理解...

MTVCrafter – 开创人像动画生成的新纪元

MTVCrafter是什么 MTVCrafter是由中国科学院深圳先进技术研究院计算机视觉与模式识别实验室联合中国电信人工智能研究所等机构推出的一款人像动画生成框架...

Morphik – 开源多模态检索增强生成工具,重塑知识管理与应用开发

Morphik 是什么 Morphik 是一款开源的多模态检索增强生成(RAG)工具,专为处理高技术性和视觉内容丰富的非结构化数据而设计。它结合了多模态搜索、知识图...

AgenticSeek – 开源本地化AI助手,开启隐私与效率的双重革命

AgenticSeek是一款开源的本地化AI助手,旨在为用户提供一个完全离线运行的智能解决方案。它基于DeepSeek R1模型构建,所有数据处理和任务执行均在用户本地设...

Slidev – 专为开发者打造的交互式演示工具

Slidev(发音为“/slaɪdɪv/”)是一个基于 Web 的幻灯片制作和演示工具,专为开发者设计。它通过结合 Markdown 语法和 Vue.js 技术,让用户能够以编写代码的方...

Company Research Agent – 智能化商业情报分析的利器

什么是 Company Research Agent? Company Research Agent 是一款基于多智能体框架的 AI 公司研究工具,旨在通过自动化方式快速生成全面、结构化的公司调...

Direct3D-S2 – 高分辨率3D生成的创新突破

Direct3D-S2 是由南京大学、复旦大学、牛津大学以及 DreamTech 等机构联合推出的一款高分辨率 3D 生成框架。该框架旨在解决传统 3D 生成方法在高分辨率场景下...

QwenLong-L1-32B – 阿里巴巴的长文本推理新突破

QwenLong-L1-32B 是阿里巴巴 Qwen-Doc 团队开源的首个长文本推理大模型,专为处理复杂的长文本任务而设计。该模型基于强化学习框架,通过渐进式上下文扩展和...

LMEval – 重塑 AI 模型评估新标准的开源框架

LMEval 是由谷歌于 2025 年 5 月推出的一款开源框架,旨在为大型语言模型(LLMs)和多模态模型提供标准化的评估工具。它通过简化跨平台模型性能比较,支持文...
1 293 294 295 296 297 442