未分类
豆包·语音播客模型 – 高效创作与互动的全新播客体验
豆包·语音播客模型是由字节跳动旗下火山引擎推出的一款创新的语音播客生成工具,旨在通过高效、自然的语音生成技术,为用户提供低成本、高时效、强互动的播客...
Veo 3 – AI视频生成的革命性突破
Veo 3是什么 Veo 3是由谷歌DeepMind于2025年5月推出的新一代AI视频生成模型。它通过多模态技术实现了视频与音频的同步生成,能够根据文本或图像提示自动生...
II-Agent – 开源智能体框架,开启AI应用新纪元
II-Agent 是由 Intelligent Internet 团队开发的开源 AI Agent 框架,旨在通过与大型语言模型(LLM)的深度交互,简化并提升跨多个领域的工作流程。它以强大...
News Agents – 开源终端新闻聚合与摘要系统
News Agents 是一款开源的终端新闻聚合与摘要系统,旨在通过多智能体协作实现高效、个性化的新闻获取与整理。它基于终端操作,利用多智能体并行处理技术,从...
Imagen 4 – 重新定义AI图像生成
什么是Imagen 4? Imagen 4是Google DeepMind最新推出的文本到图像生成模型,旨在通过先进的AI技术将用户的创意文字描述转化为高质量的视觉图像。它不仅在...
Pixel3DMM – 高精度单图像3D人脸重建的创新突破
Pixel3DMM是什么 Pixel3DMM是由慕尼黑工业大学、伦敦大学学院和Synthesia联合推出的一款单图像3D人脸重建框架。它基于DINO基础模型,通过引入专门的预测头...
AutoBE – AI驱动的后端代码生成引擎
AutoBE是一款由Wrtn Labs开发的AI驱动的后端服务器代码生成工具,旨在通过自然语言描述自动生成高质量的后端代码。它结合了瀑布模型的结构化开发流程和螺旋模...
Gemma 3n – 移动端多模态 AI 的新标杆
Gemma 3n 是谷歌在 2025 年 I/O 开发者大会上发布的端侧多模态 AI 模型,专为低资源设备设计,具备强大的多模态处理能力。它继承了 Gemini Nano 架构,通过创...
BAGEL – 开源多模态AI的全能选手
BAGEL是什么 BAGEL是由字节跳动Seed团队开发的一款开源多模态基础模型,旨在实现文本、图像和视频的统一理解和生成。它拥有14亿总参数和7亿活跃参数,基于...
Graphiti – 构建动态知识图谱的AI利器
Graphiti是什么 Graphiti是一个专为动态环境设计的AI知识图谱生成框架,旨在为AI智能体构建具备查询能力且能够感知时间的知识网络。它能够实时捕获和处理...