InstantCharacter – 腾讯混元开源的定制化图像生成插件 InstantCharacter是什么 InstantCharacter 是腾讯混元开源的定制化图像生成插件。基于扩散 Transformer(DiT)框架,引入可扩展的适配器(包含多个 Transf... Ai项目 1年前04,3700
MAI-DS-R1 – 微软开源的 AI 模型,基于 DeepSeek R1 改进版 MAI-DS-R1是什么 MAI-DS-R1 是微软基于 DeepSeek R1 改进的AI模型。MAI-DS-R1基于后训练优化,支持响应 99.3% 的敏感话题提示,比原版提升 2 倍,将有害内容... Ai项目 1年前04,3500
FramePack – 斯坦福开源的AI视频生成模型 FramePack是什么 FramePack 是斯坦福大学开源的AI视频生成模型。基于压缩输入帧的上下文长度,解决视频生成中的“遗忘”和“漂移”问题,让模型能高效处理大量帧,保持较低的计算复杂度。Fr... Ai项目 1年前05,3600
FastAPI-MCP – 一键将 FastAPI 转换为 MCP 服务器的开源工具 FastAPI-MCP是什么 FastAPI-MCP 是将 FastAPI 应用的端点自动转换为符合模型上下文协议(MCP)的开源工具。具有零配置的特点,只需简单指向 FastAPI 应用可自动发现并... Ai项目 1年前04,5300
MineWorld – 微软研究院开源的实时交互式世界模型 MineWorld是什么 MineWorld是微软研究院开源的基于《我的世界》(Minecraft)的实时交互式世界模型,基于视觉-动作自回归Transformer架构,将游戏场景和动作转化为离散的t... Ai项目 1年前04,0550
HumanRig – 阿里高德推出的3D人形角色自动绑定任务数据集 HumanRig是什么 HumanRig 是阿里巴巴团队开发的 3D 人形角色自动绑定研究项目。解决现有绑定技术因缺乏高质量数据集而发展受限的问题,通过提供大规模、高质量的数据集和创新的自动绑定框架... Ai项目 1年前05,0900
GigaTok – 港大联合字节推出用于自回归图像生成的视觉分词器 GigaTok是什么 GigaTok 是用于自回归图像生成的视觉分词器,参数量达 30 亿。通过语义正则化技术,将分词器特征与预训练视觉编码器(如 DINOv2)的语义特征对齐,有效约束潜在空间复杂度... Ai项目 1年前06,0950
SkyReels-V2 – 昆仑万维开源的无限时长电影生成模型 SkyReels-V2是什么 SkyReels-V2是昆仑万维SkyReels团队推出的无限时长电影生成模型,基于扩散强迫(Diffusion-forcing)框架,结合多模态大语言模型(MLLM... Ai项目 1年前05,0200
OpenUtau – 开源的AI歌声合成工具,自动适配系统语言 OpenUtau是什么 OpenUtau 是开源的歌声合成工具,兼容 UTAU 音源库和重采样器,支持 VSQX 导入、多语言界面及预渲染功能,帮助创作者快速预览作品节省时间。OpenUtau现代化的... Ai项目 1年前05,6500
Gemma 3 QAT – 谷歌推出的最新开源模型,Gemma 3 量化版 Gemma 3 QAT是什么 Gemma 3 QAT(Quantization-Aware Training)是谷歌推出的最新一代开源模型,是Gemma 3 的量化优化版本。通过量化感知训练技术,Ge... Ai项目 1年前04,6650