ECCV 2026 | 谷歌DeepMind等提出GenCeption:视频生成模型竟是通往通用视觉感知的捷径!

生成即是感知!

2026/7/14
阅读更多

华科 × 小米提出 DeltaV:让多模态大模型推理时不再每一步重画整张图

2026/7/13
阅读更多

ECCV 2026 | 当视觉语言模型学会“瞻前顾后”:跨图像注意力校准与偏好学习缓解多图像幻觉问题

2026/7/12
阅读更多

ECCV 2026 VisNec:不是所有图文数据都值得训练,把“没用的图文样本”筛出来

多模态训练不只是堆数据

2026/7/11
阅读更多

SIGGRAPH 2026 | 单图生成可动画 3D 数字人:PEAR 让全身、手部和表情重建跑到 100 FPS

2026/7/11
阅读更多

IEEE TPAMI | 华南理工等提出 REO:彻底摆脱标定依赖,19倍加速解锁3D语义占用预测新姿态

在自动驾驶和3D视觉的世界里,3D语义占用预测(3D Semantic Occupancy Predictio

2026/7/10
阅读更多

聚焦多模态,483篇“顶会+前沿”论文整理

2026/7/9
阅读更多

从500+高校到130家央国企合作:我们如何获得他们的信任?

分享一篇文章。

2026/7/9
阅读更多

数据生成,虚拟仿真,实时推理:前沿物理 AI 技术如何落地产业应用

2026/7/8
阅读更多

突破DiT量化瓶颈!ComfyUI 新版支持 ConvRot 黑科技:免训练、免校准、即插即用4-bit量化,让DiT显存暴降4倍、速度飙升2.26倍!

基础技术创新,释放AI生产力!

2026/7/7
阅读更多

别再只卷模型了:我们让文生图数据构建自己进化起来

2026/7/6
阅读更多

ECCV 2026 | 免训练即插即用,DiT推理加速新方案:浙大提出ResilPhase, 5倍加速下画质近乎无损

有界的相位映射,解决不稳定难题

2026/7/3
阅读更多

DomainShuttle:让主体在开放域视频生成中自由穿梭

2026/7/2
阅读更多

ICML 2026 | 别再拼模块了!一个模型同时接住人、物、声、动作,OmniShow把多模态可控人物交互视频生成带进"一次成片"时代!

2026/7/1
阅读更多

更好的PPT创作Agent来了!开源MemSlides,引入分层记忆,局部修改效率提升60%

今天介绍一篇近期非常受关注的PPT创作的新工作,曾登上Hugging Face Daily Papers榜首。

2026/6/28
阅读更多

视频更长不等于理解更难: VideoOdyssey揭示多模态大模型的长时推理瓶颈

推动模型从“看见片段”走向真正“理解过程”

2026/6/27
阅读更多

CVPR2026 | 从直接“打分”到“核验-打分”的图像编辑奖励模型

2026/6/26
阅读更多

从奖励最大化走向分布匹配:华科大等提出扩散模型对齐新范式 TMPO

代码已经开源

2026/6/25
阅读更多

AI时代科研必藏|我建了个网站帮你把教程、文献、代码、数据一站式搞定

我做了个网站, 帮你把写论文必备的Vibe Coding编程 + 网络模块 + 顶会论文绘图工具 + 科研数据

2026/6/24
阅读更多

“从生病手术到没有数据”——一位博四女生的真实上岸故事

分享一篇文章。

2026/6/24
阅读更多