PaletteID: Prototype-Composed Semantic Identifiers for Multimodal CTR Prediction
PaletteID 提出基于原型的语义标识符(PID),通过 SQ-DPP 从多模态商品嵌入中选择原型调色板,保留连续语义信号,提升 CTR 预测的长尾泛化能力
22 posts tagged with "multimodal"
PaletteID 提出基于原型的语义标识符(PID),通过 SQ-DPP 从多模态商品嵌入中选择原型调色板,保留连续语义信号,提升 CTR 预测的长尾泛化能力
A comprehensive survey of world models from a robot-learning perspective, examining policy coupling, learned simulators for RL and evaluation, robotic video generation, and benchmarks/datasets across embodied applications
腾讯混元原生多模态模型:在自回归框架内统一多模态理解与生成,80B MoE(激活 13B),当前最大最强开源图像生成模型
统一多模态理解与生成模型综述:系统梳理三大架构范式(扩散/自回归/混合),数据集与基准测试
统一多模态基础模型,融合空间增强 MLLM 与 MMDiT,实现理解/生成/编辑一体化,支持空间推理
昆仑万维 Skywork AI 开源视频生成模型系列(V1–V4、A1/A2/Audio/Text)技术演进与论文索引
通过对比策略优化对齐自回归视频生成
通过跨模态上下文学习改进联合音视频生成
NVIDIA Jetson平台优化的本地大语言模型推理框架,支持量化、多模态、语音、向量数据库和RAG
SparseVLM 和 SparseVLM+ 的完整技术分析,涵盖文本引导的视觉Token稀疏化方法、注意力重力校正、优先头选择等核心创新
A lightweight bridging paradigm that enables SOTA-level VLA performance with only 0.5B parameters, without robotic data pre-training
轻量级原生统一多模态模型,通过双流MoE架构和多任务协同训练实现图像视频理解、生成与编辑
OdysseyLLM 提出可部署的大语言模型量化加速方案。
OmniQuant 提出全方位校准的大语言模型量化方法。
支持时空定位、时序检索和视频问答的大规模多模态模型,通过统一编码架构实现视频理解与创作
OmniSparse提出训练感知的细粒度稀疏注意力机制,优化长视频多模态大语言模型的推理效率。
ShaLa提出多模态共享潜空间建模方法,实现文本、图像等多模态信息的统一表示学习。
基于多模态大语言模型的级联系统,用于工业级视频内容审核,通过路由器-排序器架构降低计算成本
首个多语言多条件语义检索数据集,通过对比重建框架提升检索性能45.9%
Qwen3 系列大语言模型,集成思考模式和非思考模式,支持 0.6B 到 235B 参数规模
通过长和丰富上下文(LRC)建模,增强视频多模态大语言模型的细粒度细节感知和长时序结构捕获能力
通过三阶段渐进训练和6B参数视频编码器,在70+视频理解任务上实现SOTA性能的视频基础模型