August 6, 2026 OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models 免训练的两阶段渐进式 token 压缩框架:LLM 前的模态特异结构压缩 + LLM 内的查询条件音视协同精炼 token-compression omni-modal multimodal-llm audio-visual-understanding efficient-inference training-free
January 21, 2025 InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling 通过长和丰富上下文(LRC)建模,增强视频多模态大语言模型的细粒度细节感知和长时序结构捕获能力 video-understanding multimodal vision-language video-llm long-context token-compression