Tags

Browse posts by topic.

llm-inference 173 system-optimization 134 diffusion-model 115 kv-cache 106 llm-training 101 efficient-attention 98 inference-serving 83 long-context 75 video-generation 75 mixture-of-experts 68 quantization 59 distributed-training 57 sparse-attention 51 pruning 49 communication 46 scheduling 46 reinforcement-learning 44 model-compression 42 kernel-optimization 41 vision-language 39 attention-mechanism 36 memory-efficiency 34 benchmark 33 parallelism-dp 32 image-generation 31 survey 29 vlm 28 parallelism 27 diffusion-transformer 26 speculative-decoding 24 multimodal 22 vla 18 parallelism-tp 17 robotics 17 llm-serving 16 mllm 13 disaggregation 13 world-model 12 architecture 11 flow-matching 10 parallelism-sp 10 reasoning 10 gpu-kernel 9 moe 9 parallelism-pp 8 compiler 8 audio 8 transformer 7 video-understanding 7 inference-optimization 6 llm 6 system-design 6 prefix-caching 6 audio-generation 6 training-free 6 multi-agent-systems 6 inference-acceleration 6 text-to-video 5 latent-diffusion 5 memory-management 5 load-balancing 5 kv-cache-optimization 5 hpc 5 pytorch 5 distributed-inference 5 disaggregated-inference 5 efficient-inference 5 rlhf 5 cxl 5 representation-learning 4 industrial-deployment 4 large-model-training 4 parallelism-cp 4 autoregressive 4 LLM Inference 4 warp-specialization 4 vllm 3 communication-efficiency 3 diffusion-models 3 distillation 3 gpu-optimization 3 cuda 3 joint-embedding 3 jit-compilation 3 image-editing 3 code-generation 3 flashattention 3 cuda-kernel 3 large-language-model 2 training-optimization 2 scaling-laws 2 scaling 2 Structural Causal Models 2 semantic-id 2 cold-start 2 computer-vision 2 recommendation 2 production-system 2 gpu 2 recommendation-systems 2 scaling-law 2 text-to-image 2 CXL 2 Persistent Memory 2 disaggregated-serving 2 deep-dive 2 latent-compression 2 optimizer 2 gradient-compression 2 sparsification 2 momentum 2 token-pruning 2 attention 2 kernel 2 state-space-model 2 token-compression 2 efficiency 2 memory-optimization 2 code-transformation 2 sparse attention 2 multilingual 2 parallelism-ep 2 contrastive-learning 2 world-models 2 mask-denoising 2 gpu-architecture 2 Scaling Law 2 graph-break 2 pd-disaggregation 2 expert-parallelism 2 Sparse Attention 2 Video Diffusion Transformers 2 dynamic-computation 2 vision-language-action 2 hybrid-attention 2 confidential-computing 2 streaming-inference 2 MoE 2 multi-agent 2 multimodal-generation 2 rdma 2 embodied-ai 2 multimodal-llm 2 linear-attention 2 gdn 2 sglang 2 KV cache 2 KV Cache 2 cxl-memory 2 memory-tiering 2 remote-caching 2 long-context-llm 2 triton 2 neural-machine-translation 1 encoder-decoder 1 sequence-to-sequence 1 alignment 1 self-attention 1 multi-head-attention 1 machine-translation 1 seq2seq 1 k-step-model-merging 1 hardware-topology 1 model-scaling 1 generative-models 1 classifier-free 1 gpu-memory 1 checkpointing 1 memory-planner 1 dynamic-batching 1 deep-learning-systems 1 continuous-normalizing-flow 1 optimal-transport 1 neural-network-verification 1 adversarial-robustness 1 hardware-accelerator 1 neural-architecture-search 1 Causal Deep Learning 1 Causal Inference 1 Deep Learning 1 Treatment Effects 1 Framework 1 Paradigm Shift 1 temporal-modeling 1 generative-retrieval 1 sequential-recommendation 1 rq-vae 1 object-discovery 1 object-centric 1 unsupervised-learning 1 binding-problem 1 ranking-model 1 youtube 1 generative-model 1 information-retrieval 1 paged-attention 1 fair-scheduling 1 virtual-token-counter 1 continuous-batching 1 hardware 1 nvidia 1 tensor-core 1 benchmarking 1 microarchitecture 1 sequential-modeling 1 foundation-model 1 video-encoder 1 Shared Memory 1 Failure Model 1 Fault Tolerance 1 Replication 1 Erasure Coding 1 Process Migration 1 moonshot-ai 1 sparse-activation 1 conditional-computation 1 gating-function 1 cache-acceleration 1 video-vae 1 causal-convolution 1 keyframe-compression 1 transformer-variant 1 torch-compile 1 video-llm 1 roofline-model 1 cuda-graphs 1 kernel-launch 1 parameter-indirection 1 sparsity 1 lora 1 autoscaling 1 kubernetes 1 nccl 1 heterogeneous-gpu 1 isoCost analysis 1 Pareto frontier 1 transformer LLM 1 taxonomy 1 Qwen 2.5 1 Llama 3.1 1 Gemma 3 1 vertical-slash 1 SnapKV 1 Quest 1 Block-Sparse 1 FlexPrefill 1 Ada-SnapKV 1 diffusion 1 gpu-sharing 1 multi-model-serving 1 open-source 1 Tensor Parallelism 1 Compute-Communication Overlap 1 CUDA Kernel Fusion 1 NVSHARP 1 Multimem 1 RMSNorm 1 vLLM 1 peft 1 retrieval 1 performance-model 1 content-moderation 1 llm-deployment 1 cascade-system 1 efficiency-leverage 1 expert-activation 1 model-architecture 1 compute-optimization 1 network-architecture 1 circuit-switching 1 scalability 1 theory 1 moe-architecture 1 Tabular Foundation Model 1 Large Structured-Data Model 1 In-Context Learning 1 Masked Modeling 1 Classification 1 Regression 1 Missing Value Imputation 1 Data Generation 1 dynamo 1 optimization 1 inference-engine 1 cross-datacenter 1 communication-optimization 1 compression 1 processing-near-memory 1 hardware-acceleration 1 long-sequence 1 cross-attention 1 efficient-training 1 spatio-temporal-grounding 1 video-qa 1 masked-generative-transformers 1 vision-generation 1 shared-memory 1 mamba 1 nvfp4 1 latent-moe 1 multi-token-prediction 1 LLM Architecture 1 Conditional Memory 1 Mixture-of-Experts 1 N-gram Embedding 1 Sparse Models 1 Knowledge Retrieval 1 DeepSeek 1 Dynamic Masking 1 Inference Acceleration 1 Denoising Process 1 Linear Approximation 1 parameter-efficient 1 image-to-video 1 token-mixer 1 computation-reuse 1 weight-pruning 1 context-parallelism 1 mllm-training 1 dynamic-parallelism 1 megatron-lm 1 anti-collapse 1 isa 1 parallel-computing 1 cross-vendor 1 hardware-architecture 1 computational-primitives 1 world-modeling 1 latent-intent 1 humanoid-robot 1 manipulation 1 edge-computing 1 energy-efficiency 1 wireless-networking 1 cpu-gpu-hybrid 1 attention-parallelism 1 sequence-compression 1 kv cache eviction 1 information bottleneck 1 mutual information 1 log-determinant 1 statistical leverage score 1 long-context inference 1 capacity-aware 1 CapKV 1 gpu-inference 1 multi-tier-memory 1 bayesian-prediction 1 attention-architecture 1 mla 1 spatial-reasoning 1 multi-tenant 1 resource-efficiency 1 Sparse Autoencoders 1 Mechanistic Interpretability 1 LLM Steering 1 Feature Analysis 1 Benchmark Redundancy 1 Toxicity Classification 1 Safety Data Synthesis 1 Reinforcement Learning 1 multi-model 1 Memory Tiering 1 Managed Runtimes 1 JVM 1 Garbage Collection 1 Hotness Tracking 1 Operating Systems 1 simulation 1 performance-modeling 1 compute-io-coopt 1 frequency-analysis 1 llm-agent 1 test-time-training 1 knowledge-distillation 1 small-model 1 ide-assistant 1 memory-mechanism 1 long-video 1 real-time 1 videollm 1 token-dropping 1 real-time-processing 1 gpu-cluster 1 performance-diagnosis 1 tracing 1 observability 1 embodied-learning 1 world-action-model 1 Edge Inference 1 Hardware Benchmark 1 Empirical Study 1 video diffusion transformers 1 intrinsic sparse topology 1 WEST 1 FAST 1 Hellinger distance 1 CRM kernel 1 FlashAttention-3 1 Wan2.1 1 HunyuanVideo 1 block-sparse attention 1 ocr 1 document-understanding 1 agent 1 terminal-agent 1 software-engineering 1 robot-learning 1 test-time-adaptation 1 planning 1 autoregressive-modeling 1 game-ai 1 Hardware Accelerator 1 Algorithm-Hardware Co-Design 1 Spatio-Temporal Correlation 1 RoPE Encoding 1 multimodal-agents 1 creative-ai 1 canvas-native 1 agent-runtime 1 long-horizon 1 workflow-orchestration 1 online-softmax 1 block-sparse 1 approximation-correction 1 Long-Context 1 Kimi-Delta-Attention 1 Attention-Residuals 1 Native-Vision 1 Agentic-RL 1 Muon-Optimizer 1 MXFP4-Quantization 1 Kimi 1 p-d-disaggregation 1 network-optimization 1 selective-transfer 1 self-hosted 1 cloud-gpu 1 reproducibility 1 evaluation 1 physical-reasoning 1 gpu-interconnect 1 nvlink 1 ctr-prediction 1 semantic-embedding 1 prototype-learning 1 dpp 1 long-tail 1 taobao 1 kv-cache-compression 1 cache-eviction 1 decoding 1 vision-language-navigation 1 vln 1 agentic-memory 1 zero-shot 1 world-graph 1 video-world-model 1 block-causal-attention 1 diffusion-forcing 1 tree-speculative-decoding 1 gpu-kernel-optimization 1 closed-form-parallelization 1 batching 1 resource-fairness 1 competitive-ratio 1 cost-alignment 1 profit-analysis 1 omni-modal 1 audio-visual-understanding 1 layer-decomposition 1 RGBA 1 agentic-editing 1 video-editing 1 real-time-inference 1 autoregressive-diffusion 1 distribution-matching-distillation 1 streaming-generation 1 causal-generation 1 llm-infra 1 tensor-management 1 distributed-systems 1 model-serving 1 taaS 1 On-Policy Distillation 1 Self-Distillation 1 LLM Post-training 1 Mathematical Reasoning 1 Self-Consistency 1 KV Cache Sparsity 1 Speculative Decoding 1 Prefetching 1 Disaggregated Serving 1 Memory Management 1 Self-Evolving Agents 1 Coding Agents 1 Core Evolution 1 Operational Safety 1 Multi-Model Review 1 Benchmark Audits 1 distributed systems 1 LLM serving 1 stateful operator 1 AAFLOW 1 zero-copy 1 agentic workflow 1 Generative Rendering 1 Video Generation 1 Revisit Consistency 1 Autoregressive Models 1 3D Scene Understanding 1 Depth Conditional Diffusion 1 semi-autoregressive 1 confidence-scheduling 1 deepseek 1 transformer-decoder 1 streaming-decoder 1 real-time-decoding 1 diffusion-llm 1 wavefront-parallel 1 self-correcting 1 block-wise-diffusion 1 dlnference 1 sequence-parallelism 1 ast-transformation 1 jaseci 1 fx-graph 1 multi-turn-llm 1 long context 1 RAG 1 RoPE 1 inference efficiency 1 selective recomputation 1 LLM Serving 1 Distributionally Robust Optimization 1 Wasserstein DRO 1 GPU Resource Management 1 Queueing Theory 1 distributionally-robust-optimization 1 gpu-clusters 1 preemption-management 1 throughput-latency 1 top-k-selection 1 weight-quantization 1 gpu-memory-management 1 runtime-quantization 1 pagedattention 1 any-precision 1 speculative-computation 1 dynamic-sparse-attention 1 graph-capture 1 VLA 1 streaming inference 1 KV caching 1 flow matching 1 real-time control 1 prompt-compression 1 extractive-compression 1 theme-collapse 1 trie-indexing 1 inference-efficiency 1 prefill-optimization 1 Multimodal Learning 1 Scaling Laws 1 Native Pre-training 1 Compute-optimal Allocation 1 Vision-Language Models 1 dsl-compiler 1 ascend-npu 1 post-training 1 video-diffusion 1 agent-framework 1 kernel-fusion 1 cache 1 recurrent-state 1 gpu-kernels 1 robot-manipulation 1 speed-control 1 trajectory-augmentation 1 imitation-learning 1 variable-speed 1 vlm-scheduler 1 OSDI-2025 1 DL-Training 1 Silent-Errors 1 Invariant-Inference 1 训练可靠性 1 generative-game-engine 1 multi-player-control 1 realtime-inference 1 wandb 1 kof97 1 streaming-autoregression 1 DMD-distillation 1 Tailwind CSS 1 robust-optimization 1