Zhi Wei Tan
zwtan-cs
AI & ML interests
Efficient LLM inference, KV cache optimization, quantization, speculative decoding, model pruning
Recent Activity
upvoted a paper about 8 hours ago
RealtimeWAM: One-Step Asynchronous World Action Models upvoted a paper about 8 hours ago
QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for Video World Models liked a model 1 day ago
yuyijiong/speculative_pipeline_decodingOrganizations
None yet