MoonMath
Posts
Research notes, engineering write-ups, and updates from MoonMath.
Jul 8, 2026TPUPyTorch to JAX: a field guide from porting a 22B video modelJul 8, 2026LiteLinearLiteLinear 0.3.0: Accelerating Video Generation DiT with Low-Rank Linear CompressionJun 23, 2026ResearchHyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion ModelsJun 21, 2026GMTLVGenerative Media TLV: 2nd EditionJun 17, 2026AMDA Fast Attention Kernel for MI300X, Written in HIP, Not AssemblyMay 5, 2026WorldJenWorldJen: An end-to-end multi-dimensional benchmark for generative videosMay 4, 2026ResearchWhy Self-Supervised Encoders Want to Be NormalApr 7, 2026AMDCosmos-Predict2.5-2B Inference: NVIDIA H200 vs AMD MI300XMar 24, 2026PartnershipPartnership - Bria Fibo AccelerationMar 22, 2026ResearchThe Quantization Handbook for DiffusionMar 17, 2026LiteAttentionLiteAttention: Optimized QuantizationMar 17, 2026LiteRunnerLiteRunner: MLOps-Style Tracking Without Touching the CodeMar 17, 2026ResearchJourney From Wan to Decart LSD, Part1: FrameCommitMar 11, 2026BackLiteIntroducing BackLite: Attention Backpropagation Acceleration Using Dynamic SparsityMar 6, 2026LiteAttentionLiteAttention Callibration Tool: How to Manage Your Error Budget to Max PerformanceMar 5, 2026GMTLVGenerative Media TLV: 1st EditionMar 2, 2026LiteAttentionIntroduction to LiteAttention