Publication

Each paper is mapped onto the four CROSS research thrusts, with a cross-cutting Application view. A paper may belong to several thrusts; every card also carries its application and hardware tags. Click a thrust to collapse it.

Application Scenarios
21 papers
  • TIDES: Tiered Block-Sparse Tensor Contraction with Streaming Transpose on GPUs.
    Zecheng Li, Sri Harshavardhan Reddy Deverapalli, Yanbo Zhao, Frank Mueller, Karl Pierce, and Jiajia Li.
    The International Conference for High Performance Computing, Networking, Storage, and Analysis (SC).
    T1T2 Quantum Chem/Physics GPU
  • G-HEMP: Fast Multi-GPU Private Inference for Large-Scale GCNs with Homomorphic Encryption.
    Ran Ran, Zhaoting Gong, Zhaowei Li, Xianting Lu, Jiajia Li, and Wujie Wen.
    Conference on Machine Learning and Systems (MLSys).
    Security GPU
  • Diagonal-Budgeted Trotterization for Efficient Quantum Hamiltonian Simulation.
    Srikar Chundury, Blake Burgstahler, Jiajia Li, In-Saeng Suh, and Frank Mueller.
    ACM International Conference on Supercomputing (ICS).
    T3 Quantum Circuit Sim.
  • Recursive Sketched Interpolation: Efficient Hadamard Products of Tensor Trains.
    Zhaonan Meng, Yuehaw Khoo, Jiajia Li, and E. Miles Stoudenmire.
    ArXiv.
    T3 Quantum Physics
  • ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference.
    Han Meng, Danny Liu, and Dong Li.
    ArXiv.
    AI/Diffusion
  • Distributed Generative Inference of LLM at Internet Scales with Multi-Dimensional Communication Optimization.
    Jiu Chen, Shuangyan Yang, Xu Xiong, Hexiao Duan, Xinran Zhang, Jie Ren, and Dong Li.
    ArXiv.
    AI/LLM
  • CoCoDiff: Optimizing Collective Communications for Distributed Diffusion Transformer Inference Under Ulysses Sequence Parallelism.
    Bin Ma, Xingjian Ding, Tekin Bicer, Pengfei Su, and Dong Li.
    ArXiv.
    AI/Diffusion
  • Systolic Array Acceleration of Diagonal-Optimized Sparse-Sparse Matrix Multiplication for Efficient Quantum Simulation.
    Yuchao Su, Srikar Chundury, Jiajia Li, and Frank Mueller.
    ArXiv.
    T4 Quantum Circuit Sim. Reconfig./Systolic
  • ZenFlow: Enabling Stall-Free Offloading Training via Asynchronous Updates.
    Tingfeng Lan, Yusen Wu, Bin Ma, Zhaoyuan Sun, Rui Yang, Tekin Bicer, Dong Li and Yue Cheng.
    ArXiv.
    AI/LLM
  • NeuronMM: High-Performance Matrix Multiplication for LLM Inference on AWS Trainium.
    Dinghong Song, Jierui Xu, Weichu Yang, Pengfei Su and Dong Li.
    ArXiv.
    AI/LLM AI Accelerator
  • Machine Learning-Guided Memory Optimization for DLRM Inference on Tiered Memory.
    Bin Ma, Jie Ren, Shuangyan Yang, Benjamin Francis, Ehsan Ardestani, Min Si, and Dong Li.
    31st International Symposium on High-Performance Computer Architecture.
    T1T3 AI/DLRM
  • Performance Studies of Hypergraph Neural Networks (HGNNs) Using Tensor Representations.
    Ahmed Taimoor.
    M.S. Thesis, North Carolina State University.
    T1 AI/GNN
  • CONQURE: A Co-Execution Environment for Quantum and Classical Resources.
    Atulya Mahesh and Frank Mueller.
    International Workshop on Integrating High-Performance and Quantum Computing.
    Quantum Circuit Sim.
  • Fully Parallelized BP Decoding for Quantum LDPC Codes Can Outperform BP-OSD.
    Ming Wang, Ang Li, and Frank Mueller.
    arXiv preprint arXiv:2507.00254.
    Quantum Circuit Sim.
  • OpenMP-Q: Quantum Task Offloading in OpenMP.
    Swastik Mittal, Atulya Mahesh, and Frank Mueller.
    International Workshop on OpenMP.
    Quantum Circuit Sim.
  • Enabling Large Dynamic Neural Network Training with Learning-based Memory Management.
    Jie Ren, Dong Xu, Shuangyan Yang, Jiacheng Zhao, Zhicheng Li, Christian Navasca, Chenxi Wang, Harry Xu, and Dong Li.
    30th International Symposium on High-Performance Computer Architecture (acceptance rate: 18%). [pdf]
    T1T3 AI/DL
  • Efficient Tensor Offloading for Large Deep-Learning Model Training based on Compute Express Link.
    Dong Xu, Yuan Feng, Kwangsik Shin, Daewoo Kim, Hyeran Jeon, and Dong Li.
    30th USENIX Annual Technical Conference (acceptance rate: 15.7%). [pdf]
    T1 AI/DL
  • FASTEN: Fast GPU-accelerated Segmented Matrix Multiplication for Heterogenous Graph Neural Networks
    Keren Zhou, Karthik Ganapathi Subramanian, Po-Hsun Lin, Matthias Fey, Binqian Yin, Jiajia Li.
    The 38th ACM International Conference on Supercomputing (ICS).
    T2 AI/GNN GPU
  • DiaQ: Efficient State-Vector Quantum Simulation
    Srikar Chundury, Jiajia Li, In-Saeng Suh and Frank Mueller.
    ArXiv.
    T1 Quantum Circuit Sim.
  • DiaQ: A Novel Quantum-Tailored Numerical Format
    Srikar Chundury.
    M.S. Thesis, North Carolina State University.
    T1 Quantum Circuit Sim.
  • A PEPS plugin for TNQVM
    Srikar Chundury, J. Lietz, E. A. C. Perez, A. Shehata, In-Saeng Suh and Frank Mueller.
    IEEE International Conference on Quantum Computing and Engineering (QCE).
    T3 Quantum Circuit Sim.