Each paper is mapped onto the four CROSS research thrusts, with a cross-cutting Application view. A paper may belong to several thrusts; every card also carries its application and hardware tags. Click a thrust to collapse it.
▸
Thrust 1
Memory Heterogeneity-Aware Representations and Data (Re-)Arrangement
-
TIDES: Tiered Block-Sparse Tensor Contraction with Streaming Transpose on GPUs.Zecheng Li, Sri Harshavardhan Reddy Deverapalli, Yanbo Zhao, Frank Mueller, Karl Pierce, and Jiajia Li.The International Conference for High Performance Computing, Networking, Storage, and Analysis (SC).T1T2 Quantum Chem/Physics GPU
-
TierBPF: Page Migration Admission Control for Tiered Memory via eBPF.Xi Wang, Tal Zussman, Yuang Xu, Bin Ma, Asaf Cidon, and Dong Li.ArXiv.T1T2
-
Machine Learning-Guided Memory Optimization for DLRM Inference on Tiered Memory.Bin Ma, Jie Ren, Shuangyan Yang, Benjamin Francis, Ehsan Ardestani, Min Si, and Dong Li.31st International Symposium on High-Performance Computer Architecture.T1T3 AI/DLRM
-
cMPI: Using CXL Memory Sharing for MPI One-Sided and Two-Sided Inter-Node Communications.Xi (Sherry) Wang, Bin Ma, Jongryool Kim, Byungil Koh, Hoshik Kim, and Dong Li.37th ACM/IEEE International Conference for High Performance Computing, Performance Measurement, Modeling and Tools.T1
-
Performance Studies of Hypergraph Neural Networks (HGNNs) Using Tensor Representations.Ahmed Taimoor.M.S. Thesis, North Carolina State University.T1 AI/GNN
-
FlexMem: Adaptive Page Profiling and Migration for Tiered Memory.Dong Xu, Junhee Ryu, Jinho Baek, Kwangsik Shin, Pengfei Su, and Dong Li.30th USENIX Annual Technical Conference. [pdf]T1T2
-
MTM: Rethinking Memory Profiling and Migration for Multi-Tiered Large Memory Systems.Jie Ren, Dong Xu, Junhee Ryu, Kwangsik Shin, Daewoo Kim, and Dong Li.European Conference on Computer Systems. [pdf]T1T2
-
Enabling Large Dynamic Neural Network Training with Learning-based Memory Management.Jie Ren, Dong Xu, Shuangyan Yang, Jiacheng Zhao, Zhicheng Li, Christian Navasca, Chenxi Wang, Harry Xu, and Dong Li.30th International Symposium on High-Performance Computer Architecture (acceptance rate: 18%). [pdf]T1T3 AI/DL
-
Efficient Tensor Offloading for Large Deep-Learning Model Training based on Compute Express Link.Dong Xu, Yuan Feng, Kwangsik Shin, Daewoo Kim, Hyeran Jeon, and Dong Li.30th USENIX Annual Technical Conference (acceptance rate: 15.7%). [pdf]T1 AI/DL
-
DiaQ: Efficient State-Vector Quantum SimulationSrikar Chundury, Jiajia Li, In-Saeng Suh and Frank Mueller.ArXiv.T1 Quantum Circuit Sim.
-
DiaQ: A Novel Quantum-Tailored Numerical FormatSrikar Chundury.M.S. Thesis, North Carolina State University.T1 Quantum Circuit Sim.
HPC
11 papers
▸
Thrust 2
Balanced SpTC Algorithms with Smart Page Arrangement
-
TIDES: Tiered Block-Sparse Tensor Contraction with Streaming Transpose on GPUs.Zecheng Li, Sri Harshavardhan Reddy Deverapalli, Yanbo Zhao, Frank Mueller, Karl Pierce, and Jiajia Li.The International Conference for High Performance Computing, Networking, Storage, and Analysis (SC).T1T2 Quantum Chem/Physics GPU
-
Leveraging AI Ecosystem for Portable and Sustainable GPU Kernels in HPC.Yanbo Zhao, Zhaonan Meng, Sai Krishna Teja Varma Manthena, Xu Liu, Ajay Panyala, and Jiajia Li.ACM SIGPLAN International Workshop on Libraries, Languages and Compilers for Array Programming (ARRAY), co-located with PLDI.T2 GPU
-
SmartDispatch: Dynamic Substitution of NumPy-style APIs on Heterogenous CPU-GPU Systems.Jinku Cui, Yueming Hao, Shuyin Jiao, Jiajia Li, and Xu Liu.ACM International Conference on the Foundations of Software Engineering (FSE).T2 GPU
-
TypeCraft: A Lightweight Data Type Profiler with High Resolution.Zecheng Li, Xu Liu, Namhyung Kim, Blake Jones, Alexey Alexandrov, and Jiajia Li.USENIX Symposium on Operating Systems Design and Implementation (OSDI).T2
-
TierBPF: Page Migration Admission Control for Tiered Memory via eBPF.Xi Wang, Tal Zussman, Yuang Xu, Bin Ma, Asaf Cidon, and Dong Li.ArXiv.T1T2
-
RedSan: Redundant Memory Instruction Sanitizer for GPU Programs.Yanbo Zhao, Yueming Hao, Zecheng Li, Shuyin Jiao, Xu Liu, and Jiajia Li.The International Conference for High Performance Computing, Networking, Storage, and Analysis (SC).T2 GPU
-
Swift: High-performance sparse tensor contraction for scientific applications.Andrew Ensinger, Gabriel Kulp, Victor Agostinelli, Dennis Lyakhov, and Lizhong Chen.arXiv preprint arXiv:2410.10094.T2
-
FLAASH: Flexible Accelerator Architecture for Sparse High-Order Tensor Contraction.Gabriel Kulp, Andrew Ensinger, and Lizhong Chen.arXiv preprint arXiv:2404.16317.T4T2 Reconfig./Systolic
-
FlexMem: Adaptive Page Profiling and Migration for Tiered Memory.Dong Xu, Junhee Ryu, Jinho Baek, Kwangsik Shin, Pengfei Su, and Dong Li.30th USENIX Annual Technical Conference. [pdf]T1T2
-
MTM: Rethinking Memory Profiling and Migration for Multi-Tiered Large Memory Systems.Jie Ren, Dong Xu, Junhee Ryu, Kwangsik Shin, Daewoo Kim, and Dong Li.European Conference on Computer Systems. [pdf]T1T2
-
FASTEN: Fast GPU-accelerated Segmented Matrix Multiplication for Heterogenous Graph Neural NetworksKeren Zhou, Karthik Ganapathi Subramanian, Po-Hsun Lin, Matthias Fey, Binqian Yin, Jiajia Li.The 38th ACM International Conference on Supercomputing (ICS).T2 AI/GNN GPU
-
Parallel Sparse Tensor-times-Vector on Cerebras WSE-2Sai Krishna Teja Varm Manthena.M.S. Thesis, North Carolina State University.T4T2 Dataflow (Cerebras)
PL & Compiler
12 papers
▸
Thrust 3
Memoization and Intelligent Allocation to Reduce Computational Cost
-
STTID: High-Performance Sparse Tensor-Train Interpolative Decomposition.Zhaonan Meng, Miles Stoudenmire, Karl Pierce, Frank Mueller, and Jiajia Li.IEEE International Parallel and Distributed Processing Symposium (IPDPS).T3
-
Diagonal-Budgeted Trotterization for Efficient Quantum Hamiltonian Simulation.Srikar Chundury, Blake Burgstahler, Jiajia Li, In-Saeng Suh, and Frank Mueller.ACM International Conference on Supercomputing (ICS).T3 Quantum Circuit Sim.
-
From 2^N to N^2: Tree-Free Scalable Sparse Symmetric Tucker Decomposition.Yongseok Soh, Shruti Shivakumar, Jiajia Li, Jee Choi, and Ramakrishnan Kannan.International Conference on Parallel Processing (ICPP).T3
-
Recursive Sketched Interpolation: Efficient Hadamard Products of Tensor Trains.Zhaonan Meng, Yuehaw Khoo, Jiajia Li, and E. Miles Stoudenmire.ArXiv.T3 Quantum Physics
-
SymProp: Scaling Sparse Symmetric Tucker Decomposition via Symmetry Propagation.Zecheng Li, Shruti Shivakumar, Jiajia Li, and Ramakrishnan Kannan.IEEE International Parallel and Distributed Processing Symposium (IPDPS).T3
-
Machine Learning-Guided Memory Optimization for DLRM Inference on Tiered Memory.Bin Ma, Jie Ren, Shuangyan Yang, Benjamin Francis, Ehsan Ardestani, Min Si, and Dong Li.31st International Symposium on High-Performance Computer Architecture.T1T3 AI/DLRM
-
Enabling Large Dynamic Neural Network Training with Learning-based Memory Management.Jie Ren, Dong Xu, Shuangyan Yang, Jiacheng Zhao, Zhicheng Li, Christian Navasca, Chenxi Wang, Harry Xu, and Dong Li.30th International Symposium on High-Performance Computer Architecture (acceptance rate: 18%). [pdf]T1T3 AI/DL
-
A PEPS plugin for TNQVMSrikar Chundury, J. Lietz, E. A. C. Perez, A. Shehata, In-Saeng Suh and Frank Mueller.IEEE International Conference on Quantum Computing and Engineering (QCE).T3 Quantum Circuit Sim.
Theory & Algorithms
8 papers
▸
Thrust 4
Specialized Accelerator Architectures for Sparse Tensor Networks
-
Systolic Array Acceleration of Diagonal-Optimized Sparse-Sparse Matrix Multiplication for Efficient Quantum Simulation.Yuchao Su, Srikar Chundury, Jiajia Li, and Frank Mueller.ArXiv.T4 Quantum Circuit Sim. Reconfig./Systolic
-
FLAASH: Flexible Accelerator Architecture for Sparse High-Order Tensor Contraction.Gabriel Kulp, Andrew Ensinger, and Lizhong Chen.arXiv preprint arXiv:2404.16317.T4T2 Reconfig./Systolic
-
Parallel Sparse Tensor-times-Vector on Cerebras WSE-2Sai Krishna Teja Varm Manthena.M.S. Thesis, North Carolina State University.T4T2 Dataflow (Cerebras)
Computer Architecture
3 papers
▸
Application
Scenarios
21 papers
-
TIDES: Tiered Block-Sparse Tensor Contraction with Streaming Transpose on GPUs.Zecheng Li, Sri Harshavardhan Reddy Deverapalli, Yanbo Zhao, Frank Mueller, Karl Pierce, and Jiajia Li.The International Conference for High Performance Computing, Networking, Storage, and Analysis (SC).T1T2 Quantum Chem/Physics GPU
-
G-HEMP: Fast Multi-GPU Private Inference for Large-Scale GCNs with Homomorphic Encryption.Ran Ran, Zhaoting Gong, Zhaowei Li, Xianting Lu, Jiajia Li, and Wujie Wen.Conference on Machine Learning and Systems (MLSys).Security GPU
-
Diagonal-Budgeted Trotterization for Efficient Quantum Hamiltonian Simulation.Srikar Chundury, Blake Burgstahler, Jiajia Li, In-Saeng Suh, and Frank Mueller.ACM International Conference on Supercomputing (ICS).T3 Quantum Circuit Sim.
-
Recursive Sketched Interpolation: Efficient Hadamard Products of Tensor Trains.Zhaonan Meng, Yuehaw Khoo, Jiajia Li, and E. Miles Stoudenmire.ArXiv.T3 Quantum Physics
-
ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference.Han Meng, Danny Liu, and Dong Li.ArXiv.AI/Diffusion
-
Distributed Generative Inference of LLM at Internet Scales with Multi-Dimensional Communication Optimization.Jiu Chen, Shuangyan Yang, Xu Xiong, Hexiao Duan, Xinran Zhang, Jie Ren, and Dong Li.ArXiv.AI/LLM
-
CoCoDiff: Optimizing Collective Communications for Distributed Diffusion Transformer Inference Under Ulysses Sequence Parallelism.Bin Ma, Xingjian Ding, Tekin Bicer, Pengfei Su, and Dong Li.ArXiv.AI/Diffusion
-
Systolic Array Acceleration of Diagonal-Optimized Sparse-Sparse Matrix Multiplication for Efficient Quantum Simulation.Yuchao Su, Srikar Chundury, Jiajia Li, and Frank Mueller.ArXiv.T4 Quantum Circuit Sim. Reconfig./Systolic
-
ZenFlow: Enabling Stall-Free Offloading Training via Asynchronous Updates.Tingfeng Lan, Yusen Wu, Bin Ma, Zhaoyuan Sun, Rui Yang, Tekin Bicer, Dong Li and Yue Cheng.ArXiv.AI/LLM
-
NeuronMM: High-Performance Matrix Multiplication for LLM Inference on AWS Trainium.Dinghong Song, Jierui Xu, Weichu Yang, Pengfei Su and Dong Li.ArXiv.AI/LLM AI Accelerator
-
Machine Learning-Guided Memory Optimization for DLRM Inference on Tiered Memory.Bin Ma, Jie Ren, Shuangyan Yang, Benjamin Francis, Ehsan Ardestani, Min Si, and Dong Li.31st International Symposium on High-Performance Computer Architecture.T1T3 AI/DLRM
-
Performance Studies of Hypergraph Neural Networks (HGNNs) Using Tensor Representations.Ahmed Taimoor.M.S. Thesis, North Carolina State University.T1 AI/GNN
-
CONQURE: A Co-Execution Environment for Quantum and Classical Resources.Atulya Mahesh and Frank Mueller.International Workshop on Integrating High-Performance and Quantum Computing.Quantum Circuit Sim.
-
Fully Parallelized BP Decoding for Quantum LDPC Codes Can Outperform BP-OSD.Ming Wang, Ang Li, and Frank Mueller.arXiv preprint arXiv:2507.00254.Quantum Circuit Sim.
-
OpenMP-Q: Quantum Task Offloading in OpenMP.Swastik Mittal, Atulya Mahesh, and Frank Mueller.International Workshop on OpenMP.Quantum Circuit Sim.
-
Enabling Large Dynamic Neural Network Training with Learning-based Memory Management.Jie Ren, Dong Xu, Shuangyan Yang, Jiacheng Zhao, Zhicheng Li, Christian Navasca, Chenxi Wang, Harry Xu, and Dong Li.30th International Symposium on High-Performance Computer Architecture (acceptance rate: 18%). [pdf]T1T3 AI/DL
-
Efficient Tensor Offloading for Large Deep-Learning Model Training based on Compute Express Link.Dong Xu, Yuan Feng, Kwangsik Shin, Daewoo Kim, Hyeran Jeon, and Dong Li.30th USENIX Annual Technical Conference (acceptance rate: 15.7%). [pdf]T1 AI/DL
-
FASTEN: Fast GPU-accelerated Segmented Matrix Multiplication for Heterogenous Graph Neural NetworksKeren Zhou, Karthik Ganapathi Subramanian, Po-Hsun Lin, Matthias Fey, Binqian Yin, Jiajia Li.The 38th ACM International Conference on Supercomputing (ICS).T2 AI/GNN GPU
-
DiaQ: Efficient State-Vector Quantum SimulationSrikar Chundury, Jiajia Li, In-Saeng Suh and Frank Mueller.ArXiv.T1 Quantum Circuit Sim.
-
DiaQ: A Novel Quantum-Tailored Numerical FormatSrikar Chundury.M.S. Thesis, North Carolina State University.T1 Quantum Circuit Sim.
-
A PEPS plugin for TNQVMSrikar Chundury, J. Lietz, E. A. C. Perez, A. Shehata, In-Saeng Suh and Frank Mueller.IEEE International Conference on Quantum Computing and Engineering (QCE).T3 Quantum Circuit Sim.