Close

Session

Research Manuscript
:
Breaking Barriers: Compute-in-Memory for Transformer Acceleration
DescriptionThis session highlights groundbreaking innovations in Compute-in-Memory (CIM) architectures designed to accelerate large-scale transformer models and alleviate data transfer bottlenecks. It covers various optimization strategies, from CIM-based solutions for attention computation in large language models (LLMs) to efficient memory management for long-context inference. The session delves into software-hardware co-design techniques, including irregular attention sparsity, outlier-aware quantization, Mixture-of-Experts (MoE) approaches, 3D hybrid bonding, and novel asynchronous execution methods.
Event Type
Research Manuscript
TimeWednesday, June 253:30pm - 5:30pm PDT
Location3001, Level 3
Topics
Design
Tracks
DES2B: In-memory and Near-memory Computing Architectures, Applications and Systems
Presentations
3:30pm - 3:45pm PDTDIAS: Distance-based Attention Sparsity for Ultra-Long-Sequence Transformer with Tree-like Processing-in-Memory Architecture
DES2B: In-memory and Near-memory Computing Architectures, Applications and Systems
3:45pm - 4:00pm PDTAttenPIM: Accelerating LLM Attention with Dual-mode GEMV in Processing-in-Memory
DES2B: In-memory and Near-memory Computing Architectures, Applications and Systems
4:00pm - 4:15pm PDTSplitSync: Bank Group-Level Split-Synchronization for High-Performance DRAM PIM
DES2B: In-memory and Near-memory Computing Architectures, Applications and Systems
4:15pm - 4:30pm PDTPIMoE: Towards Efficient MoE Transformer Deployment on NPU-PIM System through Throttle-Aware Task Offloading
DES2B: In-memory and Near-memory Computing Architectures, Applications and Systems
4:30pm - 4:45pm PDTSupporting Register-based Addressing Modes for in-DRAM PIM ISAs
DES2B: In-memory and Near-memory Computing Architectures, Applications and Systems
4:45pm - 5:00pm PDTOutlierCIM: Outlier-Aware Digital CIM-Based LLM Accelerator with Hybrid-Strategy Quantization and Unified FP-INT Computation
DES2B: In-memory and Near-memory Computing Architectures, Applications and Systems
5:00pm - 5:15pm PDTNear-Memory LLM Inference Processor based on 3D DRAM-to-logic Hybrid Bonding
DES2B: In-memory and Near-memory Computing Architectures, Applications and Systems
5:15pm - 5:30pm PDTSeIM: In-Memory Acceleration for Approximate Nearest Neighbor Search
DES2B: In-memory and Near-memory Computing Architectures, Applications and Systems