A 28nm 0.22uJ/Token Memory-Compute-Intensity-Aware CNN-Transformer Accelerator with Hybrid-Attention-Based Layer-Fusion and Cascaded Pruning for Semantic-Segmentation

Abstract

Co-Corresponding Author, The First Hong Kong AI Chip at ISSCC

Publication
International Solid-State Circuits Conference (ISSCC), San Francisco, USA