Zihao Liu

I am currently a joint Ph.D. student at Beijing Zhongguancun Academy (ZGCA) and Harbin Institute of Technology, Shenzhen (HITsz), supervised by Prof. Dr. Zhuotao Tian.

Research Interests

AI for Games, Video Understanding, Video Anomaly Detection, Multi-modal Large Language Models.

News

  • 2026.04.10: Our new preprint paper of efficient & streaming & open-world VAD is available on ArXiv.
  • 2026.01.27: One paper accepted to ICLR 2026.

Education

Beijing Zhongguancun Academy logo Harbin Institute of Technology logo

Beijing Zhongguancun Academy & Harbin Institute of Technology, Shenzhen

2026 – Present

Ph.D. Student · Joint Training Program

Supervisor: Prof. Dr. Zhuotao Tian

Communication University of China

2023 – 2026

Signal and Information Processing, Master's Degree

Supervisor: Xiaoyu Wu
GPA: 3.8/4.0

Communication University of China

2019 – 2023

Digital Media Technology, Bachelor's Degree

GPA: 3.8/4.0

Academic Service

  • Reviewer for IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI).

Publications

Paper Thumbnail

ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions

Zihao Liu, Xiaoyu Wu*, Wenna Li, Jianqin Wu, Linlin Yang.

ArXiv, under review, 2026

[ArXiv] [Code]

Paper Thumbnail

Rethinking Metrics and Benchmarks of Video Anomaly Detection

Zihao Liu, Xiaoyu Wu*, Wenna Li, Linlin Yang, Shengjin Wang.

ArXiv, under review, 2025

[ArXiv] [Code]

Paper Thumbnail

Language-guided Open-world Video Anomaly Detection under Weak Supervision

Zihao Liu, Xiaoyu Wu*, Jianqin Wu, Xuxu Wang, Linlin Yang.

ICLR 2026

[ArXiv] [Code]

Paper Thumbnail

Enhancing Video Anomaly Understanding via Multi-Task Instruction Tuning

Xuxu Wang, Xiaoyu Wu*, Zihao Liu

IEEE Signal Processing Letters (SCI-Q2), 2025

[Link]

Paper Thumbnail

LoCo-MAD: Long-Range Context-Enhanced Model Towards Plot-Centric Movie Audio Description

Jiayi Wang, Zihao Liu, Xiaoyu Wu*.

ACCV'24 (CCF-C), 2024

[PDF] [Code]

Paper Thumbnail

Adaptively Building a Video-language Model for Video Captioning and Retrieval without Massive Video Pretraining

Zihao Liu, Xiaoyu Wu*, Shengjin Wang, Jiayao Qian.

ACM MM'24 (CCF-A), 2024

[PDF] [supp] [Code]

Paper Thumbnail

Violent Video Recognition Based on Global-local Visual and Audio Contrastive Learning

Zihao Liu, Xiaoyu Wu*, Shengjin Wang, Yimeng Shang.

IEEE Signal Processing Letters (SCI-Q2), 2024

[Link]

Paper Thumbnail

Semantic Multimodal Violence Detection Based on Local-to-global Embedding

Yujiang Pu, Xiaoyu Wu*, Shengjin Wang, Yuming Huang, Zihao Liu, Chaonan Gu

Neurocomputing (SCI-Q1), 2022

[PDF]