FormNetV2: Multimodal Graph Contrastive Learning for Form Document Information Extraction
Chen-Yu Lee, Chun-Liang Li, Hao Zhang +13 authors
FormNetV2 uses a centralized multimodal graph contrastive learning approach to improve self-supervised pre-training and achieves state-of-the-art performance on form understanding benchmarks with a compact model.