Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification
2026-07-27 • Computer Vision and Pattern Recognition
Computer Vision and Pattern RecognitionArtificial IntelligenceMachine Learning
AI summaryⓘ
The authors study how to make multi-modal classification systems work well even when some types of input data (modalities) are missing during testing, which happens in real life due to issues like sensor failure. Instead of only focusing on blending available data sources, they propose a co-learning approach that encourages collaboration between different data types at both the feature and decision levels. They show their methods handle cases with varying amounts of missing data, performing differently depending on whether just one modality or almost all but one are missing. Their experiments demonstrate improved robustness compared to previous methods.
multi-modal classificationmissing modalitiesco-learningfeature-level fusiondecision-level fusionrobustnessmulti-modal datasensor failureprivacy constraints
Authors
Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard
Abstract
Multi-modal classification leverages complementary information across diverse data sources to enhance predictive performance. However, real-world scenarios subject to operational constraints, such as sensor failures or privacy restrictions, lead to inconsistent modality availability between training and inference times. To handle missing modalities, prior studies have mainly covered bimodal data setups and focused on designing robust fusion processes. Instead, we adopt a multi-modal co-learning framework that prioritizes inter-modal collaboration rather than multi-modal fusion. Specifically, we consider that any subset of modalities may be absent, without assuming predefined missing-modality patterns, an inference scenario we refer to as missing arbitrary modalities. To address this challenge, we introduce two alternative approaches that leverage information at both feature- and decision-level. Experiments on two multi-modal classification benchmarks demonstrate significant robustness gains in various missing modality conditions. The first method shows more robust behavior under minimal missing conditions, where a single modality is absent, whereas the second performs better under extreme missing conditions, where all-but-one modalities are missing. Our code is available at https://github.com/fmenat/Co4Miss.