{"as_of":"2026-08-10T04:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75fc1da14d764a87467f46aa50d2f3b9bd789e4b90da9518e26efc577e23cf65","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:10:26.201549Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11550/citation-record","integrity":"/paper/2506.11550/integrity","json":"/paper/2506.11550/citation-record.json","paper":"/paper/2506.11550"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:22.711341Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.711341Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:888dc38d78fb35cc88a6ec1c596735d36d3eee52c1d4d3c2847cb417286ddf5d","observation_id":"0a548648-f9e1-474f-bea7-08474783b0d5","resolution":{"observed_at":"2026-08-07T04:10:22.711341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:22.754631Z","title":"and Zisserman, A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.754631Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:30a73af530720ae8a9b37164ed23ef7d8e209d069f4ec741bd8a78e0f3e54b90","observation_id":"a37b3747-9691-4892-aaf4-a8838f5588c3","resolution":{"observed_at":"2026-08-07T04:10:22.754631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:22.825029Z","title":"G., Keutmann, M","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.825029Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:28a0ecb16a3f1f0e5eb860f044ee72070d4ec413e2cc25b52a6ab1e449cd4c39","observation_id":"ef675764-2246-43ac-9302-17998766915c","resolution":{"observed_at":"2026-08-07T04:10:22.825029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11059","last_updated":"2021-06-21T12:46:47Z","snapshot_observed_at":"2026-08-03T17:23:12.981213Z","submitted_at":"2021-06-21T12:46:47Z","title":"Improving Multi-Modal Learning with Uni-Modal Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11059","snapshot_observed_at":"2026-08-07T04:10:22.882216Z","title":"Improving multi-modal learning with uni-modal teachers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.882216Z"},"links":{"cited_paper":"/paper/2106.11059","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:9a7440fd2f595823986e36bbdf8a81a1d4802fd6d92c67bdd20dbf09ed0dcfe5","observation_id":"3a4a5f74-4125-4b6d-a635-0aaaf7dbd6b4","resolution":{"observed_at":"2026-08-07T04:10:22.882216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:30.571157Z","title":"On uni-modal feature learning in supervised multi-modal learning","venue":null,"work_id":"93478ec3-4666-4b01-8295-879331db6f49","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:22.938216Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:a96db30ee92f56f2ca2e1c8ac45dd5602476377c0cc026ef5adc373b6b81a2fe","observation_id":"1b778fed-948f-4364-9a02-7a15a5b8d1dd","resolution":{"observed_at":"2026-08-07T04:10:30.581147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:23.009270Z","title":"Pmr: Prototypical modal rebalance for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.009270Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:a4971c32b2f497c33a55ae6fdb1d25d6162bfad7aa025ba797307b422c87e422","observation_id":"d32cf719-3579-4c31-808a-781c5b578f4f","resolution":{"observed_at":"2026-08-07T04:10:23.009270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:30.530568Z","title":"Multimodal imbalance-aware gradient modulation for weakly-supervised audio-visual video parsing","venue":null,"work_id":"6833d176-888e-4286-aa55-a3cc6d452c56","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.076510Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:55dfe6b2d5cc794292e63d383cce7c411727ccbeb3ecc1096274713ce1e85f4e","observation_id":"0ac5d141-ba34-432e-a46b-bdce2cb1aa30","resolution":{"observed_at":"2026-08-07T04:10:30.536474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:30.348688Z","title":"and Zou, J","venue":null,"work_id":"d9683214-c0d8-4546-aa6f-8118e2e1e420","year":2020},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.142989Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:3102e5376c84e8b768363bfe974a3279445a0fffcf07156612a90ee1d4e0d0a3","observation_id":"3d89c427-7763-4a34-8d2c-90e16c49c61f","resolution":{"observed_at":"2026-08-07T04:10:30.501756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:30.039325Z","title":"and Piccardi, M","venue":null,"work_id":"58c12b4d-92e9-48c1-89f5-d0f623c375e5","year":2005},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.207396Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:e8d165081338cd98a75c567cc211cb04198e880c5807014d029a7d4a86b409ea","observation_id":"4c371302-6473-4e1a-9c27-2220902b6e49","resolution":{"observed_at":"2026-08-07T04:10:30.171070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:23.271112Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.271112Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:884ab570b215499689875ebeeb90f8faf3a6af22ba8b04505bcffbe20cc67190","observation_id":"ead9fb94-6b5e-4e7d-a6fa-451af295da41","resolution":{"observed_at":"2026-08-07T04:10:23.271112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.711860Z","title":"Multimodal temporal attention in sentiment analysis","venue":null,"work_id":"63ddc88e-b725-48f4-83d3-261b84111142","year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.327228Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:6d33bcc13bf5b56c011deaedd081f5b64d5c242f3425f1b7145db21971ca6b2e","observation_id":"49f68553-7711-4e61-a2b9-55abf0f5cece","resolution":{"observed_at":"2026-08-07T04:10:29.842232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1207.0580","last_updated":"2012-07-03T06:35:15Z","snapshot_observed_at":"2026-07-06T02:51:07.275676Z","submitted_at":"2012-07-03T06:35:15Z","title":"Improving neural networks by preventing co-adaptation of feature detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.0580","snapshot_observed_at":"2026-08-07T04:10:23.380389Z","title":"Improving neural networks by preventing co-adaptation of feature detectors","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.380389Z"},"links":{"cited_paper":"/paper/1207.0580","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:938713ac58af4be8c6d4452893cbb490034becec96f4f59db524b306f9d25dec","observation_id":"1948d1d7-4c49-4f0f-8181-5ecd58202e3b","resolution":{"observed_at":"2026-08-07T04:10:23.380389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:23.489321Z","title":"Modality competition: What makes joint training of multi-modal network fail in deep learning?(provably)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.489321Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:5dbe35e37dbe52239ce0fcacfd92f6f6bdc5c647bea1358422985989c5881541","observation_id":"32cd2ecb-c47d-4db9-be75-b762e021b3b7","resolution":{"observed_at":"2026-08-07T04:10:23.489321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:23.619934Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.619934Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:70d6840708d3e73ee363311fc5b262b3cafe125c00aafc20776e72e3b1347179","observation_id":"32118ad0-dc20-42cb-a51f-290795e1db07","resolution":{"observed_at":"2026-08-07T04:10:23.619934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T04:10:23.745725Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.745725Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:1a60f2441738a25ba93590a0dd4e9e4e3373b3c2b57143751418c6de0745b59d","observation_id":"5fc06bc0-4b0f-4b26-8797-9a98b0e95f33","resolution":{"observed_at":"2026-08-07T04:10:23.745725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.507396Z","title":"Efficient large-scale multi-modal classification","venue":null,"work_id":"965308e2-6df0-4ab2-bdce-407881e3a7ec","year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:23.880084Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:10446414ff7a12a148ebc91c95750540f55c64d8de5ee5fca2588239683a613b","observation_id":"c70e264f-0b6b-4362-bcac-496f4c08b55a","resolution":{"observed_at":"2026-08-07T04:10:29.594072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T04:10:24.025073Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.025073Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:0128c1fa8a558ec664dd284bb23d97e1b0227fda1b198e66311513cfff8b1573","observation_id":"829b936d-f245-4217-b538-1bef5d29f346","resolution":{"observed_at":"2026-08-07T04:10:24.025073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07930","last_updated":"2024-10-14T08:19:13Z","snapshot_observed_at":"2026-08-09T23:58:50.434017Z","submitted_at":"2024-05-13T17:01:28Z","title":"Improving Multimodal Learning with Multi-Loss Gradient Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07930","snapshot_observed_at":"2026-08-07T04:10:24.203659Z","title":"Improving multimodal learning with multi-loss gradient modulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.203659Z"},"links":{"cited_paper":"/paper/2405.07930","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:27e5703c842d4bc5de1c543463c2c59091a4112b7ca22dd6dd1fca805bef94ab","observation_id":"cd2bdb4f-e0cb-4b42-bdf5-ff41b9ad5c0b","resolution":{"observed_at":"2026-08-07T04:10:24.203659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.329058Z","title":"Boosting multi-modal model performance with adaptive gradient modulation","venue":null,"work_id":"915deade-d8a7-4ae0-b68f-09b1511471d2","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.312620Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:9594856a4c5d9ce34e8331870a0fd89e3e58f4160db1a36f415b449b2d68ce80","observation_id":"2933294e-1119-451e-8bef-39f6d905a80b","resolution":{"observed_at":"2026-08-07T04:10:29.375825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08536","last_updated":"2023-07-17T14:53:09Z","snapshot_observed_at":"2026-07-06T15:54:51.088869Z","submitted_at":"2023-07-17T14:53:09Z","title":"Variational Probabilistic Fusion Network for RGB-T Semantic Segmentation","version":1},"cited_work":{"arxiv_id":"2307.08536","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.08536","snapshot_observed_at":"2026-08-07T04:10:26.395439Z","title":"Variational Probabilistic Fusion Network for RGB-T Semantic Segmentation","venue":"cs.CV","work_id":"e5dcb732-ffef-4e03-89ba-d79a9245bf68","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.420906Z"},"links":{"cited_paper":"/paper/2307.08536","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:2d26bf54dd3f3f3c73f5f2a5d6033d131a7719532829af579ffb5a10ddd44c19","observation_id":"e0d6d25b-6979-43dd-ad18-4559de3f7fb9","resolution":{"observed_at":"2026-08-07T04:10:26.448724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-07T04:10:24.551100Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.551100Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:e31ee49239140fe3af7a59107d0dadeff247584709ed2c56f7bff1b4c1427975","observation_id":"96529e4a-2b61-424a-b6d0-e66114088001","resolution":{"observed_at":"2026-08-07T04:10:24.551100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.139780Z","title":"Y., et al","venue":null,"work_id":"538b73a6-23cc-4721-8844-38ae3f4bc95a","year":2011},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.643431Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:87bd40ddccb4114589b92a09ebc2c6c5c59c846a5734f77b59e6970b6cd75a22","observation_id":"73ac3bbb-77bb-44f7-85c7-7adf0d51a014","resolution":{"observed_at":"2026-08-07T04:10:29.222101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:29.004063Z","title":"and Efros, A","venue":null,"work_id":"43e07a78-2059-4460-9f04-1725cbdccf72","year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.731313Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:127eb36ec5e4e12e7be7bc2ccc1db1972c681d8f09a2c7a8bcd438cbddfad6ed","observation_id":"cfeb68f4-f573-4ade-85c5-d9de5a4c8155","resolution":{"observed_at":"2026-08-07T04:10:29.058207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:24.830032Z","title":"Balanced multimodal learning via on-the-fly gradient modulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.830032Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:51417ebeafccafec1127bfe0125f758323ac3933f043f6a1df1accfe7b137caa","observation_id":"8fb4b2a3-62e0-4ad5-8ecb-be3c553a1945","resolution":{"observed_at":"2026-08-07T04:10:24.830032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:24.900289Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.900289Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:82323458d8fbefae517df6bd27a4c8a6af3925bddfe6485e6238133dd5637a57","observation_id":"1baf4fb1-0daa-4f07-a19e-20c88c4711f3","resolution":{"observed_at":"2026-08-07T04:10:24.900289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.785267Z","title":"Graph interactive network with adaptive gradient for multi-modal rumor detection","venue":null,"work_id":"8ed5a795-1354-4758-9c71-211c399a2cbb","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:24.991403Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:05cf0044d6695f4cbaabb08152789ce7e24da75345c6c65aea2163cc1c12686b","observation_id":"05f3c57a-e8e3-46ab-b66c-22c2b7e279cd","resolution":{"observed_at":"2026-08-07T04:10:28.859950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.614651Z","title":"Learning to balance the learning rates between various modalities via adaptive tracking factor","venue":null,"work_id":"810ac292-860a-42c5-832a-6b4334c6ebd6","year":2021},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.076646Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:501008abfc0877cd7d1542f78d755fff0e9f6373c6d958c1c1179cc3bc1ee155","observation_id":"d590d297-cad3-497b-9b2f-61a353e0f4cd","resolution":{"observed_at":"2026-08-07T04:10:28.674407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:25.162190Z","title":"and Hinton, G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.162190Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:b9171d2dc91133f4eb636f1e331a5770059469a05d8f4d5946c1ed1dfa15852e","observation_id":"0b34001e-84c2-4555-b6f7-721dbb80dc7e","resolution":{"observed_at":"2026-08-07T04:10:25.162190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.422115Z","title":"Centralnet: a multilayer approach for multimodal fusion","venue":null,"work_id":"c38edc42-2935-44e3-b197-7372cb1814ad","year":2018},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.229454Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:839a2796e822de1e8363e39e100ab203c3531387c450a09e421d24035ee7fcf3","observation_id":"288b2044-a7b1-4cb0-b9cf-28828a11a4d8","resolution":{"observed_at":"2026-08-07T04:10:28.487663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.272742Z","title":"What makes training multi-modal classification networks hard? In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp.\\ 12695--12705, 2020","venue":null,"work_id":"6be85312-0a87-4ea3-8091-c4a99a5b6e6c","year":2020},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.320568Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:c6c2c36d201f3e28670befd76bf5d39287d121599a1352640cdd281439dba943","observation_id":"a7fb419c-4dec-44d9-9bf6-b689ff1b43ac","resolution":{"observed_at":"2026-08-07T04:10:28.330146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:28.097045Z","title":"and Hu, D","venue":null,"work_id":"635f3d53-1be2-4a02-b2d7-d28857723cce","year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.401392Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:9b3834fc96c52a0fb70e4223235354fb7d146a7164fb64cf1c8cfe8b20333417","observation_id":"5c509e4e-dfa4-401d-a12a-3cdbe95f0733","resolution":{"observed_at":"2026-08-07T04:10:28.135413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:25.506597Z","title":"Enhancing multimodal cooperation via sample-level modality valuation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.506597Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:01e034e9fc3a2cf1b35c70c92e817dbcdd46b8032b6070ea03730f3fd09cace4","observation_id":"8ce45d74-709e-4ecd-b3ec-b2aef8c70c21","resolution":{"observed_at":"2026-08-07T04:10:25.506597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:27.897333Z","title":"Diagnosing and re-learning for balanced multimodal learning","venue":null,"work_id":"8d59bc19-4da1-488b-8d39-c8fcfbe49fed","year":2025},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.602577Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:fcd11c549eac7ce3e40eab5762a9e5080deadb686b6585a2cfd5def42bdce586","observation_id":"29b606e7-f28d-40b4-8212-01f0a0aff8ff","resolution":{"observed_at":"2026-08-07T04:10:27.979270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:25.688411Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.688411Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:a09099f776f9d1e7a045611d655992430dc70d35d073759a9d03112b28833ff2","observation_id":"a9bae4a8-d686-43d7-bb35-31a1417d66df","resolution":{"observed_at":"2026-08-07T04:10:25.688411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:27.685787Z","title":"Mmcosine: Multi-modal cosine loss towards balanced audio-visual fine-grained learning","venue":null,"work_id":"e61b61d1-afcf-487e-a7df-a992b4df893b","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.766512Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:ceea5c8b211639fbf44131e8e4790fe1bc2e6b4f21722b06cfeb0a61e9c99c77","observation_id":"1a3b309f-37d9-476f-b68c-ae2d1a87ea43","resolution":{"observed_at":"2026-08-07T04:10:27.768250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:27.500671Z","title":"Mcl: A contrastive learning method for multimodal data fusion in violence detection","venue":null,"work_id":"ae721352-5df5-4f7b-94b9-c23398b485a5","year":2022},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.847513Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:5f65b913607e8f32239faca50b9218e28e99477ed216b36077ade8904dacc8c4","observation_id":"605b493c-a82f-42e1-90fd-fe0e7eb854fe","resolution":{"observed_at":"2026-08-07T04:10:27.580294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18947","last_updated":"2024-11-01T13:53:44Z","snapshot_observed_at":"2026-07-06T18:07:14.918612Z","submitted_at":"2024-04-27T07:22:28Z","title":"Multimodal Fusion on Low-quality Data: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18947","snapshot_observed_at":"2026-08-07T04:10:25.936570Z","title":"Multimodal fusion on low-quality data: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:25.936570Z"},"links":{"cited_paper":"/paper/2404.18947","citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:430e3fa70da17e28e3d337a076686fe34fef565d6c0ee21c090138cf0419421b","observation_id":"1c9965ad-39f0-4d8c-ae8e-101dd49b6895","resolution":{"observed_at":"2026-08-07T04:10:25.936570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:27.198634Z","title":"Multimodal representation learning by alternating unimodal adaptation","venue":null,"work_id":"d1d6e319-22d7-4859-88b4-02318b134ae8","year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:26.028364Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:55ec07f58475af37cef9ea246afdff577c8eafe24619c980b1e27c52c2d318c9","observation_id":"e1544be6-de22-4c7b-9047-00e9578606a1","resolution":{"observed_at":"2026-08-07T04:10:27.355798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:26.886922Z","title":"Adaptive mask co-optimization for modal dependence in multimodal learning","venue":null,"work_id":"65fe9e8a-db09-4d79-9f44-2a326c1ea62e","year":2023},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:26.117608Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:fe4338416644817bf9dafc3625608937f48d23f14f3377d3b53fb1a2ec672a6e","observation_id":"0b6ee059-eb55-4e7d-81ed-512085d0e225","resolution":{"observed_at":"2026-08-07T04:10:27.048028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:26.703245Z","title":"Vision+ x: A survey on multimodal learning in the light of data","venue":null,"work_id":"63884c98-f87f-4ff7-adcd-47cdf38b21bc","year":2024},"citing_paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:26.201549Z"},"links":{"citing_paper":"/paper/2506.11550"},"observation_digest":"sha256:54641cb9e285133def9a775c4e30da49bdb9140ece78f63d3597aa1d4535e115","observation_id":"af26b6f3-d4ed-4fa4-9486-f6282cc8deac","resolution":{"observed_at":"2026-08-07T04:10:26.779388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11550","last_updated":"2025-06-16T02:50:29Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:02:08.204203Z","submitted_at":"2025-06-13T08:01:29Z","title":"Improving Multimodal Learning Balance and Sufficiency through Data Remixing"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.11550."}