{"as_of":"2026-08-11T03:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3f75463e0a67bb70ab20b7c6e93d359a45b77c2a0f4b09b99684c27dccda551","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:42:02.959815Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:12:16.490080Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:36:17.633556Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"cited_work":{"arxiv_id":"2507.10203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10203","snapshot_observed_at":"2026-07-01T22:36:17.633556Z","title":null,"venue":null,"work_id":"da9d241a-8ac9-4001-abf4-97fad24a5209","year":2025},"citing_paper":{"arxiv_id":"2606.02679","last_updated":"2026-06-01T14:20:12Z","snapshot_observed_at":"2026-08-04T20:09:52.630544Z","submitted_at":"2026-06-01T14:20:12Z","title":"Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T15:12:16.490080Z"},"links":{"cited_paper":"/paper/2507.10203","citing_paper":"/paper/2606.02679"},"observation_digest":"sha256:9253717afb241578a11fe095f23bffe12eb3a93b1abb0858234177b02740181d","observation_id":"8af3ae09-e80d-4609-a093-83081d5132f9","resolution":{"observed_at":"2026-07-01T22:36:17.634863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10203/citation-record","integrity":"/paper/2507.10203/integrity","json":"/paper/2507.10203/citation-record.json","paper":"/paper/2507.10203"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.147756Z","title":"Deep audio-visual speech recognition","venue":null,"work_id":"f3546bb9-28e9-4681-ade7-dbc2fc24340f","year":2018},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:00.907865Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:b788dd4f4302eba9141472d511b9e557d34480858a570fdc9617cbf8395cb605","observation_id":"908ea99e-ec7f-4dab-807d-281ef5ee7609","resolution":{"observed_at":"2026-08-06T17:42:05.151546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.137619Z","title":"Learnable irrelevant modality dropout for multimodal action recogni- tion on modality-specific annotated videos","venue":null,"work_id":"8da35c97-a16c-4bce-a287-668cb565b8ab","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:00.974590Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:2d380424119470ee71a1bc741bf62c3debd06007fe676ec94b845ff8aa47cf67","observation_id":"870ef843-6124-4d69-8c27-a8dfb638175c","resolution":{"observed_at":"2026-08-06T17:42:05.141154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.127164Z","title":"Look, listen and learn","venue":null,"work_id":"5bb783e7-b539-4ab9-a54b-de34ff60cce0","year":2017},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.047579Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:f260a5ef3537a2976c37c76bdb71524915bccfd522d126fd219ade049d11e409","observation_id":"5689b35d-f4aa-4a65-800a-f9e6599055b4","resolution":{"observed_at":"2026-08-06T17:42:05.130252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.117166Z","title":"Mmnet: A model-based multimodal net- work for human action recognition in rgb-d videos","venue":null,"work_id":"20a52eba-108b-45f4-8c74-224b13d6e239","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.094069Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:98c1f44655997a220f8910216d40f8675100ab3815423c2e182ec1d7ead42da1","observation_id":"d8f66f01-31ac-4c14-afc7-46ee85adeb91","resolution":{"observed_at":"2026-08-06T17:42:05.121056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.106574Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset","venue":null,"work_id":"9354d710-91fb-4f5a-8f4a-239b434c9e81","year":2014},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.192538Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:86a8711e2bc96596821af3d2426bbbcf4d985b6761b816dec975f8fa51fb6d46","observation_id":"bb8cf2b1-9d6e-4b50-9db1-f193c67532a9","resolution":{"observed_at":"2026-08-06T17:42:05.110239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.096088Z","title":"Shapeconv: Shape- aware convolutional layer for indoor rgb-d semantic segmen- tation","venue":null,"work_id":"faf48949-4611-4786-a785-6e08a8601f7d","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.239618Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:b673b2568be6617783e9985f19694655b9a7195da276dcf30474ce57c908757d","observation_id":"27e970f0-5db4-499f-b479-0edbc255f275","resolution":{"observed_at":"2026-08-06T17:42:05.099921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.086450Z","title":"Mars: Motion-augmented rgb stream for action recognition","venue":null,"work_id":"b11de41b-b331-4cec-9fd3-06bb6dcb1777","year":2019},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.302791Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:3e7d52b5c44bba95f63bad7470df64746e057359e4100f0c2d811888e5bcc2af","observation_id":"090b2373-3d58-4812-acf2-52839de0e9f6","resolution":{"observed_at":"2026-08-06T17:42:05.089975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.076231Z","title":"Rfnet: Region-aware fusion network for incomplete multi-modal brain tumor seg- mentation","venue":null,"work_id":"ceb4961e-9106-47e5-8b26-a4d434f54960","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.367594Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:9a2e5a8719c4797b8c52340b5597c74ba9396f3dc3d67a027d5dff05f44896b6","observation_id":"d70d8552-957f-4f2d-93db-df5c5f1a49c9","resolution":{"observed_at":"2026-08-06T17:42:05.079799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11059","last_updated":"2021-06-21T12:46:47Z","snapshot_observed_at":"2026-08-03T17:23:12.981213Z","submitted_at":"2021-06-21T12:46:47Z","title":"Improving Multi-Modal Learning with Uni-Modal Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11059","snapshot_observed_at":"2026-08-06T17:42:01.435643Z","title":"Improving multi- modal learning with uni-modal teachers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.435643Z"},"links":{"cited_paper":"/paper/2106.11059","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:e9f0db121eebc9ed9c5ea89fa2958de6c61d45b93d2b96182da7cbce6fa09976","observation_id":"56ae7472-50dd-4a9d-a811-b6ccc6b54b98","resolution":{"observed_at":"2026-08-06T17:42:01.435643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.066412Z","title":"Pmr: Prototypical modal rebalance for multi- modal learning","venue":null,"work_id":"25d44512-12d6-43df-a437-8fbe6a420358","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.475058Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:11720d6d3f99eeac25954cb04f43a522d80f103c1e953e124a8d3edb3a185331","observation_id":"80d8db26-e4da-4b2c-a730-c0baa53087b0","resolution":{"observed_at":"2026-08-06T17:42:05.070117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.057037Z","title":"Modal- ity distillation with multiple stream networks for action recognition","venue":null,"work_id":"2e07f623-c4ed-42fe-89f5-5fadbe65b0da","year":2018},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.530044Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:62f476eaf162805cf66837ef8e680f7c574b1bc35a9d8802ce0cee18f24208ca","observation_id":"a2c688b3-b0a8-4981-a291-8b13f3bc6926","resolution":{"observed_at":"2026-08-06T17:42:05.060418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.047125Z","title":"Ensembles of classifiers: a bias-variance perspective","venue":null,"work_id":"8e909bbd-9998-4e00-b320-59d56f10c2df","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.569455Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:26c9efbe6d7b022cf37457dd0ddff0ab82b7b4ad1c76995b234b961f1d925ba4","observation_id":"beb8b611-420f-4c29-803a-3ddf8c140bd8","resolution":{"observed_at":"2026-08-06T17:42:05.050546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.037072Z","title":"Deep multimodal multilinear fusion with high- order polynomial pooling","venue":null,"work_id":"82439d3b-e523-4146-9cd4-9d4ba51cb78b","year":2019},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.582058Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:39f4c3d1cb8dc69aab1796a7a2270b04a0a6674897bb719676b7189234f757e9","observation_id":"c83e7b7a-be43-4e5d-832c-746131b003f8","resolution":{"observed_at":"2026-08-06T17:42:05.040940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.027607Z","title":"Acnet: Attention based network to exploit complementary features for rgbd semantic segmentation","venue":null,"work_id":"9b43d43b-ea30-4ee5-aed5-800ecbf46931","year":2019},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.614728Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:f1b9405bdcb54d2ea8971e180e2d17828d16de48c8dd2edae9855ec9e0e7b3a0","observation_id":"6627c548-462e-4f12-a30a-35a3182e0432","resolution":{"observed_at":"2026-08-06T17:42:05.031071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09321","last_updated":"2024-05-15T13:22:39Z","snapshot_observed_at":"2026-07-06T18:14:41.996656Z","submitted_at":"2024-05-15T13:22:39Z","title":"ReconBoost: Boosting Can Achieve Modality Reconcilement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09321","snapshot_observed_at":"2026-08-06T17:42:01.658660Z","title":"Reconboost: Boosting can achieve modal- ity reconcilement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.658660Z"},"links":{"cited_paper":"/paper/2405.09321","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:be8f51310d302ac2c2d6a9f83cf2d0a4ece1b4007da1446449f97ca043366e84","observation_id":"0272ce6d-d5ea-4e57-b70d-0bd55f980b6a","resolution":{"observed_at":"2026-08-06T17:42:01.658660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.018170Z","title":"Cdnet: Complementary depth network for rgb-d salient object detection","venue":null,"work_id":"9d4ae251-5896-4d30-998e-9a1bee954466","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.721838Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:f290c60a48f3a1696aaff3e4baa5bc5d6989eb1313ad3bb63b24dad88c7e460a","observation_id":"062b0f28-00f9-437d-981a-8897d25e22cf","resolution":{"observed_at":"2026-08-06T17:42:05.021501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:05.008722Z","title":"Mmtm: Multimodal transfer module for cnn fusion","venue":null,"work_id":"bf9d6147-7e5d-4b89-aa1b-263d25e4453b","year":2020},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.743758Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:ede3b2e898c60002a703983ca705e6c9716f747edd062da05e2118c9f87ee760","observation_id":"b8f3358e-4e2b-4b2a-a6d2-b51f2adb0d91","resolution":{"observed_at":"2026-08-06T17:42:05.012004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.998235Z","title":"Boosting multi-modal model performance with adaptive gradient modulation","venue":null,"work_id":"57b4ee18-2a05-4c5c-9cc8-603e0e0a823f","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.771670Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:046d5a9c36c26fc86e5915828656f82dade5fc2a2315b9836761080adad8abdd","observation_id":"6b7095c3-04d1-4a47-88c5-843a16aacd69","resolution":{"observed_at":"2026-08-06T17:42:05.002777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.988003Z","title":"Dynamic- hierarchical attention distillation with synergetic instance se- lection for land cover classification using missing hetero- geneity images","venue":null,"work_id":"7e1b5cf9-4586-4b4e-a559-a5faf5f4b2ce","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.861690Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:5a9f532c640fe179933c4c0d89f81fb5a95730e642a47e6e6973a105f6d5e1ab","observation_id":"36d3755b-6146-47a6-a8f8-f9abcd328aa8","resolution":{"observed_at":"2026-08-06T17:42:04.992315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.978002Z","title":"librosa: Audio and music signal analysis in python","venue":null,"work_id":"33a04f22-8ec7-4a4f-805a-fe05bee82ae1","year":2015},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.907379Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:a73ef4e10707d194539d85587fdc3f632baadcccfa07773af9b11f5cc004ec94","observation_id":"e53318f0-d5f0-4354-b788-35161b0ee046","resolution":{"observed_at":"2026-08-06T17:42:04.981996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.967612Z","title":"Balanced multimodal learning via on-the-fly gradient modulation","venue":null,"work_id":"94cb3b25-a177-4bc5-93bf-55db69dbf9f8","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:01.946357Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:711e48f46180badac27192563242749d34d00f8efa85b3a9c5a1041800db3c7a","observation_id":"ee519e5c-5c5f-4ad7-9ca9-227dce635116","resolution":{"observed_at":"2026-08-06T17:42:04.971752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.957445Z","title":"Efficient rgb-d seman- tic segmentation for indoor scene analysis","venue":null,"work_id":"8b2a2b32-fd1b-43a1-a7c6-11d0847c8f4f","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.002098Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:ba629d3206c1eb8cf74fd70243b226fe83cb11eed5a001bcbcf13974c31bfe68","observation_id":"67e67f09-9c36-4f60-a186-b9c7e0ca4750","resolution":{"observed_at":"2026-08-06T17:42:04.961492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.948055Z","title":"Opti- mizing ensemble weights and hyperparameters of machine learning models for regression problems","venue":null,"work_id":"340aaa1e-4070-4c59-9938-c73f4027a27a","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.060228Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:88dfba835405dfb30d80776cf4b26966ed46482b4be601dc6fb94d005a6225a2","observation_id":"0192a209-8e5d-4645-8027-d2db3ea6a060","resolution":{"observed_at":"2026-08-06T17:42:04.951626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.802978Z","title":"Multimodal sparse transformer network for audio-visual speech recognition","venue":null,"work_id":"e4319dee-93d0-4b15-a544-c8370b9b6c68","year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.087880Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:5ac7d4a87a8d193083f9cd42b4aca7023cbe910167c2e3213e028421c951683c","observation_id":"af0e8584-6fdf-461a-a0cb-56e518cce116","resolution":{"observed_at":"2026-08-06T17:42:04.860641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T17:42:02.125314Z","title":"Soomro, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.125314Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:995f97e727309134a8f0b14e17689a40d5c3241522ea037856b27d47886f60ab","observation_id":"7ae7a4cc-7c28-4ff6-82ff-e75541299bee","resolution":{"observed_at":"2026-08-06T17:42:02.125314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.689992Z","title":"Deep rgb-d saliency detection with depth-sensitive attention and automatic multi-modal fusion","venue":null,"work_id":"a6f479c1-6089-4d5f-a752-21f294108202","year":2021},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.175483Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:637d870b4b8dfbb9aea0b9c290bcdc87ff7304db8c82ea87b39e212990db30b9","observation_id":"0acac3b4-316a-4cc4-86dc-af2521c4ed4c","resolution":{"observed_at":"2026-08-06T17:42:04.741289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.484329Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"0af62350-54b0-464f-b3a1-5435e0997b93","year":2018},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.219731Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:230315d7ad660802bd1a6012b87fe51ef1323f65e8034a5b3932dd238ebbe5d3","observation_id":"b922028d-6634-4da3-ae14-96e1d85b9947","resolution":{"observed_at":"2026-08-06T17:42:04.535266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.312528Z","title":"What makes train- ing multi-modal classification networks hard? In Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 12695–12705, 2020","venue":null,"work_id":"b0fd10e5-a594-4339-823e-a84624f5d0d3","year":2020},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.281677Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:8466d16b2abe810677a6b8d8fecd4466c54dea85e600fde5f010ab21e7802634","observation_id":"c856842f-733f-4573-b385-e55543701bf7","resolution":{"observed_at":"2026-08-06T17:42:04.413808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.252546Z","title":"Mmanet: Margin- aware distillation and modality-aware regularization for in- complete multimodal learning","venue":null,"work_id":"26bae2ce-dbb9-4640-a924-ca55e7531ee2","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.317836Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:90d616372379412346a275f31235e4a6220b14b74586294b114974736430c5fa","observation_id":"59291014-997e-4f04-a81f-2007525ac98b","resolution":{"observed_at":"2026-08-06T17:42:04.283705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:04.065232Z","title":"Mmanet: Margin- aware distillation and modality-aware regularization for in- complete multimodal learning","venue":null,"work_id":"f438957a-90ea-4120-83bf-8d206da21615","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.358422Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:cc131614f79216270e049e403a50ef52799fd5d90d69ef3f29b5eccac84762bb","observation_id":"1d5ef1b2-0672-4333-8fb5-06ff6fcf2195","resolution":{"observed_at":"2026-08-06T17:42:04.186328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.984854Z","title":"Privi- leged modality learning via multimodal hallucination","venue":null,"work_id":"f0d80f79-75e5-4b0c-8de3-c984c888d16b","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.426869Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:17a3c9dd92a8bf88ef495fb90a3bf3911621b821d43b9323cb918b3d87aa5dab","observation_id":"a6ff03a9-47fb-497f-b4fb-671c8c11c719","resolution":{"observed_at":"2026-08-06T17:42:04.016758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.794437Z","title":"Msh- net: Modality-shared hallucination with joint adaptation dis- tillation for remote sensing image classification using miss- ing modalities","venue":null,"work_id":"f72fbcf2-b15f-47f4-a75f-158b55bc399e","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.448344Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:a6da4b1bab98676ea3d2ccd453c03560e0509deb5efdf4745d83317b73142611","observation_id":"f5ecd532-4afe-44ae-95bf-6d0e6b01be2c","resolution":{"observed_at":"2026-08-06T17:42:03.900389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.639287Z","title":"Ro- bust multimodal learning via representation decoupling","venue":null,"work_id":"008f9fe1-a59a-4083-bfb1-f76a43a135b4","year":2025},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.485015Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:5998cb2634fa2b23f0a1c1650c77ac81ddd446313bdc802ff280b8971046a146","observation_id":"a54a07cb-2b5e-442a-b59a-45a13b5a8303","resolution":{"observed_at":"2026-08-06T17:42:03.713025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17730","last_updated":"2024-05-28T01:19:13Z","snapshot_observed_at":"2026-07-06T18:21:01.419111Z","submitted_at":"2024-05-28T01:19:13Z","title":"MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17730","snapshot_observed_at":"2026-08-06T17:42:02.520141Z","title":"Mmpareto: Boosting multimodal learning with innocent unimodal assistance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.520141Z"},"links":{"cited_paper":"/paper/2405.17730","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:fdae704148de48666d37777e85d5d8fef72c712a58c26d00565f12ea3351c477","observation_id":"30d0020c-f429-42a9-b865-e681c224d742","resolution":{"observed_at":"2026-08-06T17:42:02.520141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06255","last_updated":"2024-06-14T03:37:46Z","snapshot_observed_at":"2026-08-10T02:20:02.272987Z","submitted_at":"2023-09-12T14:16:34Z","title":"Enhancing multimodal cooperation via sample-level modality valuation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06255","snapshot_observed_at":"2026-08-06T17:42:02.566239Z","title":"Enhanc- ing multi-modal cooperation via fine-grained modality valu- ation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.566239Z"},"links":{"cited_paper":"/paper/2309.06255","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:64172c267be07c2382865189de5e1c7ab84e40bfb09c9cd95bcd53489cf9d40f","observation_id":"e355758e-f3be-4d03-86c2-1655b43641ce","resolution":{"observed_at":"2026-08-06T17:42:02.566239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.427563Z","title":"Diagnos- ing and re-learning for balanced multimodal learning","venue":null,"work_id":"15fe780c-8a71-417a-af9c-6c2ede56513c","year":2025},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.609679Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:6911342bf72c29ba7c5668d9c652e1bf4db06cc9d71bad809f3e26d49815af0e","observation_id":"7a548bbe-b269-40e5-8bf3-8f26c8278e7d","resolution":{"observed_at":"2026-08-06T17:42:03.489911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.330867Z","title":"Mmcosine: Multi-modal cosine loss towards balanced audio-visual fine-grained learning","venue":null,"work_id":"a1370a9b-f14f-45bf-b60c-c148260b82ea","year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.692351Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:5f74a7e8a318cf37b3a5e333b87cc8a76f0ad182b2fc8ce040e2aa22680a454f","observation_id":"ffa7e1c7-f67d-46af-91c2-b881c1addf4c","resolution":{"observed_at":"2026-08-06T17:42:03.366133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:42:03.064811Z","title":"Multi-attention recurrent network for human communication comprehen- sion","venue":null,"work_id":"fb9f48ef-ef4b-4f69-ab14-563524c481f5","year":2018},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.807931Z"},"links":{"citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:4119a3142ba2d0a36a56cf9f32d243aa12c046469442b6ae9f955de707ba8325","observation_id":"60cfb31d-c657-4b08-b8d3-bebbaed4bc1d","resolution":{"observed_at":"2026-08-06T17:42:03.198760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18947","last_updated":"2024-11-01T13:53:44Z","snapshot_observed_at":"2026-07-06T18:07:14.918612Z","submitted_at":"2024-04-27T07:22:28Z","title":"Multimodal Fusion on Low-quality Data: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18947","snapshot_observed_at":"2026-08-06T17:42:02.854888Z","title":"Multimodal fusion on low-quality data: A comprehen- sive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.854888Z"},"links":{"cited_paper":"/paper/2404.18947","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:1a165e911dda7acf4768f4235a01df65dc69bb98c10e602cf6eade74430451b2","observation_id":"ba50fa90-47be-42f5-bc90-c4aab0e3ba35","resolution":{"observed_at":"2026-08-06T17:42:02.854888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10707","last_updated":"2024-04-01T16:56:13Z","snapshot_observed_at":"2026-08-03T06:11:41.428440Z","submitted_at":"2023-11-17T18:57:40Z","title":"Multimodal Representation Learning by Alternating Unimodal Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10707","snapshot_observed_at":"2026-08-06T17:42:02.885780Z","title":"Multimodal representation learning by alternating uni- modal adaptation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.885780Z"},"links":{"cited_paper":"/paper/2311.10707","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:6a2da6bb0dffc99c1c236b596e0638c23331ea14a8d91488417823f3e717def4","observation_id":"f6b29080-2a50-46d5-9158-63c17ac97e5d","resolution":{"observed_at":"2026-08-06T17:42:02.885780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02425","last_updated":"2022-08-04T07:23:42Z","snapshot_observed_at":"2026-08-10T16:26:32.959895Z","submitted_at":"2022-06-06T08:41:56Z","title":"mmFormer: Multimodal Medical Transformer for Incomplete Multimodal Learning of Brain Tumor Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02425","snapshot_observed_at":"2026-08-06T17:42:02.959815Z","title":"mmformer: Multimodal medical transformer for in- complete multimodal learning of brain tumor segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:42:02.959815Z"},"links":{"cited_paper":"/paper/2206.02425","citing_paper":"/paper/2507.10203"},"observation_digest":"sha256:ebb9171c0ab3881b100aec8104476126da70471963d96569fb00cc0ae5a62a0c","observation_id":"5739ee6a-c6da-41a1-bafb-e20cd885e131","resolution":{"observed_at":"2026-08-06T17:42:02.959815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10203","last_updated":"2025-07-21T08:29:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:34:42.039500Z","submitted_at":"2025-07-14T12:14:57Z","title":"Improving Multimodal Learning via Imbalanced Learning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2507.10203."}