{"as_of":"2026-08-19T04:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f06648d893b206cfa8395afa69a92a2eb17dea2d8fefb9e224f9753d4223131","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:09:43.057849Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11465/citation-record","integrity":"/paper/2506.11465/integrity","json":"/paper/2506.11465/citation-record.json","paper":"/paper/2506.11465"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:38.068767Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.068767Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:79d5d629b2dff7f435e30c52e484008a0584bdf7e5a6cf8a5bed5ea6349f0627","observation_id":"50dfc4cd-ded7-4194-bd00-11fd38177eae","resolution":{"observed_at":"2026-08-07T04:09:38.068767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.554832Z","title":"and Zisserman, A","venue":null,"work_id":"1a29b977-9e2f-41b8-af31-b21883566877","year":2017},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.226847Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:47621742c3f505cb9ffe66900e968499684f3574464cf91f0be1df868145e358","observation_id":"d76e886a-75f2-4af7-a52a-86e4cffbefcb","resolution":{"observed_at":"2026-08-07T04:09:49.559290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.539472Z","title":"Singular value decomposition tutorial","venue":null,"work_id":"d9889f9c-aa4e-4e65-b1c7-cbde05e9ec6f","year":2005},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.350243Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:0ca8dba3f9c5d95a54ed77f64e74bb3109fbac137fa6c1b76c7bad5cad55d31e","observation_id":"09d7dbc0-1d54-49b5-a6f2-ecb3c3651dfa","resolution":{"observed_at":"2026-08-07T04:09:49.544180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.525415Z","title":"Multimodal machine learning: A survey and taxonomy","venue":null,"work_id":"ae8c826c-4a00-4292-b258-74d981fb312e","year":2018},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.427179Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:233f4d0716536b8ef6d5733a0db150e953aadccf76e6c315b7a711af193b6476","observation_id":"82bf73e3-e43b-46b8-8094-7ab82b49670d","resolution":{"observed_at":"2026-08-07T04:09:49.530010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.510843Z","title":"Training stochastic model recognition algorithms as networks can lead to maximum mutual information estimation of parameters","venue":null,"work_id":"4c1a5286-f55b-4f32-9e85-8e5ceaf2cf91","year":1989},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.498054Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:3c6086f0420f1fc4f0828d82d01c52ea93446c2fe7584898820628a617de9b2b","observation_id":"2cafc4cc-ed47-42e3-880b-9fcd5e97f458","resolution":{"observed_at":"2026-08-07T04:09:49.515557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.495624Z","title":"G., Keutmann, M","venue":null,"work_id":"5885351e-0893-4c83-9b22-d1544faea1fe","year":2014},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.594262Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:fdec849380b48e2a152ff248b0f876fa3b871ec2fac502a7e01d6cd74713ba9f","observation_id":"ec1d95fd-8ee2-48a8-accb-0c867feded1f","resolution":{"observed_at":"2026-08-07T04:09:49.500337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:38.679875Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.679875Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:fe8d7c50c5b1a2b0f575eea1db237ba045f250901b789f21f18e111be81ea563","observation_id":"e20a43c3-110e-47fb-afea-7212f0bc8b75","resolution":{"observed_at":"2026-08-07T04:09:38.679875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.472403Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"e9a38be7-aca2-4321-a17f-468b942e6894","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.753191Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:2d38a87ffbde722e104457a96353d080375ce62f75b1ed9ee7402e90b178764b","observation_id":"7885befd-1227-4d1b-8bef-696afd9da023","resolution":{"observed_at":"2026-08-07T04:09:49.477032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:38.823412Z","title":"T., Rubanova, Y., Bettencourt, J., and Duvenaud, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.823412Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:4e5c867d765ec8da60ef93ef36889fe7bf9bb15186521b2e4a9434973dcba984","observation_id":"e4c3c1a8-38f2-4f74-8bdd-d088994c2cca","resolution":{"observed_at":"2026-08-07T04:09:38.823412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.449122Z","title":"Self-attention fusion for audiovisual emotion recognition with incomplete data","venue":null,"work_id":"de19fe63-7138-4f56-9ceb-af0d7b69d4e6","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.893997Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:d5872e6f6b3a476148423fad094db54a8ad6e81e4da09d045ee0ec1235c06a36","observation_id":"4786108c-a60a-452b-8d9a-2da6020d58dc","resolution":{"observed_at":"2026-08-07T04:09:49.453909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-08-16T14:00:03.452025Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-07T04:09:38.980072Z","title":"What does bert look at? an analysis of bert’s attention","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:38.980072Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:3059a28c074ee07ef3b8c837af664a6e57f2cc84f825f57fbef53064a4f49600","observation_id":"cf10ac09-1ebc-4fd9-a007-290cdf6daac3","resolution":{"observed_at":"2026-08-07T04:09:38.980072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.433768Z","title":"Addressing failure prediction by learning model confidence","venue":null,"work_id":"f33c5ccf-f260-47ca-b3db-b3ca8d12b827","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.064181Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:e561b985cbd562b8c998e795f3a5834d2c315abcc10584e5053ad513dd6dd0e0","observation_id":"0551a8ae-6918-4c74-8dfb-8f47cf9b286c","resolution":{"observed_at":"2026-08-07T04:09:49.438443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17419","last_updated":"2024-10-26T16:27:02Z","snapshot_observed_at":"2026-08-16T13:48:56.071448Z","submitted_at":"2024-05-27T17:59:02Z","title":"MultiOOD: Scaling Out-of-Distribution Detection for Multiple Modalities","version":2},"cited_work":{"arxiv_id":"2405.17419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17419","snapshot_observed_at":"2026-08-07T04:09:43.498889Z","title":"MultiOOD: Scaling Out-of-Distribution Detection for Multiple Modalities","venue":"cs.CV","work_id":"63bb8f9a-04bd-4f71-bff7-7eec732b5aad","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.130768Z"},"links":{"cited_paper":"/paper/2405.17419","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:2046783a5718666fe9d4bc78104a27932c1f5a5089a0d2149e24b75dea424d06","observation_id":"55f3978c-c448-4684-ae99-900215ee25cf","resolution":{"observed_at":"2026-08-07T04:09:43.650849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T04:09:39.218605Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.218605Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:eda245bba0331393084d021eff31abfb8f105064ad3686f547a7b237f05f206b","observation_id":"b7bb59bc-732c-44d1-b58a-d335e21ac48a","resolution":{"observed_at":"2026-08-07T04:09:39.218605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.417703Z","title":"Pmr: Prototypical modal rebalance for multimodal learning","venue":null,"work_id":"c7a518bb-325f-49a2-92d1-145c2955d47e","year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.294459Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:23da509d2f2728d93a5916b6a3af9b04f214b11bd57b7d4d8f2ada2370af6c4f","observation_id":"f19b3643-e38e-41ca-813b-463a025a7aaf","resolution":{"observed_at":"2026-08-07T04:09:49.422317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.268514Z","title":"A survey on deep learning for multimodal data fusion","venue":null,"work_id":"c928ca20-dbf8-4a76-80a9-4c5d434c6987","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.356065Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:6f6eb2ced0636b137c67f03608ae902798f223a9f74bf53097585d0176c23ddc","observation_id":"545a75d6-ae72-469f-a773-b66ee6fd6e5f","resolution":{"observed_at":"2026-08-07T04:09:49.341220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.165673Z","title":"C., Wang, X., and Li, H","venue":null,"work_id":"5e78f638-0457-443c-bd50-614648afea93","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.433527Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:bea791625a939537320603dca7012a0813d6d6d895f65839602f61313b82387a","observation_id":"a4fd3df9-1b5d-4eb6-8613-e142ab914055","resolution":{"observed_at":"2026-08-07T04:09:49.199632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10794","last_updated":"2025-08-21T11:31:09Z","snapshot_observed_at":"2026-08-16T14:33:59.053199Z","submitted_at":"2023-12-17T19:06:29Z","title":"A mathematical perspective on Transformers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10794","snapshot_observed_at":"2026-08-07T04:09:39.501652Z","title":"A mathematical perspective on transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.501652Z"},"links":{"cited_paper":"/paper/2312.10794","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:93e9aa029904ecce2d5a3311d9fa89552cd5c1e5274e8969b1771b2109f67318","observation_id":"8820c915-2613-45bc-ac88-5c32f18a1484","resolution":{"observed_at":"2026-08-07T04:09:39.501652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.121245Z","title":"Multimodal dynamics: Dynamical fusion for trustworthy multimodal classification","venue":null,"work_id":"a1f85b65-fea9-4ea5-bb0c-0e2a23202234","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.571302Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:43f107b3e3df7f93afd1b15ace172a27980d77fe0901db6e33b172211d4ebb10","observation_id":"03b11aec-86b4-4fd2-9e88-275a6673e170","resolution":{"observed_at":"2026-08-07T04:09:49.139355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.650765Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.650765Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:39c211245b115ba42a0bcee2a8b2858db581166954e468061b9cadc4d36c2d70","observation_id":"0074a38c-b600-4ccb-8213-a9b30af6ad1f","resolution":{"observed_at":"2026-08-07T04:09:39.650765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.718540Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.718540Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:c0020c44af6d34b4658781d8a408ddcf8838b3c99cec88beb383f50dc9b232e6","observation_id":"ea0983aa-2509-4c86-9810-d1956fd73305","resolution":{"observed_at":"2026-08-07T04:09:39.718540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09321","last_updated":"2024-05-15T13:22:39Z","snapshot_observed_at":"2026-08-16T13:52:29.626597Z","submitted_at":"2024-05-15T13:22:39Z","title":"ReconBoost: Boosting Can Achieve Modality Reconcilement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09321","snapshot_observed_at":"2026-08-07T04:09:39.795317Z","title":"Reconboost: Boosting can achieve modality reconcilement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.795317Z"},"links":{"cited_paper":"/paper/2405.09321","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:bbb4c6c7b7c77b48ba3b68d715cd0799a63c19fa7c21108759b18844f1396312","observation_id":"6b0631c4-cabe-4c4a-baa7-ce27b0913306","resolution":{"observed_at":"2026-08-07T04:09:39.795317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:49.086507Z","title":"Adaptive unimodal regulation for balanced multimodal information acquisition","venue":null,"work_id":"34ca46b7-f4ae-49ff-8b31-3a71426c09a0","year":2025},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.862671Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:2e41ad82c5a9f95f15b84e745d85d586763cfab2f7b832bdf3653de99d7bffbb","observation_id":"7aaf9aba-4f25-42eb-8a9f-d8ec915f37d2","resolution":{"observed_at":"2026-08-07T04:09:49.090763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.950008Z","title":"Modality competition: What makes joint training of multi-modal network fail in deep learning?(provably)","venue":null,"work_id":"0c92c132-45ef-4195-9287-78bacdbfa18d","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.922194Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:2de202c3392137839877c057631acce8b53c2265e364c951dc670215a33976bd","observation_id":"e306a950-b2aa-40f3-8948-a3b310b95012","resolution":{"observed_at":"2026-08-07T04:09:49.016974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00849","last_updated":"2020-06-22T09:09:22Z","snapshot_observed_at":"2026-08-15T14:49:08.287205Z","submitted_at":"2020-04-02T07:39:28Z","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00849","snapshot_observed_at":"2026-08-07T04:09:39.997161Z","title":"Pixel-bert: Aligning image pixels with text by deep multi-modal transformers","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:39.997161Z"},"links":{"cited_paper":"/paper/2004.00849","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:ac0b9230d5f0785277b2f28f4ba2f3332edf57559a7548069f05183b2757c8ae","observation_id":"23ea6d0e-235a-495f-bd8c-67dcabef7be7","resolution":{"observed_at":"2026-08-07T04:09:39.997161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.790269Z","title":null,"venue":null,"work_id":"63026fe7-f717-415d-aa72-0ece5d521f5f","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.072016Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:985dd4b6362859975459c4ff9b9401c287dffcce92fff68ac8495eb309c67c61","observation_id":"25da82be-d28c-4481-bd7e-c6c802b68b09","resolution":{"observed_at":"2026-08-07T04:09:48.867236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.713059Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"0f0da435-eecd-47ef-8b18-946e9da1bb9c","year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.154442Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:ddf798e33ab4b207c2c3b1b3980d2c8fba025296d7216aa5a84ea207ecf712f5","observation_id":"4320cb08-331b-4022-b18d-cbd218295782","resolution":{"observed_at":"2026-08-07T04:09:48.736558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08593","last_updated":"2019-09-11T16:26:37Z","snapshot_observed_at":"2026-08-18T12:44:48.193735Z","submitted_at":"2019-08-21T04:27:38Z","title":"Revealing the Dark Secrets of BERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08593","snapshot_observed_at":"2026-08-07T04:09:40.244763Z","title":"Revealing the dark secrets of bert","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.244763Z"},"links":{"cited_paper":"/paper/1908.08593","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:e73e7313fc35946b0343fbc084954aea387ce510f25c248984d97a27eea32b25","observation_id":"dd8abe0d-cd06-417d-a8f4-04b7f5f7f8d8","resolution":{"observed_at":"2026-08-07T04:09:40.244763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.660865Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"56ec7837-69db-42a3-a80b-29fcd91845d9","year":2011},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.308098Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:be1e45390be4a9177a94e9ef3710aef71dc67223f5a4629eceb6a29c1fc890f5","observation_id":"e4c048b0-6165-4175-9943-dff252466a8f","resolution":{"observed_at":"2026-08-07T04:09:48.699781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-07T04:09:40.379262Z","title":"H., Yatskar, M., Yin, D., Hsieh, C.-J., and Chang, K.-W","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.379262Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:f4c2988938b47c75db70034c14b9a6e9c4efabf40a0d4cbfda8e8b268cc7f479","observation_id":"d5a6dd0e-544b-4395-a0b8-db9e4b7cb64e","resolution":{"observed_at":"2026-08-07T04:09:40.379262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.504475Z","title":"P., Lyu, Y., Fan, X., Wu, Z., Cheng, Y., Wu, J., Chen, L., Wu, P., Lee, M","venue":null,"work_id":"a3aa4cd4-bc2c-4135-a3e9-417d00e2b04c","year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.437438Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:66a4b950a29fffb03e0b3222d012338bef269f261dee2c0da664ae726b287dba","observation_id":"9ff55cff-2ff8-4236-b7ff-edc47bc4d7aa","resolution":{"observed_at":"2026-08-07T04:09:48.581228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03430","last_updated":"2023-02-20T09:19:30Z","snapshot_observed_at":"2026-08-16T16:34:03.271676Z","submitted_at":"2022-09-07T19:21:19Z","title":"Foundations and Trends in Multimodal Machine Learning: Principles, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03430","snapshot_observed_at":"2026-08-07T04:09:40.521348Z","title":"P., Zadeh, A., and Morency, L.-P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.521348Z"},"links":{"cited_paper":"/paper/2209.03430","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:a44a1746589bfcad48458e010ebde9421ff19c07844c8d051d8ef880e5eafd6d","observation_id":"a18a3558-b526-4404-a362-657ea7b69717","resolution":{"observed_at":"2026-08-07T04:09:40.521348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00064","last_updated":"2018-05-31T19:28:23Z","snapshot_observed_at":"2026-08-16T06:00:48.419441Z","submitted_at":"2018-05-31T19:28:23Z","title":"Efficient Low-rank Multimodal Fusion with Modality-Specific Factors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.00064","snapshot_observed_at":"2026-08-07T04:09:40.621399Z","title":"B., Liang, P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.621399Z"},"links":{"cited_paper":"/paper/1806.00064","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:ddb0b88cc1bb9fb4e62619c37fd0e7bfdecced25a65c608cda26a52be0a97163","observation_id":"d7a3ff90-7b6b-4e7e-b8a0-5b3b1f6a6866","resolution":{"observed_at":"2026-08-07T04:09:40.621399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.348449Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"89bcd6be-9fe4-42b3-a56c-e44a5d39ba3a","year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.697091Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:692ed4e03f4280ec04b08ca0562168b2c9b06c1ee684618aa797ef23d1b4296c","observation_id":"e0e52db5-9606-435e-a9c9-4036ca3f6cdb","resolution":{"observed_at":"2026-08-07T04:09:48.420532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.235166Z","title":"Balanced multimodal learning via on-the-fly gradient modulation","venue":null,"work_id":"7296db1c-0b5a-43a3-97a2-998c888e363d","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.821931Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:28172d4492047c1b5fc7f28c22e935bc4aa3e1862509b43fb31b7213f10c1b19","observation_id":"239cea9e-0360-41c7-bea2-1287ac56cd59","resolution":{"observed_at":"2026-08-07T04:09:48.259625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08889","last_updated":"2024-06-07T05:45:02Z","snapshot_observed_at":"2026-08-17T01:19:47.413082Z","submitted_at":"2023-06-15T06:45:46Z","title":"Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08889","snapshot_observed_at":"2026-08-07T04:09:40.892599Z","title":"S., Matyasko, A., Jaiswal, S., Fernando, B., and Tan, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.892599Z"},"links":{"cited_paper":"/paper/2306.08889","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:bb00db75d81837bb6e31f62983bfe270c604ad3b8a470324e0f881be110a25a3","observation_id":"547cea5c-7798-47df-9452-779a9b14c033","resolution":{"observed_at":"2026-08-07T04:09:40.892599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09595","last_updated":"2023-02-22T18:58:10Z","snapshot_observed_at":"2026-08-16T16:00:40.735898Z","submitted_at":"2023-01-23T17:51:39Z","title":"Zorro: the masked multimodal transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09595","snapshot_observed_at":"2026-08-07T04:09:40.977183Z","title":"Zorro: the masked multimodal transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:40.977183Z"},"links":{"cited_paper":"/paper/2301.09595","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:765cccfd36bcd5ad91e0f9d860f979251ec3bbf23ecca408d07e94f2499e7ffe","observation_id":"16ce0f8b-0daf-4bc3-967d-d938b0dc3d2b","resolution":{"observed_at":"2026-08-07T04:09:40.977183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10972","last_updated":"2021-08-05T15:04:28Z","snapshot_observed_at":"2026-08-16T18:29:47.623456Z","submitted_at":"2021-04-22T10:10:14Z","title":"ImageNet-21K Pretraining for the Masses","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10972","snapshot_observed_at":"2026-08-07T04:09:41.086921Z","title":"Imagenet-21k pretraining for the masses","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.086921Z"},"links":{"cited_paper":"/paper/2104.10972","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:9afb42dd9566251b781a8b85ebc165f2548678392e99f1d9f09af7ecc70dba01","observation_id":"d46087ef-f70c-4d11-83e1-910194c6e1e2","resolution":{"observed_at":"2026-08-07T04:09:41.086921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:48.029523Z","title":"and Monro, S","venue":null,"work_id":"107df467-8f43-4d44-ac67-9af0261f62f5","year":1951},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.216679Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:2fcd54786ce0e4cbd692745c81ff79bc6e9e1064e89542103420f9a89123bfbc","observation_id":"ea171b79-85fd-47e4-ae91-6a6c7b111834","resolution":{"observed_at":"2026-08-07T04:09:48.138516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T04:09:41.333805Z","title":"R., and Shah, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.333805Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:a8238f617e2416a215c1ead303cf07631300564584ede546b58430ce3771115f","observation_id":"ebcad2ad-3b0e-4e4e-9aba-961f1d4e01b2","resolution":{"observed_at":"2026-08-07T04:09:41.333805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:47.791989Z","title":"L., Tickoo, O., and Huang, J","venue":null,"work_id":"82bdae25-0059-4508-af16-ee038fb27043","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.440088Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:7c8e01c25a7b1fc3516ee81bccc2ffa920bb6ef2f3f2ebafd52867202302832a","observation_id":"5ffad669-1854-4da8-9703-6fcf17fd33b9","resolution":{"observed_at":"2026-08-07T04:09:47.883478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:47.400653Z","title":"H., Bai, S., Liang, P","venue":null,"work_id":"38121e28-c27a-4a32-ac6d-239d81c90852","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.552413Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:ef32f8afa1ab0b83f35c56bdb9c2351c7983c40c90d429425554221c299e7e56","observation_id":"d0858fa7-edf5-4ef4-812c-4c2c3767b01d","resolution":{"observed_at":"2026-08-07T04:09:47.606166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.645870Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.645870Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:1743657690fe4bed8d2c6e42aef9d293112d03cf3e85e876d9ca317663b100c8","observation_id":"2fe37389-a3c9-4df0-afb3-bb45496bb3d9","resolution":{"observed_at":"2026-08-07T04:09:41.645870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:47.146084Z","title":"H., Zeeshan, M","venue":null,"work_id":"c626d340-34ca-4bc0-814b-ad44b6ccd562","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.762413Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:c7ab04a3d30862cfb16ef059a1136f2f3f99086f6a407ff7290c56327e4584bb","observation_id":"ca52aa6e-4920-443d-9036-e6abdfdecfe2","resolution":{"observed_at":"2026-08-07T04:09:47.235792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:46.964740Z","title":"What makes training multi-modal classification networks hard? In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp.\\ 12695--12705, 2020 a","venue":null,"work_id":"471023e5-9a33-445b-8d46-bc89880836f1","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.879818Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:4e37b42662e7d6bbdfc797b31304f203b8e19c313d62bcd0d2241de2c1493990","observation_id":"a82048ad-0376-4017-b5ad-0b4f1e841597","resolution":{"observed_at":"2026-08-07T04:09:47.029696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:46.667936Z","title":"Deep multimodal fusion by channel exchanging","venue":null,"work_id":"8acc6872-3368-456b-8bfb-b21b3332e1c4","year":2020},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:41.996523Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:4ba1122c1e2ef992c0c0e05c9067d9dcbd89c44d233adf19647a23d209a8634b","observation_id":"a99a2d56-7b1f-4a7f-a537-54692516e151","resolution":{"observed_at":"2026-08-07T04:09:46.828432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:46.385561Z","title":"Multimodal token fusion for vision transformers","venue":null,"work_id":"0f0c05bc-cabc-4bdf-b84a-b77f59878762","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.101140Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:dd17c1d1d2bcbb3a7dcd0212a65b05f5edd360ea7469032ff69f9c12dc0b24c4","observation_id":"f21ef0bb-bf4f-461c-800f-d0a1362c8203","resolution":{"observed_at":"2026-08-07T04:09:46.490537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:46.134082Z","title":null,"venue":null,"work_id":"8b898024-086a-446a-8e0d-09fbca5d91b5","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.170844Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:fc706b8209203794bfc8934bbc0125dc79083ea87e859eb0a2b35eb6e2f50de0","observation_id":"2d4e5a44-063e-4e35-8056-c28ae24e966e","resolution":{"observed_at":"2026-08-07T04:09:46.245419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:45.909761Z","title":"Enhancing multimodal cooperation via sample-level modality valuation","venue":null,"work_id":"3b569985-143f-4723-86d0-b72cfcdc3e3a","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.227002Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:6ec64374b3832c13935cdea379282e4aade1a9ab18cb26d1e2daedcdd5ea8a01","observation_id":"7323a5ea-4aaa-4e4c-aa74-bd1a0b5851e2","resolution":{"observed_at":"2026-08-07T04:09:46.014133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:45.669812Z","title":null,"venue":null,"work_id":"b3715aae-c909-4b85-b527-244f2e868b16","year":2022},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.283576Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:fb7b3d81390fb2415141986af7c3073d65a1c878d4c9b2755f8cadb5271f2f1b","observation_id":"a1a04a73-0842-4a2e-beba-ec1c69b862ca","resolution":{"observed_at":"2026-08-07T04:09:45.793727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:45.455629Z","title":"Multimodal fusion with co-attention networks for fake news detection","venue":null,"work_id":"f98012d1-dbf6-492e-b73f-ef9b5c3a8119","year":2021},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.335445Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:0f481c781392c4f292e7aedfe0d9478a99dc9c83e7d27584932350dd0709dc96","observation_id":"9441ca14-8e29-4259-abb4-a2903efd00ea","resolution":{"observed_at":"2026-08-07T04:09:45.527009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:45.190683Z","title":"Multimodal multi-loss fusion network for sentiment analysis","venue":null,"work_id":"a559dc81-f14f-40f0-b2f2-f00e059765e6","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.388586Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:1acff9aa61d269c5a5e63e1ccadd1ced83d19b913544f7e0af3bd6e9a8a53109","observation_id":"049e80b9-65b8-495a-8450-e1a6d4325ab9","resolution":{"observed_at":"2026-08-07T04:09:45.332401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10912","last_updated":"2023-06-08T06:58:05Z","snapshot_observed_at":"2026-08-16T21:56:24.211656Z","submitted_at":"2023-02-14T15:35:17Z","title":"Balanced Audiovisual Dataset for Imbalance Analysis","version":2},"cited_work":{"arxiv_id":"2302.10912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.10912","snapshot_observed_at":"2026-08-07T04:09:43.177423Z","title":"Balanced Audiovisual Dataset for Imbalance Analysis","venue":"cs.LG","work_id":"0477f687-83a3-4dd8-a628-71e8457e9fd4","year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.449291Z"},"links":{"cited_paper":"/paper/2302.10912","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:3ad1b4b7d230024c0ca4151dcae8f1409c68c653e326904309abf8235618863a","observation_id":"2b312de6-de2a-406f-800e-4eb2aee2f3c7","resolution":{"observed_at":"2026-08-07T04:09:43.246686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.987846Z","title":null,"venue":null,"work_id":"0100f699-731d-4168-a94a-fa3c74440895","year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.505015Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:3194cc8d9323c276343280d2969ab45ae1f72df35acab807a9f31da411cf21d3","observation_id":"f9ef6733-d0c6-460b-9bd2-99b47c4c3490","resolution":{"observed_at":"2026-08-07T04:09:45.069587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.805199Z","title":"Facilitating multimodal classification via dynamically learning modality gap","venue":null,"work_id":"6b56bce9-92ff-49cc-9baa-6f4f9bc2e5d4","year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.553697Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:cac7d825e97006a146b5b69c3454cba0cfdf19e69797ede95f57927b029721a8","observation_id":"66ed191c-5d3d-4682-beeb-b3e45e79ae60","resolution":{"observed_at":"2026-08-07T04:09:44.948613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.559006Z","title":"Learning to rebalance multi-modal optimization by adaptively masking subnetworks","venue":null,"work_id":"1395fb90-5a7d-4eb8-a57e-e3d2d7a40456","year":2025},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.619478Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:b6815e06adff4ac2b6cdc52c70c44a7da7b724358df007c3578a4a43b56ac093","observation_id":"f45c8981-637e-44af-9e1a-b8e6becbbf24","resolution":{"observed_at":"2026-08-07T04:09:44.656662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.315962Z","title":"Deep modular co-attention networks for visual question answering","venue":null,"work_id":"0421c666-186b-451b-a6fb-fbb5bd494353","year":2019},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.689333Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:eae5179392987ecb2d8965a31453fe450685778dfa2fb87607e24f8f66c68dc6","observation_id":"e4aab786-902f-4950-b114-ce9358f957a4","resolution":{"observed_at":"2026-08-07T04:09:44.419762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07250","last_updated":"2017-07-23T05:54:20Z","snapshot_observed_at":"2026-08-14T20:45:55.731918Z","submitted_at":"2017-07-23T05:54:20Z","title":"Tensor Fusion Network for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07250","snapshot_observed_at":"2026-08-07T04:09:42.779895Z","title":"Tensor fusion network for multimodal sentiment analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.779895Z"},"links":{"cited_paper":"/paper/1707.07250","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:1aabb31f8cf3829257c8e1f2ab8de18fa60d49d4aa260b29f4dae325aefbbafc","observation_id":"1b29b99a-b9c2-4b6a-87ff-895202aa7c49","resolution":{"observed_at":"2026-08-07T04:09:42.779895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:44.099237Z","title":"B., Liang, P","venue":null,"work_id":"a875bad2-1178-480b-ad4d-6f3bbd70b883","year":2018},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.869769Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:453955d603d302ab06a91ea2a2e754d6c6c9a61957649caf4a388c1f435ace9e","observation_id":"33865e64-506f-4578-9ab0-f0365b44c665","resolution":{"observed_at":"2026-08-07T04:09:44.221027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:43.840717Z","title":"T., and Peng, X","venue":null,"work_id":"ed92a5fb-85c3-4ae1-8f3a-8f1b78666a19","year":2023},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:42.959924Z"},"links":{"citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:6a2effdd8a3dbb8cee35f2a1836b00921abdf634251e2c046b4d5334aed8e942","observation_id":"d43883cf-fe5d-4810-887c-33cfd95e3fd6","resolution":{"observed_at":"2026-08-07T04:09:43.959333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18947","last_updated":"2024-11-01T13:53:44Z","snapshot_observed_at":"2026-08-16T13:57:23.116941Z","submitted_at":"2024-04-27T07:22:28Z","title":"Multimodal Fusion on Low-quality Data: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18947","snapshot_observed_at":"2026-08-07T04:09:43.057849Z","title":"Multimodal fusion on low-quality data: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T04:09:43.057849Z"},"links":{"cited_paper":"/paper/2404.18947","citing_paper":"/paper/2506.11465"},"observation_digest":"sha256:28e31d573eec4fb9601dbe672c9a156d14b3cd79c61bbffd82c3b5e125ed103b","observation_id":"c2704c55-8763-4037-aeaa-3d9c784a8eef","resolution":{"observed_at":"2026-08-07T04:09:43.057849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11465","last_updated":"2025-06-13T04:39:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T08:04:03.157373Z","submitted_at":"2025-06-13T04:39:58Z","title":"RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.11465."}