{"as_of":"2026-08-21T07:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1fb8b0f08ef2a6c9e010e893dfed82201362e92fb9a43543441b1fd880a28d0","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:14:31.426091Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:07:11.142298Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T01:07:11.189974Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":"2412.20872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20872","snapshot_observed_at":"2026-08-16T01:07:11.189974Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","venue":"cs.CV","work_id":"a63470db-cae7-479d-8464-bafc006b3a24","year":2024},"citing_paper":{"arxiv_id":"2505.02096","last_updated":"2025-05-04T13:03:13Z","snapshot_observed_at":"2026-08-16T00:59:19.680095Z","submitted_at":"2025-05-04T13:03:13Z","title":"TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:11.142298Z"},"links":{"cited_paper":"/paper/2412.20872","citing_paper":"/paper/2505.02096"},"observation_digest":"sha256:87c9004964cd0a267b8cca22c740a9a90557c79510e6a3962732755b126511a1","observation_id":"5ece17e2-c5a1-4539-b62f-01df159f5a7a","resolution":{"observed_at":"2026-08-16T01:07:11.196864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.20872/citation-record","integrity":"/paper/2412.20872/integrity","json":"/paper/2412.20872/citation-record.json","paper":"/paper/2412.20872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.957211Z","title":"Audio- visual event localization in unconstrained videos,","venue":null,"work_id":"c4360ac4-398d-4995-ba8d-5253541a8896","year":2018},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.338358Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:ab9748473c2bb0a3330d63f4ccd848987e4230ed79c273272e5941c06b05bf24","observation_id":"027ffa93-b264-4561-9501-c1dbc7f1e54b","resolution":{"observed_at":"2026-08-10T23:14:31.960670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.947255Z","title":"Dual attention matching for audio-visual event localization,","venue":null,"work_id":"18cce315-93c5-4f99-b14d-6a24ad5031b1","year":2019},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.342825Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:de93353076dd77601e8b38779d2640886ff8cfa96c3978a4f329a8a4a98cc09f","observation_id":"cb88e4eb-532b-4cd9-bbb8-27a098845744","resolution":{"observed_at":"2026-08-10T23:14:31.950588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.935341Z","title":"Learning to answer questions in dynamic audio-visual scenarios,","venue":null,"work_id":"425aa201-7155-46f9-aba8-f49daea3d45a","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.346742Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:17ef2f5b8d2d049a45323b8f8d74e4c2d06b754071b1500c6d55a50972054c4f","observation_id":"a80ea30b-4a9b-47e5-bc61-38e74334137d","resolution":{"observed_at":"2026-08-10T23:14:31.940052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.924024Z","title":"Listen to look: Action recognition by previewing audio,","venue":null,"work_id":"b64554d5-c4b9-478a-8b4a-a32da826a9c0","year":2020},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.350756Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:34bbdc21805a19fc959b8881bee5b563764bc6398708aff02c6ac9a9746d9c69","observation_id":"291f353f-4670-4556-b5a5-2814a3299113","resolution":{"observed_at":"2026-08-10T23:14:31.927958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.912393Z","title":"Unified multisensory per- ception: Weakly-supervised audio-visual video parsing,","venue":null,"work_id":"a59990c3-98bc-4634-b2de-23e40560ca8f","year":2020},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.354817Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:1567f12eb8558487e15e5ab4c01b6fd1110cfae0414b6e4a1d6226c83750586b","observation_id":"084c3cf5-50bc-4850-9bab-73e7b19f63e7","resolution":{"observed_at":"2026-08-10T23:14:31.917109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.901204Z","title":"MM-Pyramid: Multimodal pyramid attentional network for audio-visual event localization and video parsing,","venue":null,"work_id":"5686f376-f727-49ed-8522-9025ac5aa0dd","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.358620Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:42c8dfd85f8791e1abee127ea5d7f6f49c7060672700a2886af0f824538cca49","observation_id":"78b33c2e-ab8e-4b1a-9698-0c5370b29680","resolution":{"observed_at":"2026-08-10T23:14:31.905241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05152","last_updated":"2023-12-20T23:06:09Z","snapshot_observed_at":"2026-08-18T20:44:56.061187Z","submitted_at":"2023-11-09T05:24:20Z","title":"Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks","version":2},"cited_work":{"arxiv_id":"2311.05152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.05152","snapshot_observed_at":"2026-08-10T23:14:31.474918Z","title":"Cross-modal Prompts: Adapting Large Pre-trained Models for Audio-Visual Downstream Tasks","venue":"cs.LG","work_id":"12afae91-a09a-47ea-8b23-bee70a7ecc6d","year":2023},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.362775Z"},"links":{"cited_paper":"/paper/2311.05152","citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:d86177f424e31f6a75319494c1b67358934f31b5fbb955a5020cf9a9744b49c0","observation_id":"772b055e-a842-4dae-8880-c4f23906bcb5","resolution":{"observed_at":"2026-08-10T23:14:31.479730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.886462Z","title":"Modality-independent teachers meet weakly-supervised audio-visual event parser","venue":null,"work_id":"a32ec167-accb-4afd-8346-b8408808deeb","year":2023},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.366623Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:95effbc89954c65a5100b0670e60f427e207007020cf8a992bcd0740b589275c","observation_id":"3678b30a-fd30-4b7a-8caf-757610b41371","resolution":{"observed_at":"2026-08-10T23:14:31.893531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.874648Z","title":"Label-anticipated Event Disentanglement for Audio-Visual Video Parsing,","venue":null,"work_id":"1345640a-34e1-4b21-af4b-3bd58ef31535","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.369985Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:a1492f5cc83a3406c8c58fd3ab3eee62c3bbcb155bb607bf36ba3736fe691852","observation_id":"b00ba2d6-0458-437d-baf4-b8376e7bfa00","resolution":{"observed_at":"2026-08-10T23:14:31.878816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.648477Z","title":"Cbam: Convo- lutional block attention module,","venue":null,"work_id":"5fd41cb1-0b94-4728-8ee1-baf7c98d6d77","year":2018},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.373333Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:6b2fad2eecd479ad10eb403fdbf3d3b6d8b2bbb889e45e1c3e4dba877ae31e72","observation_id":"1f1ea22e-4445-4d3c-80e6-f73bb5246b79","resolution":{"observed_at":"2026-08-10T23:14:31.651641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.638224Z","title":"Towards Efficient Audio-Visual Learners via Empowering Pre-trained Vi- sion Transformers with Cross-Modal Adaptation,","venue":null,"work_id":"dacbf8fd-bffe-4525-86c8-3268d6b94503","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.376298Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:36afbf31415d9a3d0a1c9072293fbd45fdda15bbbde4defdfabf9da49ae8a9a6","observation_id":"02f180ef-7605-4869-b5be-14b205afe4d5","resolution":{"observed_at":"2026-08-10T23:14:31.642040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.626175Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"1d4d78f4-bd38-4e1b-b16c-2776a6f78b14","year":2021},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.379469Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:ce4eb47be4e7a1a23ca086c1bf0023f75811216fda40784565c358b492b27ac8","observation_id":"f874c14f-f6c7-419f-a57f-5c741bf31e3a","resolution":{"observed_at":"2026-08-10T23:14:31.630531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.614085Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"4786eb07-0ae1-44de-9252-b3fd4a16d5ed","year":2019},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.382375Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:e141f5d9e0b03daa345e33fbb83b66434102657f4b7dd0aaa7351c68b12f577c","observation_id":"c57e30cc-86a3-408f-84d0-533adb9a56ae","resolution":{"observed_at":"2026-08-10T23:14:31.618846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.603131Z","title":"Balanced multimodal learning via on-the-fly gradient modulation,","venue":null,"work_id":"b33f11d9-32d8-4b2a-951d-dcc5e9e0d0e3","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.385120Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:b89e17411dec0a0b93ccc12f1cc8c6e6ed87995e3330c54f269c39009c1e1b8c","observation_id":"f9db92f0-8937-4978-a6c2-e1ab5c9da90a","resolution":{"observed_at":"2026-08-10T23:14:31.606881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.592033Z","title":"What makes training multi-modal classification networks hard?","venue":null,"work_id":"3d30e528-303e-4918-90a2-7da6569ac71b","year":2020},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.388073Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:64320f2e7430f8b11c37785a90b83a6e0b2313697d2989ad0a8a3307b835da5f","observation_id":"86bc2f74-c6ed-4c96-823a-881dafcffd81","resolution":{"observed_at":"2026-08-10T23:14:31.596182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.580440Z","title":"Scal- ing multimodal pre-training via cross-modality gradient harmonization,","venue":null,"work_id":"d9386f0e-5984-4eac-9a60-c9a1e5f34fbf","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.391510Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:e39985dc99607e13de43d4fda2a0e762edc27b48f1ffcd45e617af3d956bafb5","observation_id":"d9fe477f-bdc7-40ed-a1da-392e5ae1f55b","resolution":{"observed_at":"2026-08-10T23:14:31.584694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.569659Z","title":"Text-IF: Leveraging Semantic Text Guidance for Degradation- Aware and Interactive Image Fusion,","venue":null,"work_id":"5fe6b440-3043-4491-b16f-90258eb4fce6","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.394816Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:022b9e50d85c8a20814a9778222b95ba1ed8b7a20503089a3c847aa2cb878283","observation_id":"c8b9b600-26d9-4085-b466-68c64a65c0dd","resolution":{"observed_at":"2026-08-10T23:14:31.573528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.559550Z","title":"Language- driven All-in-one Adverse Weather Removal,","venue":null,"work_id":"78432d41-0f0f-4e6a-a0b2-68245dd27a58","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.398392Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:b33e18b6d6ddd5f2d16aeadc2fde5ff02212a0d7fcbc1a5378cb72d527f1737c","observation_id":"5dcd6f78-f15d-456f-ac84-61bcdc1c61ba","resolution":{"observed_at":"2026-08-10T23:14:31.563153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.548864Z","title":"Multi-modal grouping network for weakly-supervised audio-visual video parsing,","venue":null,"work_id":"7058c116-4556-4d1b-8954-673eca543b63","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.402479Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:8407effe03edf059b37971ce96ee60c1e87891dc739748a041c9b2c3930f4119","observation_id":"261f4f31-11f2-498b-ac28-e0c59cc642ac","resolution":{"observed_at":"2026-08-10T23:14:31.552666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.538310Z","title":"Joint-modal label denoising for weakly-supervised audio-visual video parsing,","venue":null,"work_id":"85025027-ec52-4f73-a814-52f8c2cfe223","year":2022},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.406002Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:cff2ea08f4da6e6fefe11cd954e52550570669edd048873fd2204d5d5d3669ec","observation_id":"c695cf29-0b0d-4c24-b307-03af97c209ed","resolution":{"observed_at":"2026-08-10T23:14:31.541674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.526896Z","title":"Collecting cross-modal presence-absence evidence for weakly-supervised audio- visual event perception,","venue":null,"work_id":"6f2ad8bc-7252-498c-a6c6-aaf07431b3c6","year":2023},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.409922Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:81d6ebcd92b619ed5e7ed9495da588f02576704683ff6e0f6d0f55452b44fa55","observation_id":"d4577133-bff7-4684-a3a1-cdca17f11bec","resolution":{"observed_at":"2026-08-10T23:14:31.531000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10690","last_updated":"2024-07-15T09:31:54Z","snapshot_observed_at":"2026-08-16T13:51:54.671840Z","submitted_at":"2024-05-17T10:51:15Z","title":"CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing","version":4},"cited_work":{"arxiv_id":"2405.10690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.10690","snapshot_observed_at":"2026-08-10T23:14:31.455861Z","title":"CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing","venue":"cs.CV","work_id":"62802a26-66dd-4381-8ac3-1fed77a74ed8","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.413878Z"},"links":{"cited_paper":"/paper/2405.10690","citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:9a59c139e9fcf2091f94c9b93cb0bf198b5724a87202adb47351c8ad8d9c3a04","observation_id":"efe3f719-9e97-4b0f-867f-25133ee6c53b","resolution":{"observed_at":"2026-08-10T23:14:31.462911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.515900Z","title":"CM-PIE: Cross-modal perception for interactive-enhanced audio-visual video parsing,","venue":null,"work_id":"2486480e-211a-442e-8c5a-9b0ef2a8cb63","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.417511Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:0b27e4e8ec934e5240ea9be550a5246f2d35c69dedeecc58ea45879450c70dce","observation_id":"854a2959-0109-4ff4-bb39-9fcbbd030c5a","resolution":{"observed_at":"2026-08-10T23:14:31.519353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.503627Z","title":"V ALOR: Vision- Audio-Language Omni-Perception Pretraining Model and Dataset,","venue":null,"work_id":"74a31436-aab3-418b-95ad-56c4cc9b039d","year":2024},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.421175Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:d1cab16b225db5f6e3a7dfb84243fd9e2a7603bc4fcdad21c2093debf3867259","observation_id":"bd2c0d7f-8b4b-4b52-a42f-fa13dda274b7","resolution":{"observed_at":"2026-08-10T23:14:31.508137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:14:31.489907Z","title":"Multi-grained representa- tion learning for cross-modal retrieval,","venue":null,"work_id":"56741781-3d01-4763-b72a-1fde830b4cc1","year":2023},"citing_paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:31.426091Z"},"links":{"citing_paper":"/paper/2412.20872"},"observation_digest":"sha256:b420544f038ed9493b861618484b5e61ba0475730e3d1a013a9920513b5bc08c","observation_id":"d7cf971f-fddf-4cb3-84f1-1c7240fbf6a6","resolution":{"observed_at":"2026-08-10T23:14:31.494562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20872","last_updated":"2024-12-31T03:39:42Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T23:05:50.113962Z","submitted_at":"2024-12-30T11:23:15Z","title":"LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2412.20872."}