{"as_of":"2026-08-20T15:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:871555c209010f48668629742b4af2139222dd756fda8b0a5ee309b07c8f9e30","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:26:32.991891Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.01237/citation-record","integrity":"/paper/2505.01237/integrity","json":"/paper/2505.01237/citation-record.json","paper":"/paper/2505.01237"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:32.775790Z","title":"Self-supervised learning of audio-visual objects from video","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.775790Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:2e93b7440190ca721094b81679ff5f04205b351d2a6ac124cd6e718d363f208a","observation_id":"ab5ba190-b74b-4850-853f-0225be2800ec","resolution":{"observed_at":"2026-08-16T04:26:32.775790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.815745Z","title":"Look, listen and learn","venue":null,"work_id":"b9661b8d-e2f8-4b82-8a31-259c8c3a3adb","year":2017},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.780800Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:b7bd432bfabe7a3be0caf3596199d3eb4e9850f9ecead4f3a975f1dbba457b53","observation_id":"73b9163a-48bc-4536-91e9-ba49dd15249f","resolution":{"observed_at":"2026-08-16T04:26:33.820348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.800740Z","title":"Objects that sound","venue":null,"work_id":"c7f3ff50-8567-4c82-9e38-10cb2be0c8c9","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.785314Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:e8e7159beae5e68a3fde758ab52147f9f145ceb620ea8856a4fa70fa54b77822","observation_id":"8721d22e-4783-44c8-99e1-4be0d12cd5fd","resolution":{"observed_at":"2026-08-16T04:26:33.805349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.785917Z","title":"Sound- net: Learning sound representations from unlabeled video","venue":null,"work_id":"3a113f0d-11fe-4bac-ac47-ccb9b6906d3e","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.789973Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:a74333ed9a41ccaf475109a9b1c80e2d76d0423ee452e59ebb7c0d6044309b42","observation_id":"abb8d35f-e874-40ce-b211-b62f120a2b8e","resolution":{"observed_at":"2026-08-16T04:26:33.790489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:32.794959Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.794959Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:91ecb8decc3dc95dcc41ae142c962fc5450ee6b7c7296feb65354a6891b46027","observation_id":"59c34e70-af9a-468a-94aa-9aac795b5112","resolution":{"observed_at":"2026-08-16T04:26:32.794959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.761450Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"b0379ab2-9a74-4e6b-b6e4-ff0128ee69fd","year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.799505Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:5e5dc28a3dc6083d51820c588b795a5476675ad6cb5e6e2e61462fa010558850","observation_id":"9420bd3c-3674-43c4-8681-a06a2d76b89d","resolution":{"observed_at":"2026-08-16T04:26:33.766400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.747531Z","title":"Localiz- ing visual sounds the hard way","venue":null,"work_id":"fb66c3e2-894e-42d1-a95e-1ca86939178d","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.804317Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:bebdfea4470226fa67382adab6aa8b5fc7cc4644e5734d3cf9e18c1a441ac6c7","observation_id":"f19c7b18-3466-41f9-b614-78e182dda387","resolution":{"observed_at":"2026-08-16T04:26:33.751761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.734029Z","title":"Distilling audio-visual knowledge by com- positional contrastive learning","venue":null,"work_id":"860b2f78-852a-4e79-9357-4ce00468db55","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.809033Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:44747e868cac5757383a26cce99314c0ccf177e0e71e30b7f57e09a54b80ab81","observation_id":"aba398b6-c9ce-4d75-a004-151350fab2e0","resolution":{"observed_at":"2026-08-16T04:26:33.738412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.719983Z","title":"Look, listen, and attend: Co-attention network for self-supervised audio-visual representation learning","venue":null,"work_id":"f68371a4-f1dd-4949-a3a4-1f4415b42891","year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.813514Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:9b64198d8f90560cf6623a0511aab70270a2faa8270aa50dd67090620f0d3ad8","observation_id":"389a656d-d290-4307-9cbf-a00ce46c72ff","resolution":{"observed_at":"2026-08-16T04:26:33.724307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.706578Z","title":"Vision transformers need registers","venue":null,"work_id":"539229e2-30ad-42cc-8156-0ad6059ece18","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.817897Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:bab746fcc6919646d0043207e11c9c9b3964eda7a715e52df1bd405715114a1b","observation_id":"cc1b77d1-1f77-4738-9521-0773c9fdb621","resolution":{"observed_at":"2026-08-16T04:26:33.711043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.692479Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"0b995a49-e55e-4da8-b415-7d8006928d73","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.822446Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:e40aea5a572fd109fcf8f5820f747f75749a2c93591a9ec1864dec29153d29b7","observation_id":"29d9ea60-eb9f-47fc-998d-7f82934b04ed","resolution":{"observed_at":"2026-08-16T04:26:33.697065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.678768Z","title":"Audiovisual masked autoencoders","venue":null,"work_id":"45883d6d-7749-4185-849d-d0a700628c64","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.826992Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:f63d068521a94501e623fc61122ddcf509d8df39d03f8c8dd2f3a83bf5ddef57","observation_id":"3cd7ed33-9754-4237-a3c0-202be15b27a7","resolution":{"observed_at":"2026-08-16T04:26:33.683003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.664662Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"a54ceb86-c3d7-43e3-908c-b6dab3c65b21","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.831640Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:8c4bcfa2935d9a91c73222fe99d537727a82555555e4c4d3737671cf69a1145e","observation_id":"fa9b2a8a-99e5-4572-96a7-4ba46a39fa6e","resolution":{"observed_at":"2026-08-16T04:26:33.669127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.649929Z","title":"Liu, David Harwath, Leonid Karlinsky, Hilde Kuehne, and James R","venue":null,"work_id":"57ed131e-c83f-4e50-ae0e-08bdbf2715be","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.835914Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:6394c7d91ba9de0736df4ffa6d76b129e2131fd17c620e650a8e9bd09eb4296b","observation_id":"6c0f4c33-db18-466c-aa5d-712e26f1a4f8","resolution":{"observed_at":"2026-08-16T04:26:33.654970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.635465Z","title":"Cross- mae: Cross-modality masked autoencoders for region-aware audio-visual pre-training","venue":null,"work_id":"1d6b0c11-0a66-4e53-9dc8-897dd75ef8b1","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.840157Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:e8afec550d6681f751235b5154ad63067c341358955e5c9d7f4d62ffd9ae0489","observation_id":"7003157a-d225-473d-adb4-ac16868a791a","resolution":{"observed_at":"2026-08-16T04:26:33.639798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.621889Z","title":"Separating the” chirp” from the” chat”: Self-supervised visual grounding of sound and language","venue":null,"work_id":"54377dea-450e-4b3a-8362-d944453c1f54","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.844720Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:94a575137a786d5edb3186b69853147d8bfebdea1b522868c17513b27ce05b58","observation_id":"7485129c-84de-4caa-ae10-4b5e257db1a9","resolution":{"observed_at":"2026-08-16T04:26:33.626057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.607110Z","title":"Jointly dis- covering visual objects and spoken words from raw sensory input","venue":null,"work_id":"04a1b8f8-1fe6-44e4-9312-2bb9dd7145d2","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.848959Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:d4afee92e09fba70153b2ba657ff697a784fa3ddac4491e43577084b19eff3bf","observation_id":"1e006760-16ec-420d-bc6b-b7abd2a55357","resolution":{"observed_at":"2026-08-16T04:26:33.611946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.591848Z","title":"Multi- modal attention for fusion of audio and spatiotemporal fea- tures for video description","venue":null,"work_id":"311e0d38-2f5a-4026-b230-e9661abffa36","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.853357Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:d8e1f30e9769d76f1d9cc7c86ad35c950145a27725957ebfc9a812e1eb9e0c0b","observation_id":"78ea52a8-0f76-417b-8399-76e4059b0a34","resolution":{"observed_at":"2026-08-16T04:26:33.596598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.467266Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"084df9bf-1841-4044-a419-ca3654214c79","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.857551Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:8f4fa1b6371845e55b3302023a2c8ba20305a968e8cb7519efc417d5d43f0e49","observation_id":"30f027fb-4e56-4c69-b832-00867cb4bbb8","resolution":{"observed_at":"2026-08-16T04:26:33.581567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.452016Z","title":"Mavil: Masked audio-video learners","venue":null,"work_id":"9cd163d7-c426-462e-9c6d-b57578dcf8b4","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.862296Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:7912d776a85fa8e40b68848f11bca6537350769bd8e3e5172a9e8e4b59d9cd73","observation_id":"a20842a8-ea8c-4cea-b304-763c02564db4","resolution":{"observed_at":"2026-08-16T04:26:33.457498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.437256Z","title":"EquiA V: Leveraging Equivari- ance for Audio-Visual Contrastive Learning","venue":null,"work_id":"a52e707f-fd0c-484e-aeef-cd103d75477d","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.866833Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:4f429d6956f7a7e5231514ffda99433cd27ad012482857c045f555c84f4bfee3","observation_id":"52136e88-5727-4d12-b8b6-e0e58f7aa1f8","resolution":{"observed_at":"2026-08-16T04:26:33.442031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.422444Z","title":"Coopera- tive learning of audio and video models from self-supervised synchronization","venue":null,"work_id":"87dd688c-8f0f-4003-a45b-eafdfee3044f","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.871032Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:e00840fa4fd434767483e9cadb3332e4d82e4f32f93c92d36eaabedb837bf8a3","observation_id":"a6e05e86-f8c8-4a25-98b3-0ccfdbc1768a","resolution":{"observed_at":"2026-08-16T04:26:33.426938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:32.875357Z","title":"Cross-attentional audio-visual fusion for weakly- supervised action localization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.875357Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:9db7438397470ff555aa2b82087ddff262fc0bec29d19216bc33d95612721876","observation_id":"4a87a967-a4e1-4ec5-8d90-9d8ce76aca57","resolution":{"observed_at":"2026-08-16T04:26:32.875357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.398781Z","title":"Siamese vision transform- ers are scalable audio-visual learners","venue":null,"work_id":"377704dc-07fc-43bf-a113-424cb8a0aef1","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.879753Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:fa1bf4947580dc1a58807e8e7cdd1ee4c1c3305622761458cb8e8dbf7602064b","observation_id":"97cfe34f-ac02-4013-af24-f9410fbd6eeb","resolution":{"observed_at":"2026-08-16T04:26:33.403313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.384361Z","title":"Vision transformers are parameter-efficient audio- visual learners","venue":null,"work_id":"50492a50-0508-4217-b786-04cc7476de10","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.883993Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:b58b399f99681027203dd5cd999050ba56612a9069e04888117530243aececa0","observation_id":"19cb27be-d1c7-44cd-bc3d-7b3d14033aa8","resolution":{"observed_at":"2026-08-16T04:26:33.389148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.369401Z","title":"Active contrastive learning of audio-visual video representa- tions","venue":null,"work_id":"2c69de36-dbc8-45d3-9be1-1de656311b38","year":2020},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.888136Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:a60d53cfdb7acdee2bcbdec72831eb36e8ccc0b8fd2b8b55680cb2e67d7a7aa6","observation_id":"4aa27521-bd89-44d0-8dde-73aff2b7ec49","resolution":{"observed_at":"2026-08-16T04:26:33.374522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.354162Z","title":"Active contrastive learning of audio-visual video representa- tions","venue":null,"work_id":"f64fde47-b9ee-46ae-ba7e-6543a109eb05","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.892420Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:6dacb71fcbcf521da766b24893344eb438e1acad3ac98fbc632dfdf2476b6e87","observation_id":"c48d9fe1-9393-437e-a92b-2beeafada6ea","resolution":{"observed_at":"2026-08-16T04:26:33.359075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.340747Z","title":"Robust audio-visual instance discrimination","venue":null,"work_id":"b300ec65-1568-4abb-a6ec-08c0e7acb12c","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.896858Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:81e417b59617da7a35d41badd4dd46acf2bdf4118602b12aa88dd7c8bacefb60","observation_id":"261f2fbd-a995-4dd1-8c0e-d4548bedf6c8","resolution":{"observed_at":"2026-08-16T04:26:33.344760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.327096Z","title":"Audio- visual instance discrimination with cross-modal agreement","venue":null,"work_id":"d74336a8-be40-4992-9a6d-87c1e4008e58","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.901142Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:b4c62472e53d8cd0d2e8918d455aaf2dfa238db08f062538676bbca9b0a8510a","observation_id":"c4844cf3-ab58-4ec3-88bc-72a32a372b69","resolution":{"observed_at":"2026-08-16T04:26:33.331778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.313052Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"7b4763e8-3170-4a2b-8dca-588e8e39fa14","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.905131Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:72bef96158051f4cef30a8e8332b8d3916fece08a223d043b22ee765460c8b80","observation_id":"ded765ae-f5e6-4a40-aecb-402998a79a28","resolution":{"observed_at":"2026-08-16T04:26:33.317636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.299190Z","title":"Ambient sound provides supervision for visual learning","venue":null,"work_id":"ac4d0ec6-1b4a-4729-a964-d082660c3ff4","year":2016},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.909268Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:13729782210dd3b28cb91d0c594ed5167448cddf1e267f0afe737041592604a0","observation_id":"7e8392aa-f18e-4acf-95a7-682aaddfa66f","resolution":{"observed_at":"2026-08-16T04:26:33.303731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.284431Z","title":"On compositions of transformations in contrastive self-supervised learning","venue":null,"work_id":"63c5e04a-ca6c-46fe-887b-edaa8cf57975","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.913150Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:dfb53556970db04b7ca442fc225011d45c7af5fba3294f3c5693b074146272e9","observation_id":"1c192f66-1479-475c-a088-ee4d811c364f","resolution":{"observed_at":"2026-08-16T04:26:33.289207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.270145Z","title":"Broaden your views for self-supervised video learning","venue":null,"work_id":"097eba0f-9fd4-49f7-b13e-46dc9f8153ea","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.916743Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:0e653941407fdcce64d8d94f6a8e9debf2511dca773099cacc64dc3bd7fda792","observation_id":"741a9754-e2dc-4f0f-8cf8-db0f6c36e4ed","resolution":{"observed_at":"2026-08-16T04:26:33.274828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.255561Z","title":"Avlnet: Learning audio-visual language representa- tions from instructional videos","venue":null,"work_id":"9264cceb-cb90-4f3c-89f7-f3d27567d66d","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.920815Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:4927ebb8955d83b3d33a35a3634cd2f290519c5e2bd050881ed6f86d1a964d7b","observation_id":"6a6e6f64-3bc0-4896-80db-b4cb6659f2fc","resolution":{"observed_at":"2026-08-16T04:26:33.260253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.240601Z","title":"Self-supervised audio- visual representation learning with relaxed cross-modal syn- chronicity","venue":null,"work_id":"471e0536-8d71-4783-aa63-1c0b6515c59b","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.925091Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:03b40240d8d7d19465bca78865902d0782fd66cda4c44601bada1002134b9e5b","observation_id":"edc60b02-4d74-4097-b79c-e28efaf0a2bf","resolution":{"observed_at":"2026-08-16T04:26:33.245489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.225304Z","title":"Event-specific audio-visual fusion layers: A simple and new perspective on video understanding","venue":null,"work_id":"f779e819-f95a-4b47-8113-d61f82f84ee8","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.929279Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:009c6d97679053fcd78535a21286d6099a9437969d5f9228fda17fced55c0d8e","observation_id":"6ff6cfa9-1b25-4b6d-bf08-532115f77f59","resolution":{"observed_at":"2026-08-16T04:26:33.230436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.209735Z","title":"From vision to au- dio and beyond: A unified model for audio-visual representa- tion and generation","venue":null,"work_id":"ec63337d-e824-4903-a233-e40d3b04ea94","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.933357Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:d6feee8a5393ea2928f5b903c08648bfc33c0f81b1c76fc29eb9d24f3151df01","observation_id":"e4892cd6-6be3-40fc-ad05-52d2911f5a50","resolution":{"observed_at":"2026-08-16T04:26:33.214522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.194504Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"a129b62c-4389-4d57-9236-e7e9522d3a17","year":2023},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.937457Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:235f802fea6832efdf33a32de91416c4161d2859ee377b3e26aec52458b2e5e8","observation_id":"047fe13b-cd2f-4c29-82c8-3751fc36d5ed","resolution":{"observed_at":"2026-08-16T04:26:33.199227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12807","last_updated":"2021-04-28T15:59:38Z","snapshot_observed_at":"2026-08-16T18:28:57.432936Z","submitted_at":"2021-04-26T18:07:17Z","title":"Multimodal Self-Supervised Learning of General Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12807","snapshot_observed_at":"2026-08-16T04:26:32.941470Z","title":"Multimodal self- supervised learning of general audio representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.941470Z"},"links":{"cited_paper":"/paper/2104.12807","citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:3e3006df82b0d1ed2de240dca8a49ab3e6a1a4b169563eacc41c57a320cd26db","observation_id":"fc5418b9-2d54-4061-b30e-9488c3298d4a","resolution":{"observed_at":"2026-08-16T04:26:32.941470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.180577Z","title":"Temporal cue guided video highlight detection with low-rank audio-visual fusion","venue":null,"work_id":"5f845834-ed03-4d70-aed0-82803153c2ba","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.946526Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:5f3870129e9690fc2e01605699bd9ea598e0d158f10403fceb2f9bb480efe8ee","observation_id":"89288667-2be6-4606-8168-8889985cf1d2","resolution":{"observed_at":"2026-08-16T04:26:33.184876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.166405Z","title":"Con- trastive learning of global and local video representations","venue":null,"work_id":"0793d607-afdb-4f55-97d4-8685fc367b9a","year":2021},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.950818Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:cc2cf257acbbef4aed64417272edbf7cbf137a7581e3c2ee4da54a3bd071a136","observation_id":"8620266b-ec0c-4d5e-9ab1-4257529d94c2","resolution":{"observed_at":"2026-08-16T04:26:33.171128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.152347Z","title":"The sound of pixels","venue":null,"work_id":"4bd8c6fa-ceaa-4eaa-9a4f-fd7f59587ad7","year":2018},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.955193Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:d2602fbdca0ee338b980b457a608b2a051c3f73cf64ac269f3c47bcce820e4f6","observation_id":"a0311b32-5c5d-4fc8-abad-76a0f5d08865","resolution":{"observed_at":"2026-08-16T04:26:33.156494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:32.959437Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.959437Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:50ee4e45c09fa5d91ffb8567d71701ae5fa4a4d6be74a01291c60673e23f0935","observation_id":"aa27f171-004a-4ceb-90f0-7c343d55ca27","resolution":{"observed_at":"2026-08-16T04:26:32.959437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.128788Z","title":"Languagebind: Extending video-language pretraining to n- modality by language-based semantic alignment","venue":null,"work_id":"865a9c6c-d44d-4b76-aff3-773ed1560880","year":2024},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.964120Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:521efd23eba349f4a9026b406be6d61c77ba7f4dec225f0615016d872c8ec572","observation_id":"56ae1a59-bbaf-4163-b650-9a12be9fcba5","resolution":{"observed_at":"2026-08-16T04:26:33.133027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.114908Z","title":null,"venue":null,"work_id":"c90639b6-698c-4b90-b408-b158d13b92d6","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.968662Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:f1c09322aaeba6b4ba3d7db1f07612fa501a15d71f333376d7554f5d5870cc8f","observation_id":"12498e67-28ca-4db0-b812-1f954bcbcfff","resolution":{"observed_at":"2026-08-16T04:26:33.119294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.100162Z","title":null,"venue":null,"work_id":"bd0e880e-3f40-4ddb-b1d9-c52a630b8045","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.973334Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:ec17c60a4d28dd6b6f6cfde40051cdb047650679aa3b3d217f24b4c667fd24fd","observation_id":"9bb38671-8523-400e-a3c8-de9b7e29c955","resolution":{"observed_at":"2026-08-16T04:26:33.104530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.085281Z","title":"di- agonal mean","venue":null,"work_id":"dd34c807-8152-4543-8e59-3d6e55ab5d82","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.977885Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:353b3f103d8333df8d1668438096765391434f9c3e6be5cab17fbf070347086c","observation_id":"da8d6112-834b-4bc6-9fe2-b732aade6310","resolution":{"observed_at":"2026-08-16T04:26:33.089873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.070645Z","title":"Table 12 shows the performance comparison between register to- kens, patch tokens, and the global token","venue":null,"work_id":"72bba7fb-a983-4c31-80d0-d6431ea44e92","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.982956Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:951d4d5bec0d96ff1d1d492e9462ede56cc653e868c581b65b07ad1aac606402","observation_id":"dbef4d5f-5e60-45ce-8820-907cc749079f","resolution":{"observed_at":"2026-08-16T04:26:33.075447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.055794Z","title":"writing on blackboard with chalk","venue":null,"work_id":"dfb8cbb0-f65f-40cd-b4b8-47f5ea528a85","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.987325Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:b64f680be4b9998215f44bb0b1d16231ce60c040f4c12c7cdaf04ab6b25b68c3","observation_id":"e08250c1-bba3-4508-8115-66e6321d4225","resolution":{"observed_at":"2026-08-16T04:26:33.060343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:26:33.038877Z","title":"For this experiment, we manually annotate the occurrence of the classes throughout the video","venue":null,"work_id":"2aa12c89-9d9c-4809-b7ef-16a5f29faee2","year":null},"citing_paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:26:32.991891Z"},"links":{"citing_paper":"/paper/2505.01237"},"observation_digest":"sha256:c483f50e3c7a3da3dfcf1d5e49d5b9412d64ddac6e6d0a518dca1d3468d6beb7","observation_id":"521aa4e2-2093-47a7-aa0d-aa4e7c0f997c","resolution":{"observed_at":"2026-08-16T04:26:33.045181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.01237","last_updated":"2025-05-21T13:54:07Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-16T21:48:37.272023Z","submitted_at":"2025-05-02T12:59:58Z","title":"CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.01237."}