{"as_of":"2026-08-10T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e3f1ab94b5c4f19b2ef8c25118c0147c8658f39bcddd06661980dbccc381748","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:02:47.086421Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:02:44.662433Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T17:02:47.349677Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"cited_work":{"arxiv_id":"2507.11967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.11967","snapshot_observed_at":"2026-08-06T17:02:47.349677Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","venue":"cs.CV","work_id":"5201c818-a667-4c67-b617-1ee4bb4f12f7","year":2025},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.662433Z"},"links":{"cited_paper":"/paper/2507.11967","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:93bd91a59fe9e62617ba29a38d9d5607b3f5f6d3c53e65759610e82483c9235b","observation_id":"3b82f3c9-ed53-401e-b29b-d85ffdd59aa9","resolution":{"observed_at":"2026-08-06T17:02:47.407214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.11967/citation-record","integrity":"/paper/2507.11967/integrity","json":"/paper/2507.11967/citation-record.json","paper":"/paper/2507.11967"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"cited_work":{"arxiv_id":"2507.11967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.11967","snapshot_observed_at":"2026-08-06T17:02:47.349677Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","venue":"cs.CV","work_id":"5201c818-a667-4c67-b617-1ee4bb4f12f7","year":2025},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.662433Z"},"links":{"cited_paper":"/paper/2507.11967","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:93bd91a59fe9e62617ba29a38d9d5607b3f5f6d3c53e65759610e82483c9235b","observation_id":"3b82f3c9-ed53-401e-b29b-d85ffdd59aa9","resolution":{"observed_at":"2026-08-06T17:02:47.407214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.725496Z","title":"We also propose to automatically gener- ate audio-visual-text triplets from unlabeled videos, which are subsequently used for training LG-CA V-MAE","venue":null,"work_id":"dca97a3d-5ee9-4224-b8dc-302038c694b7","year":null},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.810201Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:f3a947fdc20616027e0ec4b3b9cdd7e7eed1aa7ad5c91171e3133563260842b1","observation_id":"e914d1db-ca25-4909-abb0-28cfae130dff","resolution":{"observed_at":"2026-08-06T17:02:49.780523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.576640Z","title":null,"venue":null,"work_id":"20f37126-af83-432b-b040-2beff694bd76","year":null},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.891841Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:30b6f9c9c3567cf925c455799fce061067eb5d91f5adfdaeb9110726670f8585","observation_id":"48449906-1dcf-4cea-a384-8751903f7c49","resolution":{"observed_at":"2026-08-06T17:02:49.645247Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.423332Z","title":null,"venue":null,"work_id":"b56e5a43-8be8-493e-b4ad-d3c1e6ec6757","year":null},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:44.961943Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:391c19581a87ea1e00f6ac3ead809d7a83b888dc71daa6a30d707cf86596ee1d","observation_id":"90ee5293-c267-4109-910d-530c82239868","resolution":{"observed_at":"2026-08-06T17:02:49.526984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-08-10T01:58:32.784453Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-06T17:02:45.037290Z","title":"Contrastive audio-visual masked au- toencoder,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.037290Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:c02a31497a9c84b4a54870add4014c1632cc72a75fdefc34f656f73595716767","observation_id":"90dd38b2-8ab7-4064-bc64-7caa43145675","resolution":{"observed_at":"2026-08-06T17:02:45.037290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.255903Z","title":"Mavil: Masked audio-video learners,","venue":null,"work_id":"9f0e61d7-09fa-4b2b-baab-59acaa599eb2","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.118282Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:2338446dfcf8f522815de3b32346fad1c527af6f1188dfa7834ad17192b56804","observation_id":"92d8bf79-fc66-4056-a9b1-5e2c4ae02a20","resolution":{"observed_at":"2026-08-06T17:02:49.361832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:49.092225Z","title":"Audiovisual masked autoencoders,","venue":null,"work_id":"945e821f-9fa2-4ab5-b196-a87f84341101","year":2023},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.248428Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:18ca70d448551bffa81f2cae1e726d008158c7fdb385138a6e6a9c19a7d033dd","observation_id":"0509ec62-d6a4-442b-8677-a82e7db0a7fd","resolution":{"observed_at":"2026-08-06T17:02:49.178565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:45.369591Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.369591Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:d81dc90d07c1703080e8ee59729c4d73641c8867c8af7388757710a3b3c8d5cd","observation_id":"fa779b7d-4f7c-489a-a940-a87fd09879ca","resolution":{"observed_at":"2026-08-06T17:02:45.369591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T17:02:45.445056Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.445056Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:4b99f130a72b5478877eb2f5d29e2f5116c0444381513eed1c828832aa45c38e","observation_id":"4d1168e6-07ab-4819-86bd-c915906aaf85","resolution":{"observed_at":"2026-08-06T17:02:45.445056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.938463Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":"9dbc438b-bd35-4a1f-b6a9-3dc0191325db","year":2020},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.534477Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:205e806a732e47dfb3067468e138afc3a8269402c13420dfae0705b470bc2c27","observation_id":"437a2c0e-0f7f-474a-b31a-b038349e3fd5","resolution":{"observed_at":"2026-08-06T17:02:49.032112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.744844Z","title":"Acav100m: Automatic curation of large-scale datasets for audio-visual video representation learning,","venue":null,"work_id":"42cb8569-fda3-46cb-ab08-4e94d23e541e","year":2021},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.622514Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:b9251e02f514f8b528aae36cc4812ba8429ec7bf6cf2f448ae178616ce698694","observation_id":"a805f781-fdf6-4ca9-833e-05d4e3e771e1","resolution":{"observed_at":"2026-08-06T17:02:48.834728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11729","last_updated":"2024-09-18T06:38:48Z","snapshot_observed_at":"2026-07-06T19:17:23.847280Z","submitted_at":"2024-09-18T06:38:48Z","title":"DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information","version":1},"cited_work":{"arxiv_id":"2409.11729","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.11729","snapshot_observed_at":"2026-08-06T17:02:47.225233Z","title":"DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information","venue":"cs.MM","work_id":"019133ec-468a-4248-9d98-e905c0cc458a","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.719897Z"},"links":{"cited_paper":"/paper/2409.11729","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:c41eda584110c87e964d487a63a33bb718e83265ea83cc8c03a38d25f2ff0550","observation_id":"80c6ccf8-756a-4288-a4d3-17eed4ed3939","resolution":{"observed_at":"2026-08-06T17:02:47.273577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:45.866977Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.866977Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:924734da4792a9b5e3bd7f25dec5d941e09e0fd6db5b94270f22540b987a2aa0","observation_id":"f32d6421-83f9-4433-a70f-2b1f887c27f3","resolution":{"observed_at":"2026-08-06T17:02:45.866977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.530944Z","title":"Dense-captioning events in videos,","venue":null,"work_id":"33292fe9-ce97-40ea-ad30-e4fa8e2fb561","year":2017},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:45.967626Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:d6e5e390f535b532e552cf82f08700e15a062695ac3177840b92d008d11518f2","observation_id":"308d9055-154c-49cf-98d4-6832043d1a37","resolution":{"observed_at":"2026-08-06T17:02:48.623107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.390009Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips,","venue":null,"work_id":"0c22f382-a3af-4f0c-a516-0fe8705a1d2e","year":2019},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.050837Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:a480d8b39907dc446aa905e4dfad6adf03957bbfc8cf65b18f2f1bef4be53a49","observation_id":"67eb9617-c53e-48fe-8b5f-e4b75ad074fa","resolution":{"observed_at":"2026-08-06T17:02:48.467621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.233053Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video- and-language research,","venue":null,"work_id":"741b1e7a-494d-431b-9b89-6b39c0380173","year":2019},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.141712Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:5fe1f9d8fefd1a71fe0568246de852fa8b0efefc494c5ae71be1488c68b74cdb","observation_id":"51708959-5173-4272-b622-144a7580e5dd","resolution":{"observed_at":"2026-08-06T17:02:48.312845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.131728Z","title":"Avset-10m: An open large-scale audio-visual dataset with high correspondence,","venue":null,"work_id":"015ca15a-4af9-4861-9a23-9cf1c234d77a","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.219041Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:d89274f0a7aa589f5544b7f34a02bf9ea40765f0b8805131f6cc4607714b158c","observation_id":"1ad27a96-7e47-4f48-a2ac-5410af91390a","resolution":{"observed_at":"2026-08-06T17:02:48.184192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:48.001742Z","title":"Sound event envelope estimation in polyphonic mixtures,","venue":null,"work_id":"1392f2e5-b028-4fcb-ac7b-92778db86d30","year":2019},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.290229Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:8f3ea6456fd54aa0010a331d2ca5e20e093fc419c9b3d216082bac5e4eac5073","observation_id":"b7a7a21c-6951-4462-ad65-f7a9b733d473","resolution":{"observed_at":"2026-08-06T17:02:48.052660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:47.859979Z","title":"Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"9a7bc7c1-e336-453b-ad53-c6b5cb4fd604","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.366677Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:78a40ee86aae35c9b78c41a9eafbfd473da56b770ffb311cca161e8aa2a43e4d","observation_id":"6e7b2256-3a88-40ee-a052-4f261cc9ebde","resolution":{"observed_at":"2026-08-06T17:02:47.918457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-07-06T16:00:29.832559Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-08-06T17:02:46.431246Z","title":"Lp-musiccaps: Llm-based pseudo music captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.431246Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:4de9e70da04577b01fa80d5b38e7352494171fe6f2b9e3333c49e103effb5414","observation_id":"a5be9aea-0026-43be-80c2-0534256b5b45","resolution":{"observed_at":"2026-08-06T17:02:46.431246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04416","last_updated":"2025-01-01T13:46:37Z","snapshot_observed_at":"2026-07-06T18:41:53.152987Z","submitted_at":"2024-07-05T11:07:13Z","title":"Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04416","snapshot_observed_at":"2026-08-06T17:02:46.490467Z","title":"Sound-vecaps: Improving audio generation with visual enhanced captions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.490467Z"},"links":{"cited_paper":"/paper/2407.04416","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:6726875bbe4dae4bb9a39ea45be7af56f1e66966966a20419ae847d3e3b28e00","observation_id":"400238fd-6039-465d-a1a4-3597ab50cd9d","resolution":{"observed_at":"2026-08-06T17:02:46.490467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-06T17:02:46.554864Z","title":"A short note on the kinetics-700 human action dataset,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.554864Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:f768a15193b4caf4690a1ce510b7cc301178fd59e3fc97d4f09e7184c315bd7d","observation_id":"1a5b6cb5-3de1-4f72-bfa6-25d959fd7fb7","resolution":{"observed_at":"2026-08-06T17:02:46.554864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:46.631137Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.631137Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:b79dfba0abc0c899ce01aeb58f9169ba5484539d558cf0f682dada80869d16da","observation_id":"5bb31ecb-e7fc-4aca-95e5-5150ce7a52c4","resolution":{"observed_at":"2026-08-06T17:02:46.631137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T17:02:46.721538Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.721538Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:050047ef5dd137849861821b5654a542b9fd822f9f112538dd27b48c68b6c007","observation_id":"b0fef977-f530-4dcc-aef9-3cbe601b25c4","resolution":{"observed_at":"2026-08-06T17:02:46.721538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:47.744313Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"a9d81513-70db-47e1-a701-2c84ccc07575","year":2023},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.808652Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:04cf17f93294c8ebe21a11f791c6e861878cf147172aff8bb4e6eb82380f0688","observation_id":"c2c7a069-6bc6-4f75-95bd-94993b383002","resolution":{"observed_at":"2026-08-06T17:02:47.788088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:47.588455Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"000636a6-61db-49c7-9441-cd3631eb2ae2","year":2024},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.889581Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:f0c853394ac2e8ba25a4366cae8462b18bca0f2d94f0aae234d011fc36b8a513","observation_id":"66b550c5-b6d1-4fed-8b0f-f17f9697ef9c","resolution":{"observed_at":"2026-08-06T17:02:47.651647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-08-09T00:43:35.974628Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-06T17:02:46.945121Z","title":"Audiovisual slowfast networks for video recognition,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.945121Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:347b4aa45804fa201bd9c5092df4d60872fa2b3aa61a3e03bb7bffbceb7c0c85","observation_id":"56600a93-ee73-4a74-9978-01870ce512b2","resolution":{"observed_at":"2026-08-06T17:02:46.945121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:02:47.451533Z","title":"Masked autoencoders that lis- ten,","venue":null,"work_id":"1f50673a-2969-436e-958c-19b90b8553b3","year":2022},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:46.993705Z"},"links":{"citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:595dfb42b342e6f2596810ab431eddda0e681a8e260644a54c71438d55bab4cc","observation_id":"099ed48e-97e1-4aa7-ad83-aa66bface629","resolution":{"observed_at":"2026-08-06T17:02:47.513305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T17:02:47.086421Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:02:47.086421Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.11967"},"observation_digest":"sha256:5049c8a74a175e1a6624d32749a8b0cbb1b8e55ad41261602d4ce1d34c87cf3b","observation_id":"24cb7e99-41c5-435f-9db0-83539c10c1bc","resolution":{"observed_at":"2026-08-06T17:02:47.086421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.11967","last_updated":"2025-07-16T06:58:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T02:00:05.966441Z","submitted_at":"2025-07-16T06:58:14Z","title":"Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2507.11967."}