{"as_of":"2026-08-11T18:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78f01b37dfc33e932c52a5dc0a4df8d2e4b831e60ba2e3cfc1852f908cf57af5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:05:44.339061Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":109,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":"2207.06405","doi":"10.48550/arxiv.2207.06405","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://doi.org/10","venue":"arXiv (Cornell University)","work_id":"4be71eb6-f826-4371-9bdc-e7f8f5c52c5a","year":2022},"citing_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T04:17:19.878360Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2304.07193"},"observation_digest":"sha256:4cfbb7874d4ac16743fd299bf56336d654a830eda8a3610f56f7792a2dd6513f","observation_id":"d5ad5530-cbb2-4705-9211-1bfe7ba1c95d","resolution":{"observed_at":"2026-05-09T04:17:20.373783Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":"2207.06405","doi":"10.48550/arxiv.2207.06405","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://doi.org/10","venue":"arXiv (Cornell University)","work_id":"4be71eb6-f826-4371-9bdc-e7f8f5c52c5a","year":2022},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:cb032a51af63d575a23c89629ad0623dd7adf40f6c14d7671efb73df7bbbeabc","observation_id":"bfa0710a-8e46-48f8-bbd4-a7d3373df7f0","resolution":{"observed_at":"2026-05-13T09:41:38.097331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-07T01:05:44.339061Z","title":"Masked autoencoders that listen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12222","last_updated":"2025-06-13T20:48:46Z","snapshot_observed_at":"2026-08-07T05:03:50.906639Z","submitted_at":"2025-06-13T20:48:46Z","title":"SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T01:05:44.339061Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2506.12222"},"observation_digest":"sha256:2fac82df1d99e802e65726de50649b55cd949c350b5c93f03bfe489e2014a99e","observation_id":"aa434d91-4f9b-4397-8fd1-5e44eef43cdd","resolution":{"observed_at":"2026-08-07T01:05:44.339061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-06T22:56:46.264640Z","title":"Masked Autoencoders that Listen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-10T06:26:17.946083Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.264640Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:ca9fc119ba89a1ff2732662788930e5c971b392c7be5e4a2378f12a2d3937ba1","observation_id":"f0292ae4-b77a-4c7d-af57-a5001062a6ac","resolution":{"observed_at":"2026-08-06T22:56:46.264640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-03T07:06:33.202888Z","title":"Masked autoencoders that listen, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.21402","last_updated":"2026-07-02T10:34:29Z","snapshot_observed_at":"2026-08-06T16:31:01.007730Z","submitted_at":"2026-01-29T08:40:37Z","title":"SemanticAudio: Audio Generation and Editing in Semantic Space","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T07:06:33.202888Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2601.21402"},"observation_digest":"sha256:75e96b2ce641b62cfaa6ad5890244d5af9908fe95be0d382c9312f04b19a6877","observation_id":"d6c844de-79e1-47a2-b8bb-4dd9e91d88a5","resolution":{"observed_at":"2026-08-03T07:06:33.202888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":"2207.06405","doi":"10.48550/arxiv.2207.06405","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://doi.org/10","venue":"arXiv (Cornell University)","work_id":"4be71eb6-f826-4371-9bdc-e7f8f5c52c5a","year":2022},"citing_paper":{"arxiv_id":"2603.03190","last_updated":"2026-05-18T03:37:10Z","snapshot_observed_at":"2026-07-06T22:47:41.997192Z","submitted_at":"2026-03-03T17:47:09Z","title":"Expectation and Acoustic Neural Network Representations Enhance Music Identification from Brain Activity","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T11:36:06.967549Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2603.03190"},"observation_digest":"sha256:658bf9d5aac8bd4a905db7c0c87e6e5abc11f9af8a9b4b504f51bbdf8d75b39d","observation_id":"d0daf660-63c1-4fc8-b0ef-7015ef907c77","resolution":{"observed_at":"2026-05-21T11:40:03.500473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":"2207.06405","doi":"10.48550/arxiv.2207.06405","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://doi.org/10","venue":"arXiv (Cornell University)","work_id":"4be71eb6-f826-4371-9bdc-e7f8f5c52c5a","year":2022},"citing_paper":{"arxiv_id":"2606.09780","last_updated":"2026-06-08T17:40:09Z","snapshot_observed_at":"2026-08-02T06:40:06.285701Z","submitted_at":"2026-06-08T17:40:09Z","title":"Quality-Diversity Search in Sound Generation: Investigating Innovation Engines for Audio Exploration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T15:00:28.073970Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2606.09780"},"observation_digest":"sha256:d934b4860b705b362f6ead4bfe83cd5e101bce0748470e6b473804f4db0c1a91","observation_id":"54cbb9ff-6ea7-4fb9-9ce4-0d674736572e","resolution":{"observed_at":"2026-06-27T15:00:58.763197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen","version":3},"cited_work":{"arxiv_id":"2207.06405","doi":"10.48550/arxiv.2207.06405","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.06405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://doi.org/10","venue":"arXiv (Cornell University)","work_id":"4be71eb6-f826-4371-9bdc-e7f8f5c52c5a","year":2022},"citing_paper":{"arxiv_id":"2606.21411","last_updated":"2026-06-19T13:26:06Z","snapshot_observed_at":"2026-08-07T05:12:21.264658Z","submitted_at":"2026-06-19T13:26:06Z","title":"CoughPhase-CLR: Designing an acoustics-informed foundation model for coughing sound classification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T12:56:07.348171Z"},"links":{"cited_paper":"/paper/2207.06405","citing_paper":"/paper/2606.21411"},"observation_digest":"sha256:dd7cb33a3b1932b1f850e49ca03125a4bfc0d32b5e2a70b8de37fe2b1af94e88","observation_id":"a3d6e0aa-e3b0-4ef4-9958-aee1ab772c79","resolution":{"observed_at":"2026-06-26T12:59:29.459339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2207.06405/citation-record","integrity":"/paper/2207.06405/integrity","json":"/paper/2207.06405/citation-record.json","paper":"/paper/2207.06405"},"outbound":[],"paper":{"arxiv_id":"2207.06405","last_updated":"2023-01-12T05:22:31Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T13:30:58.601457Z","submitted_at":"2022-07-13T17:59:55Z","title":"Masked Autoencoders that Listen"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2207.06405."}