{"as_of":"2026-08-12T13:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0adef54fcdf9276d2d1aa83a353762a13d8c1860e876c6808946ae653a7ca91","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:11:49.190965Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22008/citation-record","integrity":"/paper/2507.22008/integrity","json":"/paper/2507.22008/citation-record.json","paper":"/paper/2507.22008"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:11:49.153861Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.153861Z"},"links":{"citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:57f465429fc3d5e6634a8c7df710b9efcca070681dc1378755542657d3ca2e13","observation_id":"6d79d9b3-fd12-48c7-8530-7ee7bc8526b9","resolution":{"observed_at":"2026-08-06T12:11:49.153861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:11:49.301685Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"3bac80d5-cf90-45e0-8933-274a09294497","year":2020},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.158237Z"},"links":{"citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:6931046286a362181a53643de02d8631af31153934372b8696396070331cc58b","observation_id":"9ffb9103-45f8-4a9b-8619-8164c84f4b08","resolution":{"observed_at":"2026-08-06T12:11:49.305108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01900","last_updated":"2022-04-28T02:13:09Z","snapshot_observed_at":"2026-08-11T10:00:42.821288Z","submitted_at":"2021-10-05T09:34:44Z","title":"DistilHuBERT: Speech Representation Learning by Layer-wise Distillation of Hidden-unit BERT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.01900","snapshot_observed_at":"2026-08-06T12:11:49.161523Z","title":"Distilhubert: Speech representation learning by layer-wise distillation of hidden-unit bert","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.161523Z"},"links":{"cited_paper":"/paper/2110.01900","citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:7d968f88926d0505b9750727dcc5f5116d872df3ecb5764cdacb2e39cc42b2c3","observation_id":"b7396ad5-a7e3-40c5-9ab8-09a77b1fbc98","resolution":{"observed_at":"2026-08-06T12:11:49.161523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:11:49.292216Z","title":"chirp\" from the","venue":null,"work_id":"b2f66054-0196-4ee7-a76a-0ee85ee873b8","year":2024},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.164942Z"},"links":{"citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:73ab5cd54cfd649032f79cb4ec1061c2fa3a1ace8a0ce8c43794763306943fc9","observation_id":"7eff41cd-a1ea-450e-998f-cc800ad4779a","resolution":{"observed_at":"2026-08-06T12:11:49.295297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:11:49.281291Z","title":"Project vaani (huggingface dataset)","venue":null,"work_id":"cf7650c6-beba-441f-9001-44126fce4afe","year":2024},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.168255Z"},"links":{"citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:38866804c69ca7f50dfb417d4248cb6cf6e9015e5fb7baac34ee1b6c085d476f","observation_id":"d9a7fc29-d51d-4283-962d-a24acd71215c","resolution":{"observed_at":"2026-08-06T12:11:49.285721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:11:49.271583Z","title":"Project vaani","venue":null,"work_id":"25008982-a523-4d47-b975-68a0e0f3576d","year":2024},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.171434Z"},"links":{"citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:dfc0a9e8a8b4cbbea983a19ffcbe5acc98abfe0468e10e9567823172c1ee77c2","observation_id":"4df5d955-ad3a-4b3d-9c9a-5e0b45218d97","resolution":{"observed_at":"2026-08-06T12:11:49.274559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:11:49.262529Z","title":"Vo, Patrick Labatut, and Piotr Bojanowski","venue":null,"work_id":"d5b41752-8873-4bcf-beac-857f5c72afe0","year":2025},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.174798Z"},"links":{"citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:32ba699f510dc7774371f8d412f98fd342dedda62022962271f4b6f7e1fd41b3","observation_id":"bbdd71e6-9a7c-4701-a062-80cc9f3c674b","resolution":{"observed_at":"2026-08-06T12:11:49.265612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T12:11:49.178168Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.178168Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:1775296581e7f99f3b58a32406be51a569161b2687753ff8263ad56b9f165dd3","observation_id":"68e10076-8d75-4e86-8417-2c27eba76b15","resolution":{"observed_at":"2026-08-06T12:11:49.178168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:11:49.252667Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"00db7194-c5ed-49ed-975e-99208ef9659b","year":2021},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.181378Z"},"links":{"citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:73f23198e50de9ad040957847b99ce2c4f2a3ba60f9ef2a9ed126b48fc0eac53","observation_id":"f35682fe-08d5-49b1-a949-def07971cdd1","resolution":{"observed_at":"2026-08-06T12:11:49.256044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:11:49.243432Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":"9ab9b8bb-157e-4c17-9431-75e6294a8c56","year":2022},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.187601Z"},"links":{"citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:59aea2be7fec00ded8806fd60b377084bc5c958f2f28f762636dad3fbed32fdf","observation_id":"b4d4be16-a38c-4ff1-9b15-04a265516705","resolution":{"observed_at":"2026-08-06T12:11:49.246621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:11:49.231645Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"b9b4f493-a7fc-41f3-9d82-d5cd937cd6d5","year":2022},"citing_paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T12:11:49.190965Z"},"links":{"citing_paper":"/paper/2507.22008"},"observation_digest":"sha256:5cd45159113cc8463b6bb54e824b2e1eee6c61a27f8bbf6511fb507ef5630ccb","observation_id":"5eb1de39-ff1c-4f5b-84fc-47a35be25fc3","resolution":{"observed_at":"2026-08-06T12:11:49.236473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22008","last_updated":"2025-07-29T16:58:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T23:23:54.481335Z","submitted_at":"2025-07-29T16:58:52Z","title":"VeS: Teaching Pixels to Listen Without Supervision"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2507.22008."}