{"as_of":"2026-08-14T22:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9d9ce209c0394ba0287d618b6ab6e76c2c39fe2b27dcc1ad52309bb5479b26d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:58:59.991539Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":241,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-14T14:35:29.440022Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"reference_index":223,"source":"arxiv_source","source_observed_at":"2026-05-12T12:40:23.709098Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2404.08471"},"observation_digest":"sha256:b61611d971936e212829e204e1cb8ec19f2dbeca9135d0b44e821cb1dc8f403d","observation_id":"3b9d6c00-ee68-46ca-abf0-337f9c4428c8","resolution":{"observed_at":"2026-05-12T12:40:23.837332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-12T19:58:59.991539Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10503","last_updated":"2025-07-28T11:18:49Z","snapshot_observed_at":"2026-08-12T19:52:22.533472Z","submitted_at":"2024-11-15T12:59:37Z","title":"Everything is a Video: Unifying Modalities through Next-Frame Prediction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:58:59.991539Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2411.10503"},"observation_digest":"sha256:539bf79882d6a0935172357931405f6058612bce86ad18761cf75fb84dc8ad4f","observation_id":"07e62f32-e74b-472f-8214-0da90b355604","resolution":{"observed_at":"2026-08-12T19:58:59.991539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-11T15:12:27.853236Z","title":"data2vec: A General Framework for Self -supervised Learning in Speech , Vision and Language , April 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11276","last_updated":"2025-01-31T17:35:20Z","snapshot_observed_at":"2026-08-14T06:03:17.129503Z","submitted_at":"2024-12-15T18:48:14Z","title":"Wearable Accelerometer Foundation Models for Health via Knowledge Distillation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:12:27.853236Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2412.11276"},"observation_digest":"sha256:21b003173793c0b5aa1050cb83b5b0c762f423bdd85947f7acdd802fe0c8fc7f","observation_id":"1ed9d5b9-cffd-4c56-bf76-ec497633f12e","resolution":{"observed_at":"2026-08-11T15:12:27.853236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-11T14:59:01.125368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-13T14:56:43.704817Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.125368Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:e388f368a41e66d779b9730c66be87229681e5911263519732648999879d9a8d","observation_id":"c330543f-40bb-4fc7-9601-a6ce42b4e49f","resolution":{"observed_at":"2026-08-11T14:59:01.125368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-10T14:25:39.004449Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15377","last_updated":"2025-01-26T03:22:22Z","snapshot_observed_at":"2026-08-12T02:35:38.958726Z","submitted_at":"2025-01-26T03:22:22Z","title":"Fine Tuning without Catastrophic Forgetting via Selective Low Rank Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:39.004449Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2501.15377"},"observation_digest":"sha256:edcac371fab4bf72397d9a07222dabc43e2c0baa1c38783e66a9c89085fc0ca8","observation_id":"d974947f-55bc-4f6f-86e7-029b7ffc68d4","resolution":{"observed_at":"2026-08-10T14:25:39.004449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-06T22:56:46.244140Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02915","last_updated":"2025-06-25T08:38:27Z","snapshot_observed_at":"2026-08-14T02:58:17.373151Z","submitted_at":"2025-06-25T08:38:27Z","title":"Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:46.244140Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2507.02915"},"observation_digest":"sha256:3b5e5e92d2823ad48def8cf3a9c648c43d0f6efe8acf97d6d66948e74210b4be","observation_id":"4615b1ab-4aa0-48a8-b010-a13417829438","resolution":{"observed_at":"2026-08-06T22:56:46.244140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-02T22:51:44.257192Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:44.257192Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:64abdcf3cf99ac7c3b9d259349c51f1df06d41578b8af2391b4c815e092d9e89","observation_id":"0905b55d-e95d-4f7f-be9b-717b67a9e59b","resolution":{"observed_at":"2026-08-02T22:51:44.257192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2603.01482","last_updated":"2026-03-02T05:45:55Z","snapshot_observed_at":"2026-07-06T22:47:28.681790Z","submitted_at":"2026-03-02T05:45:55Z","title":"A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T17:25:27.137423Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2603.01482"},"observation_digest":"sha256:c223920e081671008e92acff1b7d4c8e99a102715799cf6e4c78ea0b96e57340","observation_id":"91668eec-41fe-4d9f-99af-25a8aa0b16dc","resolution":{"observed_at":"2026-05-15T17:26:22.168642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2605.11654","last_updated":"2026-05-18T13:48:57Z","snapshot_observed_at":"2026-08-11T01:05:14.234056Z","submitted_at":"2026-05-12T07:15:52Z","title":"Weather-Robust Cross-View Geo-Localization via Prototype-Based Semantic Part Discovery","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T01:30:53.240885Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2605.11654"},"observation_digest":"sha256:3d93fe0eea8d18d60d086c6f1e19be3a53808cbbde84e175d7a799f5fd9c18a3","observation_id":"49ee6506-dc9e-485d-9878-176673bd5659","resolution":{"observed_at":"2026-05-13T01:32:01.852772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2605.11654","last_updated":"2026-05-18T13:48:57Z","snapshot_observed_at":"2026-08-11T01:05:14.234056Z","submitted_at":"2026-05-12T07:15:52Z","title":"Weather-Robust Cross-View Geo-Localization via Prototype-Based Semantic Part Discovery","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-20T23:05:06.850388Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2605.11654"},"observation_digest":"sha256:cc385fa0d1f9b9ee489f86ee04c62783510cefa1a584962664bae453f4a6d749","observation_id":"69a43e48-2bd8-4608-ba65-c99283d46e4a","resolution":{"observed_at":"2026-05-20T23:09:11.869978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2605.15394","last_updated":"2026-05-14T20:27:32Z","snapshot_observed_at":"2026-08-14T09:58:23.517729Z","submitted_at":"2026-05-14T20:27:32Z","title":"Representation Without Reward: A JEPA Audit for LLM Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T16:27:51.512806Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2605.15394"},"observation_digest":"sha256:dde1051a7b08c4bff3d5b5959c2526a995b633efd92cbbddccf4d3ae95c7f317","observation_id":"2d7ab24c-0bdb-4767-8ce2-a343e2e7ed39","resolution":{"observed_at":"2026-05-19T16:32:39.667284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2606.09335","last_updated":"2026-06-08T11:03:25Z","snapshot_observed_at":"2026-08-07T05:59:53.128999Z","submitted_at":"2026-06-08T11:03:25Z","title":"Factors affecting ASR performance: A study using state of the art ASR models in Indic Languages","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T15:10:03.282212Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2606.09335"},"observation_digest":"sha256:9f2413e9790e5343f2aaac91d368555d68c7dd9b578304dc7f3db48107ccb596","observation_id":"3027b3ee-52dd-4804-833e-cbfd5013ad61","resolution":{"observed_at":"2026-07-03T03:37:35.494984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2606.11190","last_updated":"2026-06-10T19:46:16Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:59:58Z","title":"When to Align, When to Predict: A Phase Diagram for Multimodal Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T14:08:33.542700Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2606.11190"},"observation_digest":"sha256:332fdb1e323536c3d48f26478bd6f1a5382bc3649210c6f5204366f40df67b90","observation_id":"04035132-ae07-4059-8396-df8915f99333","resolution":{"observed_at":"2026-07-03T04:07:37.046489Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2606.11190","last_updated":"2026-06-10T19:46:16Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:59:58Z","title":"When to Align, When to Predict: A Phase Diagram for Multimodal Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T14:08:33.542700Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2606.11190"},"observation_digest":"sha256:9de2f683be5bef19edf8dc01645835fd7c755f37b07ecc74fb3a0ebf4c6c8922","observation_id":"a8e2703b-ca0e-497f-addb-d19fb1c11c46","resolution":{"observed_at":"2026-06-27T14:10:57.804524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2606.21052","last_updated":"2026-06-19T02:36:11Z","snapshot_observed_at":"2026-08-12T15:44:53.066338Z","submitted_at":"2026-06-19T02:36:11Z","title":"Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T13:27:19.810597Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2606.21052"},"observation_digest":"sha256:85ab0de5fdcb3105679ad4d2559380f344a27e8ba67ab8aed9114c7526a556f5","observation_id":"2e51db97-8530-4b54-a22f-ad767b04ccb3","resolution":{"observed_at":"2026-07-04T07:29:38.679311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2606.24910","last_updated":"2026-06-19T08:07:13Z","snapshot_observed_at":"2026-08-13T09:40:37.751064Z","submitted_at":"2026-06-19T08:07:13Z","title":"End-to-End Voice Intent Recognition for Spontaneous Human-Drone Interaction with Naive Users","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T13:30:12.101045Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2606.24910"},"observation_digest":"sha256:10b007a773dbe5cb4bb3772a75b1bc7ef14932144dbb84dc579004bfdbc91028","observation_id":"4ebe04c0-2dfd-42ed-a076-7dd7d30d21e2","resolution":{"observed_at":"2026-07-04T07:29:38.184343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2606.25225","last_updated":"2026-06-23T22:48:42Z","snapshot_observed_at":"2026-08-07T15:32:28.900926Z","submitted_at":"2026-06-23T22:48:42Z","title":"MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T23:57:19.880950Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2606.25225"},"observation_digest":"sha256:b1cf69c231c212fbbc41c1cb216e9d6cf451054e035c462ce9b94e3537d4a5b4","observation_id":"6523e947-629d-4ac5-8261-5ea0d3a08301","resolution":{"observed_at":"2026-07-04T17:09:58.611899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2607.00052","last_updated":"2026-06-30T01:23:09Z","snapshot_observed_at":"2026-08-02T17:58:34.671249Z","submitted_at":"2026-06-30T01:23:09Z","title":"AGE: Adaptive-masking for Graph Embedding in Graph Retrieval-Augmented Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-02T18:01:48.915707Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2607.00052"},"observation_digest":"sha256:d4e90687ccc15deea927628da861c48411535408640ac59e6c002fa00664624c","observation_id":"02316223-29ea-4cdb-b820-4b5528bc28c9","resolution":{"observed_at":"2026-07-02T18:47:17.215358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2607.01145","last_updated":"2026-07-23T14:49:47Z","snapshot_observed_at":"2026-08-06T15:01:44.020372Z","submitted_at":"2026-07-01T16:27:21Z","title":"Hierarchical Self-Supervised Representation Learning Framework for Multivariate Time Series Grounded in ECG Analysis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-02T15:26:51.956476Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2607.01145"},"observation_digest":"sha256:8b0be79bb68d10d72675924fed93bca47c319b41c3afca967f073482e5858c60","observation_id":"6ac91d1f-de75-4add-9c2b-70b0a85ab1ef","resolution":{"observed_at":"2026-07-02T15:27:04.540813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2607.06629","last_updated":"2026-07-09T11:36:51Z","snapshot_observed_at":"2026-08-07T01:17:33.686416Z","submitted_at":"2026-07-07T12:19:54Z","title":"STST-JEPA: Shallow-Target Spatio-Temporal Joint Embedding Prediction Architecture For EEG Self-Supervised Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T01:07:21.002787Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2607.06629"},"observation_digest":"sha256:9f16a6e8c9089f634ad7fc1c5f22d41551f1f4698dc1cf0a94d0f6bcfd7ce35d","observation_id":"d01a470f-ef3d-4fcf-8254-64077cd7dde9","resolution":{"observed_at":"2026-07-11T01:07:42.196659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":"2202.03555","doi":"10.48550/arxiv.2202.03555","metadata_source":"pith","pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language","venue":"cs.LG","work_id":"8d9afd06-2ad7-4482-9779-72480275597b","year":2022},"citing_paper":{"arxiv_id":"2607.07756","last_updated":"2026-07-08T14:01:16Z","snapshot_observed_at":"2026-08-02T22:53:58.003943Z","submitted_at":"2026-07-08T14:01:16Z","title":"The Importance of Encoder Choice:A Tabular-Image Study","version":1},"reference_index":253,"source":"arxiv_source","source_observed_at":"2026-07-10T19:03:32.353393Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2607.07756"},"observation_digest":"sha256:139b619a7bf5da6caa7b7af06a209158c6119be9521c903d809b1914bd95de3b","observation_id":"3cdf2041-ac99-4872-9fe7-3222c51f3458","resolution":{"observed_at":"2026-07-10T19:07:35.063435Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:42.8572+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-02T05:01:23.102997Z","title":"data2vec: A general framework for self-supervised learning in speech, vision and language.arXiv preprint arXiv:2202.03555,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13522","last_updated":"2026-07-15T07:21:00Z","snapshot_observed_at":"2026-08-09T08:21:58.226231Z","submitted_at":"2026-07-15T07:21:00Z","title":"Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:01:23.102997Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2607.13522"},"observation_digest":"sha256:a3f9c6292176672ed204e23160c4e2c1bc68d28d8bbebfa6e29a08bfe66b6184","observation_id":"c480e7be-a636-4039-a5ba-db5862730999","resolution":{"observed_at":"2026-08-02T05:01:23.102997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-07-31T14:47:01.466428Z","title":"Data2vec: A General Framework for Self-Supervised Learning in Speech, Vision and Language , shorttitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28204","last_updated":"2026-07-30T13:43:40Z","snapshot_observed_at":"2026-08-12T01:58:12.178361Z","submitted_at":"2026-07-30T13:43:40Z","title":"Toward Annotation-Efficient Continuous Emotion Arousal Quantification via Group-Level EEG Dynamic Neural Synchrony","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T14:47:01.466428Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2607.28204"},"observation_digest":"sha256:3703ff6909d7c54668ac4ac5da2175236b31437f4ea59ed40fb8844b4422fb98","observation_id":"28a05d06-b226-47f8-b4c1-7f63ca8827d2","resolution":{"observed_at":"2026-07-31T14:47:01.466428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2202.03555/citation-record","integrity":"/paper/2202.03555/integrity","json":"/paper/2202.03555/citation-record.json","paper":"/paper/2202.03555"},"outbound":[],"paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2202.03555."}