{"as_of":"2026-08-10T03:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e069c04654d8202466f564b4b18f20342ca11170372b9aebc330c0a1a98d82b7","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:52:54.973978Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05409/citation-record","integrity":"/paper/2506.05409/integrity","json":"/paper/2506.05409/citation-record.json","paper":"/paper/2506.05409"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-08-07T13:01:28.667448Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-07T10:52:54.657235Z","title":"Deep vit features as dense visual descriptors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.657235Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:4c69cc02407db382df8e938cac677a93785b6f313ded09c05aef9295e7171281","observation_id":"0c4c77bd-525f-4379-b8ac-ad7ba49c8b22","resolution":{"observed_at":"2026-08-07T10:52:54.657235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.662402Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.662402Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:248a39956482c5d7aa81c29bff323057c9e83b4ec76220eb4b7ff84ab7d0b27d","observation_id":"8f4f1e59-bdc1-417a-94f1-0755f3bcd612","resolution":{"observed_at":"2026-08-07T10:52:54.662402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.608230Z","title":"Towards in-context scene understanding","venue":null,"work_id":"bed977f9-3d4a-4b3a-ba46-08400be2132b","year":2024},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.666837Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:237f9b53d243281eaee78b3c7fa239b8529f482e26d3572e41d0775546f54b22","observation_id":"39f8aa84-736b-4159-b3c9-ac111e486596","resolution":{"observed_at":"2026-08-07T10:52:55.613282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-07T10:52:54.797778Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.797778Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:7077947cd45642331d9aca9695219616618b6833374ab990e8e84addb1a56b42","observation_id":"d601e02e-6555-4c2b-bed4-86e731552f7b","resolution":{"observed_at":"2026-08-07T10:52:54.797778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-07T08:01:08.867333Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-07T10:52:54.802249Z","title":"Are we done with imagenet? arXiv preprint arXiv:2006.07159, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.802249Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:fa83e0e868aadff448be9671555cd7ecfdc71f157ab5b63192631205769a0a03","observation_id":"d4e66b74-3c82-41a3-91cd-9a3d2daea8e2","resolution":{"observed_at":"2026-08-07T10:52:54.802249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-07-06T07:30:18.170401Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-07T10:52:54.806304Z","title":"Monet: Unsupervised scene decomposition and representation","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.806304Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:c0acb1386bba9d6da2668d8a9260ed717ddeecf382228ddcf83515526e234fb6","observation_id":"fd8d6619-be2a-41c8-80f6-6679c54ededb","resolution":{"observed_at":"2026-08-07T10:52:54.806304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.811166Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.811166Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:0d63a8698ca5b914b09065b6becda19ee02bc1c1495c50809ac550fde159dd9a","observation_id":"3ab378cd-c2ec-4af3-aa9d-9ce881e0176d","resolution":{"observed_at":"2026-08-07T10:52:54.811166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.815084Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.815084Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:19702e7f367fd9cf3fc553f256c5b6cccacba854b1679186ca4b0f1baaa5e2ff","observation_id":"2bc2c9a5-7fa3-49c1-a992-c00bf875414b","resolution":{"observed_at":"2026-08-07T10:52:54.815084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.818818Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.818818Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:d7965f123eb7efaea11ebae1543eec630a2d3acb1a9a17fc131c216a53b4969a","observation_id":"9c82dc22-3163-4437-b965-6312223d0ff1","resolution":{"observed_at":"2026-08-07T10:52:54.818818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.822453Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.822453Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:88d71c96961d39ebe2030b3c27d2c3f601165b24c38b864c356ba3134e89da1d","observation_id":"6299418c-e640-408f-9168-6fa5a6d2a5e3","resolution":{"observed_at":"2026-08-07T10:52:54.822453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T10:52:54.826195Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.826195Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:6015541c1e0356b83895aef50060ae7e48b0036f6aad1969d1d92f69424836d1","observation_id":"67f2652a-8366-43d9-8cec-7b9faaf0147f","resolution":{"observed_at":"2026-08-07T10:52:54.826195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.554899Z","title":"On the transfer of object-centric representation learning","venue":null,"work_id":"057f9138-bd3b-4891-84b6-7bb81ae89b7a","year":2025},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.830333Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:a394fcb74866cef708453a9520fbc3a89f04b20af14f2bf5e6b7c4281fe07b53","observation_id":"85f2dc7d-ebbe-4e57-8242-e868f51b76f3","resolution":{"observed_at":"2026-08-07T10:52:55.559232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.541131Z","title":"Attention over learned object embeddings enables complex visual reasoning","venue":null,"work_id":"eb4a1f21-10c1-4297-8057-cf657befcff7","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.833978Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:43de7ba83e50c7f9874637b157457c2792a604cd03f6ec5a075f36bffea54a4f","observation_id":"263ed725-ad70-4fa0-bbb4-5400f5cb24b8","resolution":{"observed_at":"2026-08-07T10:52:55.545518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T10:52:54.837670Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.837670Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:9770ebfc66788e3cd8186dc5dd809a430ec303fc6ec9012a4ac144fc19044681","observation_id":"54bf1c76-00f2-4e1e-9baa-e2726dd3ca84","resolution":{"observed_at":"2026-08-07T10:52:54.837670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.841715Z","title":"The pascal visual object classes challenge: A retrospective","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.841715Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:2a5bc9259145e56a2843c55d0da5bf30f7f0ccb8a842ac4b3dadd69a3e30fa21","observation_id":"d8b15774-5d64-403f-80cc-e47d18cce68e","resolution":{"observed_at":"2026-08-07T10:52:54.841715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.845527Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.845527Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:8081169141e7df5662654fdfdf2ee95764a4099f88d3d867d17f92af70720181","observation_id":"2662183d-8910-4f6d-b7c4-603567a3e4f7","resolution":{"observed_at":"2026-08-07T10:52:54.845527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08414","last_updated":"2022-03-16T06:08:47Z","snapshot_observed_at":"2026-08-05T19:30:04.459795Z","submitted_at":"2022-03-16T06:08:47Z","title":"Unsupervised Semantic Segmentation by Distilling Feature Correspondences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08414","snapshot_observed_at":"2026-08-07T10:52:54.849121Z","title":"Unsupervised semantic segmentation by distilling feature correspondences","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.849121Z"},"links":{"cited_paper":"/paper/2203.08414","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:b64a14db313ca73aa8d96c056d90bb9d01483336b01e0de917cd53e468c45e30","observation_id":"72ff2598-229a-4858-af51-980ec1c33472","resolution":{"observed_at":"2026-08-07T10:52:54.849121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.508564Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"5e7b3a7f-92b2-4bf6-8054-8f99bac8138d","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.853099Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:42bb33f1d0b47afaeecac021f1e763c64c538e1929c606ae3a0527ea14213598","observation_id":"af5ffdda-990a-4b83-baf3-f15dbf0de28e","resolution":{"observed_at":"2026-08-07T10:52:55.513013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.495438Z","title":"Efficient visual pretraining with contrastive detection","venue":null,"work_id":"4bb6f09c-e982-47f6-980f-9890913d95d8","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.856862Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:3050d6c12773152cd383bda33689c59f221dae0062ee1f135e7a54d555661670","observation_id":"1fb37551-0c9e-4e79-9c16-9b27a6ff328c","resolution":{"observed_at":"2026-08-07T10:52:55.499495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.481858Z","title":"Object discovery and representation networks","venue":null,"work_id":"e5d78089-285a-4d5d-9f3f-8a73d4ee5e48","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.860732Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:d809e0d760573438118c6a6e7df4628979723084a376ecf565f61273458e621a","observation_id":"808d2e15-e936-4218-8433-32d75d576558","resolution":{"observed_at":"2026-08-07T10:52:55.486121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.864448Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.864448Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:5bbf455925846e32b115d96db5ff0ad16e7642221951fb75066224e6e3ef3774","observation_id":"218af056-abeb-4cd7-aa74-1ac8f2c8b639","resolution":{"observed_at":"2026-08-07T10:52:54.864448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07855","last_updated":"2024-03-03T09:57:57Z","snapshot_observed_at":"2026-08-09T06:55:58.350502Z","submitted_at":"2023-10-11T19:57:51Z","title":"CrIBo: Self-Supervised Learning via Cross-Image Object-Level Bootstrapping","version":2},"cited_work":{"arxiv_id":"2310.07855","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07855","snapshot_observed_at":"2026-08-07T10:52:55.100358Z","title":"CrIBo: Self-Supervised Learning via Cross-Image Object-Level Bootstrapping","venue":"cs.CV","work_id":"a1adae35-a480-46d2-8fdc-32dcf38ff242","year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.868199Z"},"links":{"cited_paper":"/paper/2310.07855","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:0c1477d430e07fa4ffb0e9da665950242ff9f9436e02caf262e247db87ab7cd1","observation_id":"bfbcf340-dcd5-43b8-92d1-87691d22e3bd","resolution":{"observed_at":"2026-08-07T10:52:55.106571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.872053Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.872053Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:82bc6e9fdc202824ef2a89fdd7a358e20376022dab87387ab739f1420e4e83a8","observation_id":"32f05046-d05f-442a-b0ca-db80917fbbd6","resolution":{"observed_at":"2026-08-07T10:52:54.872053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.449222Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"f372f24b-3fea-423b-ac96-651c53c39ca3","year":2024},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.875853Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:1466a72b023c21526375342086e26a3e9c4f874fc99ffad3fcab436088a88887","observation_id":"dc097102-f3a6-4cac-bc94-2a7590b8a648","resolution":{"observed_at":"2026-08-07T10:52:55.453723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.879463Z","title":"Object-centric learning with slot attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.879463Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:ec7c955470aa6ad9848ad8819e4936d79af716069b9bd2510b5b5c903f47e2a9","observation_id":"77737830-6a7d-4300-a8ba-e13d6cac174d","resolution":{"observed_at":"2026-08-07T10:52:54.879463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.425959Z","title":"Class-agnostic object detection with multi-modal transformer","venue":null,"work_id":"3eb5a763-9fc2-4a76-8e14-811183eb7331","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.883202Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:05d778a2fe216e770f64a464cc4eb38c84d2c6a42d389debacf9406de171b66c","observation_id":"3090c0ee-6db9-4f8e-9af0-b3132d803359","resolution":{"observed_at":"2026-08-07T10:52:55.430040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15589","last_updated":"2025-03-03T11:48:03Z","snapshot_observed_at":"2026-07-06T18:50:00.486434Z","submitted_at":"2024-07-22T12:26:08Z","title":"Exploring the Effectiveness of Object-Centric Representations in Visual Question Answering: Comparative Insights with Foundation Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15589","snapshot_observed_at":"2026-08-07T10:52:54.887043Z","title":"Exploring the effectiveness of object-centric representations in visual question answering: Comparative insights with foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.887043Z"},"links":{"cited_paper":"/paper/2407.15589","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:0431dee3f7c263b9a798353305b089108833ac604c547f95e1d5b2b5983f762f","observation_id":"4b8de29f-a972-4d86-b301-0374c377f368","resolution":{"observed_at":"2026-08-07T10:52:54.887043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.412431Z","title":"Unsupervised learning of dense visual representations","venue":null,"work_id":"676e81de-1047-47fe-8109-536295204584","year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.891247Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:e5d235ae51ebd276b989801006c3ce567038d35fcddc7b358cbf1b330267f9cf","observation_id":"d30f897e-0ba8-4e5d-9208-a8839eadecd8","resolution":{"observed_at":"2026-08-07T10:52:55.416858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.399104Z","title":"Neural congealing: Aligning images to a joint semantic atlas","venue":null,"work_id":"acf3cc8b-f5ed-4abd-b052-3c0fd9fad6fb","year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.894863Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:75bc327b19a7cb2aa8494a6b6d41132ceed309156466c0af8f025654535e3537","observation_id":"969274a8-d206-4e24-b87b-dc8e53d88812","resolution":{"observed_at":"2026-08-07T10:52:55.403336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T10:52:54.898506Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.898506Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:2adebc13a3729b684d91eeb3edc3b34c191cad4c05ccbfb6d874d4dce2828ee8","observation_id":"861c41db-1346-4146-bde7-de33800adf3e","resolution":{"observed_at":"2026-08-07T10:52:54.898506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.385710Z","title":"Improving language understanding by generative pre-training.(2018), 2018","venue":null,"work_id":"ad906de3-5cef-46bb-9773-2e9b21cfd3c6","year":2018},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.902139Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:a5ff03e17bfd29df25ad7e8a709c4d2c69e2d1361e9c2d2fd3ac709d92995d33","observation_id":"027c8501-67b8-4c3c-ad2b-f0a534165b98","resolution":{"observed_at":"2026-08-07T10:52:55.389838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.906427Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.906427Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:2c16296fb38e0ef609be80a910b8a6c51284324891f4971595dae7ee5b3a3204","observation_id":"3b797630-d64c-402c-a2ca-98a1076a9a89","resolution":{"observed_at":"2026-08-07T10:52:54.906427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T10:52:54.910228Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.910228Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:67e59abb1805711842595b15f553b908c3453441de53c1cc1ba0360539e67939","observation_id":"d89c2bf2-2718-4400-95ba-7d5a8618fc91","resolution":{"observed_at":"2026-08-07T10:52:54.910228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.914054Z","title":"Do imagenet classifiers generalize to imagenet? In International conference on machine learning, pages 5389--5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.914054Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:687fe71b95e0c6ed81207be0f6184a987cd102371f578c4a4fdff10dfe3b9d31","observation_id":"4cf3507e-0984-47a2-b9a9-dc5fd72da7f1","resolution":{"observed_at":"2026-08-07T10:52:54.914054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.918254Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.918254Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:a82cfc09747cc4dc37fcd0da1796d15fbc2ae957e0b579f67c3594688b032115","observation_id":"7619d09c-7cee-4089-9e7a-f6e24c628ba5","resolution":{"observed_at":"2026-08-07T10:52:54.918254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07092","last_updated":"2025-04-10T21:45:00Z","snapshot_observed_at":"2026-08-07T16:07:06.100185Z","submitted_at":"2025-04-09T17:59:05Z","title":"Are We Done with Object-Centric Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07092","snapshot_observed_at":"2026-08-07T10:52:54.922097Z","title":"Are we done with object-centric learning? arXiv preprint arXiv:2504.07092, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.922097Z"},"links":{"cited_paper":"/paper/2504.07092","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:01bbdc79b8a362049f0b89821751da6906d4aa3ac2ae9e842605282d4d4ca7c4","observation_id":"baf18923-4db5-43d0-af5b-28b6817b5366","resolution":{"observed_at":"2026-08-07T10:52:54.922097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14860","last_updated":"2023-03-06T23:19:17Z","snapshot_observed_at":"2026-08-06T15:09:47.073411Z","submitted_at":"2022-09-29T15:24:47Z","title":"Bridging the Gap to Real-World Object-Centric Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14860","snapshot_observed_at":"2026-08-07T10:52:54.925946Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.925946Z"},"links":{"cited_paper":"/paper/2209.14860","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:650b50647b4ea205c9caf825a708cc776f5b5398127ac1bd7a5069916dc02391","observation_id":"1b30982e-6436-4d6c-927c-eb499cc00399","resolution":{"observed_at":"2026-08-07T10:52:54.925946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.345259Z","title":"Evaluating machine accuracy on imagenet","venue":null,"work_id":"0b3f78d0-96e6-49f3-bb28-3282bcc24fe5","year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.930160Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:1e8f20f37252c6e0e707269d2bb7045bc0389f33efe4e0b883e77e6ffb38f878","observation_id":"99228d01-3c03-42b2-b57d-d507dc5750ff","resolution":{"observed_at":"2026-08-07T10:52:55.349341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.332145Z","title":"Croc: Cross-view online clustering for dense visual representation learning","venue":null,"work_id":"b25d6039-4779-4764-9a51-687ae034b2f3","year":2023},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.934008Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:9fb2ff4bfbfdb586a047f444bb235a0b105f4d5bba85db7dc8f4bd145d56df84","observation_id":"c37011a0-5ce3-4742-8d9c-072e910e3825","resolution":{"observed_at":"2026-08-07T10:52:55.336102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.318346Z","title":"Convnets and imagenet beyond accuracy: Understanding mistakes and uncovering biases","venue":null,"work_id":"bc42f924-17d2-430d-9a67-b77a10900cd2","year":2018},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.937717Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:444fa904c22d97baf9cb5b84c20f1e5552e9ee490ae3057fb6b913f03a5346cf","observation_id":"e3432fdd-81b0-4249-ae5b-d1a5451d2af9","resolution":{"observed_at":"2026-08-07T10:52:55.322766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.941851Z","title":"Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.941851Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:69bb61a228d7e9b7ce23a6b45899b9eb823ec1d4414f1e76890a3459e9e5f11a","observation_id":"72da9c3d-4061-4759-9807-9c8d44cef805","resolution":{"observed_at":"2026-08-07T10:52:54.941851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.294718Z","title":"From imagenet to image classification: Contextualizing progress on benchmarks","venue":null,"work_id":"142b524a-ba92-40f3-8a6c-9c6d1bed5c13","year":2020},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.945813Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:3f6483d47428266fb44203dcf64d17f666d7c3c3d857d58ba524593417fe5984","observation_id":"767d379c-3c0b-4cf9-a642-97cef43c6653","resolution":{"observed_at":"2026-08-07T10:52:55.299105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.280398Z","title":"Splicing vit features for semantic appearance transfer","venue":null,"work_id":"02fac546-7b10-4cb1-a095-d63c30490167","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.950041Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:01b27f791855eec5c7f7a19023946d3052db8d0a7855275f8c72259cb500293f","observation_id":"00c2909d-3221-4241-827c-b060f92fc604","resolution":{"observed_at":"2026-08-07T10:52:55.284466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.267514Z","title":"Dense contrastive learning for self-supervised visual pre-training","venue":null,"work_id":"7669e3ba-5683-4925-8da6-e53adaea7a68","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.953887Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:0d20bce17442a9fa1dd8aa81391ad37df94bcf35543b86e7445edaa9a6026e78","observation_id":"06994615-4d3a-46b6-b97e-381d17e14ad5","resolution":{"observed_at":"2026-08-07T10:52:55.271415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.254250Z","title":"Self-supervised visual representation learning with semantic grouping","venue":null,"work_id":"63f49cf3-8514-432c-87c6-fc036f3a73cb","year":2022},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.957725Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:bfd361b7039d3493eb9da90541954cb684ce39596313285768dbbbd768009c55","observation_id":"5b50c22f-d140-43ab-89bc-aa9cd0b8cb87","resolution":{"observed_at":"2026-08-07T10:52:55.258331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.240244Z","title":"Unsupervised object-level representation learning from scene images","venue":null,"work_id":"a505ee18-db5c-403b-997b-4e9ab4479d01","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.961699Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:044a618caffc69364c356c56c565a6a79db514b214a21e3890ad2c9027d0a2e0","observation_id":"2b237aeb-0368-412d-b3c6-afe5ac14ecd9","resolution":{"observed_at":"2026-08-07T10:52:55.244587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:55.226508Z","title":"Re-labeling imagenet: from single to multi-labels, from global to localized labels","venue":null,"work_id":"bcc9f0d7-9996-44da-993d-6f0341a0d87f","year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.965391Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:93b1f5f57e19078094376f015b15922b7b6bd5b0c11296dde16b3ff6a76881dd","observation_id":"b57b8659-4670-4432-ae26-c2d605449ecf","resolution":{"observed_at":"2026-08-07T10:52:55.230722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:52:54.969995Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.969995Z"},"links":{"citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:f126ba0f52db52ed04e45ac774cde69bf718153da7a53946b9d61b9557b5e2fa","observation_id":"562eab54-3c33-493d-8da8-fa3795e212ab","resolution":{"observed_at":"2026-08-07T10:52:54.969995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-07T10:52:54.973978Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:52:54.973978Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2506.05409"},"observation_digest":"sha256:52dfc764d79655546fa52bd99ed9ee28e6403d3d6999a6e1b0c6bad0f4bc8405","observation_id":"18ca66a9-4989-4c00-b86e-31483b866a09","resolution":{"observed_at":"2026-08-07T10:52:54.973978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05409","last_updated":"2025-06-04T15:50:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T23:15:30.180161Z","submitted_at":"2025-06-04T15:50:09Z","title":"Object-level Self-Distillation for Vision Pretraining"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.05409."}