{"as_of":"2026-08-09T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f057ba0c83f6da6ea1bee315bbaa68d8601c013f1222d56669d2393b9478653a","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:08:37.081122Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:26:05.863088Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.24181","snapshot_observed_at":"2026-08-02T05:26:05.863088Z","title":"Hudson, Ye Xia, Skanda Koppula, Andre Araujo, Joao Carreira, and Niloy J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16314","last_updated":"2026-07-15T00:58:45Z","snapshot_observed_at":"2026-08-07T02:32:13.619549Z","submitted_at":"2026-07-15T00:58:45Z","title":"Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:26:05.863088Z"},"links":{"cited_paper":"/paper/2602.24181","citing_paper":"/paper/2607.16314"},"observation_digest":"sha256:daeb704b7caa9a1d7dbece8129ff9a8ad0cb8e105f929eb01e42c6d4e1971118","observation_id":"bfd85a2f-f3b8-4892-abda-a9fe302d48cb","resolution":{"observed_at":"2026-08-02T05:26:05.863088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.24181/citation-record","integrity":"/paper/2602.24181/integrity","json":"/paper/2602.24181/citation-record.json","paper":"/paper/2602.24181"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.418112Z","title":"Cross-modal knowledge transfer with- out task-relevant source data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.418112Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:17ce5aa9f8beff571dddf82b0c27833eb458cdd60571be66ddbfd68bc74a912a","observation_id":"c4ab06af-d80b-43ad-b20b-0c1606faffcb","resolution":{"observed_at":"2026-08-02T20:08:30.418112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11041","last_updated":"2018-02-26T16:54:14Z","snapshot_observed_at":"2026-07-06T06:06:46.772265Z","submitted_at":"2017-10-30T16:17:34Z","title":"Unsupervised Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11041","snapshot_observed_at":"2026-08-02T20:08:30.516147Z","title":"Unsupervised neural machine trans- lation.CoRR, abs/1710.11041, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.516147Z"},"links":{"cited_paper":"/paper/1710.11041","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:4a0a80401d526ff9ce10fdb9fe453fc0c6f63e91e4927a10cc033dbe745c46b5","observation_id":"8337e498-d7f6-46d1-80fb-168fed035c23","resolution":{"observed_at":"2026-08-02T20:08:30.516147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.647686Z","title":"Spatial-aware multi-modal contrastive learning for rgb-d salient object detection and beyond.Information Fu- sion, 124:103362, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.647686Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:5f9e11df8a02ef1310c11bd99a12687667048c453b765a7d8ecb19163fab3e0b","observation_id":"87450015-f6e0-48e8-81d4-8e17c0afda7f","resolution":{"observed_at":"2026-08-02T20:08:30.647686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.732866Z","title":"Vision transformer adapter for dense predictions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.732866Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:1f0e6cb7dc44882e11ee5b082c3caf997ce5206720c3b32b47ee2be8b73ad343","observation_id":"25366554-0a3c-4f89-babb-8ed9002b7ef8","resolution":{"observed_at":"2026-08-02T20:08:30.732866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.847082Z","title":"Cross-lingual language model pretraining","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.847082Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:f5066ecd9f81cb52347978054b408485c951f0cdf696c525a6ca9ca3b5063322","observation_id":"dd4ff651-bd10-434a-bb51-03bc4d41b3bf","resolution":{"observed_at":"2026-08-02T20:08:30.847082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:30.947765Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:30.947765Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:39d9c979c86c3b9e45b7388946591d1b374b40cbea537e7d16ae7f77907f2182","observation_id":"2ff1759f-c074-46d3-bba3-6639daf7900d","resolution":{"observed_at":"2026-08-02T20:08:30.947765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.098872Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.098872Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:c593f59e9bb70d8cc893702e7424dfa360e668403803a0b68136810205db0463","observation_id":"8ed312dc-7786-4b06-840c-ab7bc87926ce","resolution":{"observed_at":"2026-08-02T20:08:31.098872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.174754Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.174754Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:9ded6d2565d3c842fc676722cc52907170fb5f728924dd1992e1e8bec1daeec1","observation_id":"2e30d775-d470-487c-b598-d986855a9386","resolution":{"observed_at":"2026-08-02T20:08:31.174754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-02T20:08:31.343820Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.343820Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:15e248a852128dc60d2d45badc62ae63a7edde4e7ae403e99a3cbc5ae7009558","observation_id":"5d66bcf7-42a1-4d9f-8240-5af0f7359d51","resolution":{"observed_at":"2026-08-02T20:08:31.343820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.432706Z","title":"Prob- ing the 3d awareness of visual foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.432706Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:efdbb3f1b6904217799454b218e94ccb8c8429f8e7fcb6fbd62a99775d4a28d3","observation_id":"c5ae598b-dace-45bd-a301-e1d81f1c2dd3","resolution":{"observed_at":"2026-08-02T20:08:31.432706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.574298Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.574298Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:c5078515c1adf1b35094abf3fd5d6f17e6a29abbf25218a89c63aa5546ae1fa6","observation_id":"e50ec73d-b83a-4dfd-bb27-81ed5ce0a388","resolution":{"observed_at":"2026-08-02T20:08:31.574298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.709038Z","title":"Dantas, Luigi Di Caro, and Dino Ienco","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.709038Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:2a007fa84820797e5e35acb473898a0e8484a2dac57029a9007bf3953f15eb57","observation_id":"1a616629-3c03-400f-a5a4-a225eed41a79","resolution":{"observed_at":"2026-08-02T20:08:31.709038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.816513Z","title":"Omnivore: A sin- gle model for many visual modalities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.816513Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:853ec0fee85158278e4d484c8ca918d9f1f93da4a2a4e2349113a48af43670fb","observation_id":"3d9796c5-70c2-40cc-8fae-093a3350f685","resolution":{"observed_at":"2026-08-02T20:08:31.816513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:31.890796Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:31.890796Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:dcde677f46a24a89049442ddddfc6071952e55c25e857f30ec3840dc55e62952","observation_id":"16caaca9-e0e0-4378-9ead-8777f5240bee","resolution":{"observed_at":"2026-08-02T20:08:31.890796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.103039Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.103039Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:511e03f8c27c336a341c1fd93911baa00b88e1441d294532b1fe36ccbfed7584","observation_id":"0430cd56-7cd2-43ac-9a1c-b9c760a384b3","resolution":{"observed_at":"2026-08-02T20:08:32.103039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.217414Z","title":"The inaturalist species classification and de- tection dataset, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.217414Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:6b8dca6893e33e9bbfacd53348ed88ee849e67d7ce9a2ac5bc24aba944816c0b","observation_id":"ca389ea4-af40-43d4-b0df-81fd717e6464","resolution":{"observed_at":"2026-08-02T20:08:32.217414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.336039Z","title":"Mask3d: Pre-training 2d vision transformers by learning masked 3d priors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.336039Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:8b1628213436bbaf89abf79b8e98e5eb07475801ea7ea4a491cc00f018aaddcd","observation_id":"5164ff88-437f-4b49-aa13-68df61fb520d","resolution":{"observed_at":"2026-08-02T20:08:32.336039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.480704Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.480704Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:295dd031663816c0d727cff5f167bc1fd2a9fdf9375633e4c4c9f175607c85ff","observation_id":"ee0bce46-934b-49b8-9e5e-2c66ec09a7ae","resolution":{"observed_at":"2026-08-02T20:08:32.480704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.584745Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.584745Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:42b516e434c10290ff77868fb97871aaf205512006cc38adc2a4a2e4d4738594","observation_id":"97db1390-e301-4fd5-8b3e-f2efcbc898e9","resolution":{"observed_at":"2026-08-02T20:08:32.584745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.698128Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.698128Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:de4025b571efb8cc246090d70ef891ccc40f3b3d55ade5a548d11f37cb6a0a1a","observation_id":"6671bdda-1c2a-42b2-a91b-972cd4a78c3e","resolution":{"observed_at":"2026-08-02T20:08:32.698128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:32.873713Z","title":"Multi- modal contrastive masked autoencoders: A two-stage pro- gressive pre-training approach for rgbd datasets","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:32.873713Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:c55b46931cf626a9f3d5eef8c5db375303a180fddc06b0eeade44a35ea6fe73f","observation_id":"2798e5b0-21d4-4a04-82ad-9547018b9250","resolution":{"observed_at":"2026-08-02T20:08:32.873713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.001693Z","title":"NA VI: Category- agnostic image collections with high-quality 3d shape and pose annotations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.001693Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:78ccc735a9295e01e62d3fe2f5db1cf97a48080729f680df9eaac8dc2a1e632f","observation_id":"5ec8fcf5-6cf6-4a93-9a34-031a93a3478a","resolution":{"observed_at":"2026-08-02T20:08:33.001693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.161108Z","title":"Google’s multilin- gual neural machine translation system: Enabling zero-shot translation.Transactions of the Association for Computa- tional Linguistics, 5:339–351, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.161108Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:2d244c811e71c5be2db98129141980b7d16c385f50807b919a4b030841f1f7d9","observation_id":"61ee9790-a290-42f8-8b0b-0bb3c7f049b2","resolution":{"observed_at":"2026-08-02T20:08:33.161108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.249449Z","title":"Dy- namicstereo: Consistent dynamic depth from stereo videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.249449Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:4fcca91058210a4832341beb14c544a69047be87dcaed0f7d1f1fa9a9743425f","observation_id":"d9c4ac43-32b2-4787-be04-dec9c2a3990f","resolution":{"observed_at":"2026-08-02T20:08:33.249449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.384538Z","title":"The retinex theory of color vision.Scientific american, 237(6):108–129, 1977","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.384538Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:696bf026015c3adcc91850c28654ea7e4ae3edbac35e892d846129afb35d04ba","observation_id":"0a1a3d9e-8086-48e5-a333-a02f7ebc0192","resolution":{"observed_at":"2026-08-02T20:08:33.384538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.547415Z","title":"Uni-perceiver v2: A gener- alist model for large-scale vision and vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.547415Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:fa97169d9114113e629b1b552851bf51b1f266902e6c1d45d657f15e747d653a","observation_id":"e1432e4b-0683-4e69-8da3-9333f4171661","resolution":{"observed_at":"2026-08-02T20:08:33.547415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.731063Z","title":"A closer look at invari- ances in self-supervised pre-training for 3d vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.731063Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:7141de1425bfcb0411be67a45dea127e1b63549bea3d7a1220fdb4fd127e1b86","observation_id":"5d3ec7a5-afc6-4820-b6b4-f0ef02907c10","resolution":{"observed_at":"2026-08-02T20:08:33.731063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.802426Z","title":"Contrastive multimodal fu- sion with tupleinfonce","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.802426Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:31a1288dbdf21c0eeebc64bd1516298e258c03eac45a2a85bef26ad5eccc1f3e","observation_id":"fb6cb484-e8a5-4128-bb06-8ee3e802567b","resolution":{"observed_at":"2026-08-02T20:08:33.802426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.861631Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.861631Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:452491ac0f3e8b7050300c4d53a44bbe5847d676a5f7b63c4fb31fe07fc0e686","observation_id":"f3f26e30-4f9f-4409-8da9-3357437d0aa7","resolution":{"observed_at":"2026-08-02T20:08:33.861631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:33.979151Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, au- dio, and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:33.979151Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:ce7dc5444b65409dbf799867e2fe06da030a1b792c7f5f7daa625570224bf2eb","observation_id":"fdd3495c-84d2-415b-90d9-0608da5c4d5d","resolution":{"observed_at":"2026-08-02T20:08:33.979151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.098445Z","title":"Ma-avt: Modality alignment for parameter-efficient audio-visual transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.098445Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:43728229b391979764d82d3ac11abd8965656d1290b0acace844c02a0974731a","observation_id":"8533d64d-01b6-422d-b382-2d22c95ff803","resolution":{"observed_at":"2026-08-02T20:08:34.098445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.207183Z","title":"TIPS: Text-Image Pretraining with Spatial Awareness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.207183Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:605f996a6100bc268a45bd41c9edee272b2bf01734b601868c5c171ba68a8c78","observation_id":"3da60b0b-60dc-48c2-ad4c-f9f728d08e14","resolution":{"observed_at":"2026-08-02T20:08:34.207183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.261314Z","title":"Large scale visual food recognition, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.261314Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:4d16bcd185c7b6b5b0859526f28f978fa3019128cc1d21e8b5f20584552d7c8a","observation_id":"22915d5d-f162-468f-97c7-c25a476610ac","resolution":{"observed_at":"2026-08-02T20:08:34.261314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.349160Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.349160Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:b4a897e2ac05c250ec84534786cc4419479a732a8dc441d4ecab8204993fa6e6","observation_id":"76aa84be-f5b1-43d5-807d-f843558942bf","resolution":{"observed_at":"2026-08-02T20:08:34.349160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-02T20:08:34.436108Z","title":"Repre- sentation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.436108Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:a527088f424b92752a7904476621f0622aa449267c9e49bbbf4c4856871e833c","observation_id":"cc49ad89-1e04-4196-9ff0-9bdb40abc99a","resolution":{"observed_at":"2026-08-02T20:08:34.436108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T20:08:34.539397Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.539397Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:6ea6fce87a0115b57cec912c7cfc06cc5e057fdc2869fc2da95e829021bfef3e","observation_id":"35fb48d8-d0de-4cac-aedb-d14e65b7b7ce","resolution":{"observed_at":"2026-08-02T20:08:34.539397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.635007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.635007Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:4e5bd4ead601b6cc7d812d786578aa2de6ee9a40517b59090335af2a117ea275","observation_id":"f7fc82de-f603-4121-bd3d-4a0c1d2109e1","resolution":{"observed_at":"2026-08-02T20:08:34.635007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12634","last_updated":"2021-09-01T16:21:13Z","snapshot_observed_at":"2026-08-07T10:00:45.682572Z","submitted_at":"2020-06-22T21:39:56Z","title":"RP2K: A Large-Scale Retail Product Dataset for Fine-Grained Image Classification","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12634","snapshot_observed_at":"2026-08-02T20:08:34.697363Z","title":"Rp2k: A large- scale retail product dataset for fine-grained image classifica- tion.arXiv preprint arXiv:2006.12634, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.697363Z"},"links":{"cited_paper":"/paper/2006.12634","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:2393b4251cf65f8efd62335e3726176967d9570534d316b1ca87481097d2ea3d","observation_id":"480bfd97-0bbd-40dc-81ab-ec8f7f0b74a1","resolution":{"observed_at":"2026-08-02T20:08:34.697363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.847462Z","title":"Susskind","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.847462Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:b80ef4ad68cd961dc688aec775144ba9a05e8736286bac73c1dda3c6f9a7f070","observation_id":"5319969a-02cd-4780-83a6-46d82ee08dc2","resolution":{"observed_at":"2026-08-02T20:08:34.847462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:34.956458Z","title":"Deep metric learning via lifted structured feature embedding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:34.956458Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:33f29e27c541a8e6b9f45d5cba840a9d9c058a32d589021f2f4824a0d446c10d","observation_id":"365c19e4-0773-4a3f-b6b5-6ef3e941f089","resolution":{"observed_at":"2026-08-02T20:08:34.956458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.133853Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.133853Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:6f64ba67247360e0f9500706efa2c3d4c2eeed9776360cbb5d5fbedd7a576211","observation_id":"c46b1b79-01ab-4c9f-a8a6-9e7b5f5403e0","resolution":{"observed_at":"2026-08-02T20:08:35.133853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.254409Z","title":"Sequence to sequence learning with neural networks.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.254409Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:cdffb83dd3b28ba99ce5792b7b65f57d0b4dd986eaa9dbfd3276ada1d6f1e307","observation_id":"4fc759f0-78fa-4455-8487-2b75353b8c58","resolution":{"observed_at":"2026-08-02T20:08:35.254409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T20:08:35.354646Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.354646Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:0a6b72a4b6703b5e387ad4c3689823eed4d39997fa2ffb3c731d8c072f882228","observation_id":"c499003b-7b93-4343-b691-b8a2502c91a9","resolution":{"observed_at":"2026-08-02T20:08:35.354646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.487554Z","title":"Con- trastive multiview coding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.487554Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:45331679e48c6bc5d3980d1fb25fb2c59c9da0cf2bb3e0f0913fae29c5b38ec7","observation_id":"5f664293-6f23-4dd1-bf2e-4f0d2d212d04","resolution":{"observed_at":"2026-08-02T20:08:35.487554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.613794Z","title":"Normalized object coordinate space for category-level 6d object pose and size estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.613794Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:df521a4c42a5d3c0b6cbe6b63b8f055a7569c1d84fe8a2a81c69b59640a48f8f","observation_id":"1681d64c-8b23-4c4c-bf47-babf2893dc67","resolution":{"observed_at":"2026-08-02T20:08:35.613794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.715215Z","title":"Tartanair: A dataset to push the limits of visual slam","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.715215Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:46f95ab083973489d5b6084cc3cb578419cb4d3451a9a520e57f520cd4ec6a63","observation_id":"89da3704-38c9-41e9-9859-1d9591083257","resolution":{"observed_at":"2026-08-02T20:08:35.715215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.871115Z","title":"Weyand, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.871115Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:2735dc00b36ef4a7f3debc34495e6722fc6e9fa12c329b9337ba7b7460923bbd","observation_id":"61f8c26f-41e9-4f35-a01c-6f1ea73fd1da","resolution":{"observed_at":"2026-08-02T20:08:35.871115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:35.948678Z","title":"Comae: Single model hybrid pre-training on small-scale rgb- d datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:35.948678Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:1a10327961c55f36d9596802c1c7123cd855aa526ec05bd997fa1610d5ce4020","observation_id":"953dc62d-1e54-414e-b77c-39c06b987ef7","resolution":{"observed_at":"2026-08-02T20:08:35.948678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.042462Z","title":"Pace: A large-scale dataset with pose annotations in cluttered environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.042462Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:501714beef65c6283b7b7d5386f915535f0293fdbc1b6db7fcaff820b353b488","observation_id":"785f0218-45dc-4b6e-ab92-39cd0664e0e7","resolution":{"observed_at":"2026-08-02T20:08:36.042462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.171697Z","title":"Colour coding in the cerebral cortex: the re- action of cells in monkey visual cortex to wavelengths and colours.Neuroscience, 9(4):741–765, 1983","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.171697Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:0d7f5626bdec05fd86a4fc4a2e043e05df7d0718c545f69df2d78361066fcb48","observation_id":"e6dd3706-ec9e-4d8e-ac9d-df4bd1bc832f","resolution":{"observed_at":"2026-08-02T20:08:36.171697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-02T20:08:36.301530Z","title":"Dauphin, and David Lopez-Paz","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.301530Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:4c8fe875204ddecbed44e344b0d1f8d9c54195d5fa79aff3a7256179cca4b5a4","observation_id":"02b3718a-bc15-4657-a564-d9ee5d55d0df","resolution":{"observed_at":"2026-08-02T20:08:36.301530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.397239Z","title":"Towards uni- fied representation of invariant-specific features in missing modality face anti-spoofing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.397239Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:f7039a4f11dbab1f2c407feb228c2db826a8224429ad93d692acf16e51199c22","observation_id":"fc53afc7-2eff-4a24-9b8a-b2cbcf37a4fa","resolution":{"observed_at":"2026-08-02T20:08:36.397239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.506756Z","title":"Harley, Bokui Shen, Gordon Wet- zstein, and Leonidas J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.506756Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:41810280c06f574b167a47ef05ddca9d39afd5b66183c978204dab1c14e88e20","observation_id":"64bfc636-1f70-4076-9a54-adb4773e3f65","resolution":{"observed_at":"2026-08-02T20:08:36.506756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.599423Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.599423Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:34945fb3b191f80501afc8bb78f79ace378ed4ae745237390b8b061def51fcca","observation_id":"317d2e0e-b118-4918-9c21-643498c476d2","resolution":{"observed_at":"2026-08-02T20:08:36.599423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.708956Z","title":"Uni-perceiver: Pre- training unified architecture for generic perception for zero- shot and few-shot tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.708956Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:09d196a13b6ee824daafa553c47307587e6da2aecd381bed46b5ee7e1d1a0ddf","observation_id":"5fdbc378-aa12-4f20-8501-fce86eccfe51","resolution":{"observed_at":"2026-08-02T20:08:36.708956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.824126Z","title":"hard positives","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.824126Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:7842d99e329f4d14a19bc3de1fc37d366cad5d9cb945e81c0894a2ff5624e8ec","observation_id":"0f7420b6-2b16-4fe2-b906-a34b0aa257d6","resolution":{"observed_at":"2026-08-02T20:08:36.824126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:37.017386Z","title":"Diagnostic Metrics Expanding on Fig 1, we report detailed cross-modal align- ment and cross-scene discernibility metrics before and after Omnivorous training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:37.017386Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:2202fded9445f0d30959eb8fd98518649632ec76fbd030c03833158bd689354c","observation_id":"348b6eb6-ac4b-4168-b6ce-5b7b9f1edb3e","resolution":{"observed_at":"2026-08-02T20:08:37.017386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:37.081122Z","title":"adapter-on-top","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:37.081122Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:35ac544f5688a49e42c6fb0950579c8281158ff18eaa308cbd9842c7347588fe","observation_id":"f6d5bc12-02c1-4944-ae0a-466b3145fa14","resolution":{"observed_at":"2026-08-02T20:08:37.081122Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:08:36.925825Z","title":"pad- to-patch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder","version":2},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-02T20:08:36.925825Z"},"links":{"citing_paper":"/paper/2602.24181"},"observation_digest":"sha256:9f4ce3b09b2b4b9913f9077c076cc3f3b6a7be7b103a58e365e41f3ecad58c59","observation_id":"c88de4cb-0312-4d6f-8f0b-da5019cc5023","resolution":{"observed_at":"2026-08-02T20:08:36.925825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.24181","last_updated":"2026-06-05T18:04:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T02:41:52.056865Z","submitted_at":"2026-02-27T17:03:45Z","title":"A Mixed Diet Makes DINO An Omnivorous Vision Encoder"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2602.24181."}