{"as_of":"2026-08-18T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a488e902be4274bcb99facd941125332b0b547a67b800f65a76987c990a5ec3d","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T20:54:48.203293Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:48:51.126553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19584","snapshot_observed_at":"2026-08-04T14:48:51.126553Z","title":"arXiv preprint arXiv:2606.19584 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:51.126553Z"},"links":{"cited_paper":"/paper/2606.19584","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:295970d386598c5b76cc9ce4067013e79b2a8a7bf6e9520b6822fdcd0f0e7f98","observation_id":"bfdd4eff-2c2d-400e-bbbe-6f7e1f2e63ef","resolution":{"observed_at":"2026-08-04T14:48:51.126553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.19584/citation-record","integrity":"/paper/2606.19584/integrity","json":"/paper/2606.19584/citation-record.json","paper":"/paper/2606.19584"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-18T15:22:56.094984Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":"2203.17274","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-07-04T00:49:19.216124Z","title":"Visual prompting: Modifying pixel space to adapt pre-trained models","venue":null,"work_id":"da285965-ebf5-410b-beaf-17ba49e67f3d","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:cacf24d1a920e5bde096dccf456a74b3ccd7d93e3f6af6f52123fa3fa553a5cf","observation_id":"b409a6b4-2b1c-469c-a19c-41e9306614ba","resolution":{"observed_at":"2026-07-04T00:49:19.219783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:b615584ae3e8f925234a2ea5a765f808bb924b9aff5038dee2561b36a38d4106","observation_id":"4d801b32-0b86-45eb-a176-91299175cc09","resolution":{"observed_at":"2026-07-04T00:49:19.235400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01883","last_updated":"2022-05-04T04:09:23Z","snapshot_observed_at":"2026-08-18T01:44:06.615596Z","submitted_at":"2022-05-04T04:09:23Z","title":"All You May Need for VQA are Image Captions","version":1},"cited_work":{"arxiv_id":"2205.01883","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.01883","snapshot_observed_at":"2026-07-04T00:49:19.179579Z","title":"Chen, M., Tworek, J., Jun, H., Yuan, Q., Pinto, H","venue":null,"work_id":"9d6e4be6-a94f-464a-9061-a8e316ae711b","year":null},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2205.01883","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:4b391f28899901ae47d00354c3606d726fab9de2e5d3357b185421be1ed75010","observation_id":"f65f8726-a036-4254-9f67-75bccbe48d5f","resolution":{"observed_at":"2026-07-04T00:49:19.182325Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-16T15:49:09.216982Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":"2209.06794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-07-04T19:30:07.491958Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","venue":"cs.CV","work_id":"29921cff-29c1-4aad-a27d-adac346027ec","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:e4d73cca934e61cf9e3813674c3427d9bc96ffed75ecb3f22d7508ccac358e9b","observation_id":"04765852-f0e7-47bf-a8a0-0e3d3f4d71f5","resolution":{"observed_at":"2026-07-04T00:49:19.151225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:ba86d1e5d7c57f704be452a71e53bb8e06aeef09fc926b77e6b52da0a98676cc","observation_id":"af8d776a-b5dc-4e54-93ff-56c205391feb","resolution":{"observed_at":"2026-07-04T00:49:19.186065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:a707b1a34a5f9c1a05b2865b86641e0256779df5366feda38c8a9201c8a4d9e8","observation_id":"fe8d1ff0-b339-427f-a452-b870f0b87148","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04193","last_updated":"2024-03-10T01:55:47Z","snapshot_observed_at":"2026-08-16T22:03:34.718497Z","submitted_at":"2023-11-07T18:34:02Z","title":"Selective Visual Representations Improve Convergence and Generalization for Embodied AI","version":2},"cited_work":{"arxiv_id":"2311.04193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04193","snapshot_observed_at":"2026-07-04T00:49:19.228025Z","title":"Selective visual representations improve convergence and generalization for embodied ai","venue":null,"work_id":"3f7f82f4-f12b-43fc-9173-06255d095cb8","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2311.04193","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:3f4c2878726e9c432f956f7dcb6e920232d0f7fb1e44e4bc8d5d9cc45800b52b","observation_id":"d0a11f6c-9b33-4edd-a4bf-3dbaede5828b","resolution":{"observed_at":"2026-07-04T00:49:19.230707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-08-16T14:56:25.720519Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":"2309.17425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-07-04T20:50:12.674098Z","title":"arXiv preprint arXiv:2309.17425 (2023)","venue":null,"work_id":"9922937e-9c54-4233-8816-d729dfaf746e","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:156ee334e8fdc08014ad776193730c7a845297898dd864185174d713b14c270c","observation_id":"74603111-ced3-4d18-9828-7fd57917637a","resolution":{"observed_at":"2026-07-04T00:49:19.225762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:e24b8703e22b4a1d9c78d2e3c022ba326f18310b7e5e26d9615635c1ed6b2c8f","observation_id":"d0b878aa-956d-45f4-8003-365ac9d3cd15","resolution":{"observed_at":"2026-07-04T00:49:19.239610Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-17T17:47:50.871594Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2407.12580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-07-08T20:35:34.387006Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","venue":"cs.CL","work_id":"df2e178e-bd96-48f4-8431-51c61fbc63fd","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:dc8e17406ff6d0d336dd7cf37d23faf2941ae83af77572a275fa1ecbbba0c072","observation_id":"500065c9-714e-448b-823f-4fa100ce157f","resolution":{"observed_at":"2026-07-04T00:49:19.214012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:24482de45503468e2e65e5ebc86b42d42e2666b9e07091039dd8ea60fdc0cedd","observation_id":"0f3e7447-3d28-4bdd-bc44-5b2744a5d4ff","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00740","last_updated":"2025-03-29T12:57:07Z","snapshot_observed_at":"2026-08-16T13:56:46.712499Z","submitted_at":"2024-04-30T01:19:18Z","title":"Modeling Caption Diversity in Contrastive Vision-Language Pretraining","version":4},"cited_work":{"arxiv_id":"2405.00740","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00740","snapshot_observed_at":"2026-07-04T00:49:19.200456Z","title":"Modeling caption diversity in contrastive vision-language pretraining.arXiv preprint arXiv:2405.00740,","venue":null,"work_id":"f1f68f83-c1c3-4b18-8112-7551c2453e3f","year":null},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2405.00740","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:7ec1a58bb36b4fcfdf8f8df6c33bd57ae605dd6e46ec8379e217621ac8e047a6","observation_id":"2f15f18c-c861-4fad-bd23-32145fe9126d","resolution":{"observed_at":"2026-07-04T00:49:19.203184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Vx2text: End-to-end learning of video-based text generation from multimodal inputs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:366f1c5df3aec986b0f4d84138133945c942c73292c93ad460a51a0bebe5ad5a","observation_id":"eb94859a-361c-4f75-bf42-d1c570f5915a","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Training-free deep concept injection enables language models for video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:f7ad05003b544ff44b9100389c010389f983d93b878dd5be3dc137f325af45ed","observation_id":"db8e253e-c488-4afd-b7a7-b04411b59a66","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07016","last_updated":"2023-04-21T17:08:27Z","snapshot_observed_at":"2026-08-16T16:08:49.584396Z","submitted_at":"2022-12-14T04:08:56Z","title":"Understanding Zero-Shot Adversarial Robustness for Large-Scale Models","version":2},"cited_work":{"arxiv_id":"2212.07016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07016","snapshot_observed_at":"2026-07-04T00:49:19.205616Z","title":"Understanding zero-shot adversarial robustness for large-scale models","venue":null,"work_id":"056afba7-1521-4a1f-ba45-99a26390b294","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2212.07016","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:48beaeeeceb01bdd8f5edeaa150e478a49c094551acbb66cadd1c1fc15095b1f","observation_id":"24da8478-d867-4092-ad40-ec9f08a7b5fd","resolution":{"observed_at":"2026-07-04T00:49:19.208818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-18T17:22:41.593184Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":"2210.07183","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-07-04T21:00:08.502290Z","title":"Visual Classiﬁcation via Description from Large Language Models, Dec","venue":null,"work_id":"f4d7d889-755e-4932-871a-c5a2d3a50b92","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:ea17d9819f89f6b3867c2d0ffc0b9a5e04fbc5e4d12f00d30369e6c3d3d7dffc","observation_id":"075770d9-5c3b-40e0-99be-b6180696ee69","resolution":{"observed_at":"2026-07-04T00:49:19.244441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04412","last_updated":"2022-12-08T17:10:31Z","snapshot_observed_at":"2026-08-16T16:10:00.367279Z","submitted_at":"2022-12-08T17:10:31Z","title":"Task Bias in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2212.04412","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.04412","snapshot_observed_at":"2026-07-04T00:49:19.261510Z","title":"Task bias in vision-language models","venue":null,"work_id":"cd095483-03ae-4b76-bd2e-051a2a09cacc","year":null},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2212.04412","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:2ac61ed3942a3e93f412badd02ff0ec04d9c9dff758b4cc43e284bb452007de4","observation_id":"39dc97ab-cd15-4c86-b94d-147a7176662e","resolution":{"observed_at":"2026-07-04T00:49:19.264204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:67a76cfe69504573e08af23bce83f2f2d505100b3a91ac5125fc3f25a7593e90","observation_id":"0ed28888-7932-4c8c-af28-f5be5c797b1d","resolution":{"observed_at":"2026-07-04T00:49:19.186873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.04372","last_updated":"2022-09-09T16:11:11Z","snapshot_observed_at":"2026-08-16T16:33:36.803826Z","submitted_at":"2022-09-09T16:11:11Z","title":"Pre-training image-language transformers for open-vocabulary tasks","version":1},"cited_work":{"arxiv_id":"2209.04372","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.04372","snapshot_observed_at":"2026-07-04T00:49:19.209105Z","title":"Piergiovanni, W","venue":null,"work_id":"5912d9b2-6b92-47a1-933f-9685abc0e263","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2209.04372","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:2c9bfd747042f4403480681e9e30628582189c88183e817f0740df5b64babcde","observation_id":"b09248ad-332a-46dc-94bf-8d04a110f576","resolution":{"observed_at":"2026-07-04T00:49:19.212641Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:843ae3f0a69a1034066f5c71b8127187683d8a27bb1e75d8ec1b43191e63543c","observation_id":"67f47f13-970e-4356-a8aa-cecdc6daa478","resolution":{"observed_at":"2026-07-04T00:49:19.177192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13851","last_updated":"2024-07-18T18:39:54Z","snapshot_observed_at":"2026-08-16T13:32:56.171022Z","submitted_at":"2024-07-18T18:39:54Z","title":"X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs","version":1},"cited_work":{"arxiv_id":"2407.13851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13851","snapshot_observed_at":"2026-07-04T00:49:19.163396Z","title":"X-former: Unifying contrastive and reconstruction learning for mllms.arXiv preprint arXiv:2407.13851,","venue":null,"work_id":"9d239d5f-a242-4ad4-afd1-8067358bdc8e","year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2407.13851","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:c21ebc90011f9b8ae04e83c64779f941ff847968329c08c9d486647cba66fd8e","observation_id":"b75a33ca-9a94-4554-8f86-a03749aacd6a","resolution":{"observed_at":"2026-07-04T00:49:19.166875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:e222b6543f8b98d154a5f853f5d76015339ce6ccd8ba01faf156d73e6265c865","observation_id":"650ab919-5ed6-4535-aa2b-f874432f07df","resolution":{"observed_at":"2026-07-04T00:49:19.230531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:98b44cd5095124b4feb4a077eea9fa66b9283c40f382f89f1583e6d7d587a781","observation_id":"6969ea20-7901-4607-abca-b9018cfccf80","resolution":{"observed_at":"2026-07-04T00:49:19.190898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:4beb92195dc97b307675f5a68e9bdc29ad8a59a2ee05cf9c8bb16e170e0c7081","observation_id":"abfccb1c-3e97-4a79-b498-cd004b12dba1","resolution":{"observed_at":"2026-07-04T00:49:19.172207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07617","last_updated":"2026-05-31T18:45:03Z","snapshot_observed_at":"2026-08-17T13:43:29.791103Z","submitted_at":"2025-02-11T15:05:33Z","title":"Scaling Pre-training to One Hundred Billion Data for Vision Language Models","version":2},"cited_work":{"arxiv_id":"2502.07617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07617","snapshot_observed_at":"2026-07-04T00:49:19.193120Z","title":"Scaling pre-training to one hundred billion data for vision language models.arXiv preprint arXiv:2502.07617, 2025a","venue":"cs.CV","work_id":"368c410b-8396-411d-b445-36d9f0f44537","year":2025},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2502.07617","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:efa802d1f598ee5f69af1ad1145c9734c1b93336f0d732e2e7f63a77776ed5b4","observation_id":"bcf2fc55-31ca-4fa8-abe4-c2168bb3593c","resolution":{"observed_at":"2026-07-04T00:49:19.195832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-17T12:17:37.741844Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":"2309.16671","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-07-04T20:50:12.667951Z","title":"Demystifying CLIP Data","venue":"cs.CV","work_id":"7af932a5-c6d2-4f55-9522-7777cc3fa5ae","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:73aefcf25871d292d0eff65822a475975ddd58262b2dfc4729b2723ff6c1b7ac","observation_id":"0b3c985a-f1f3-4b88-b7af-7c74314198ab","resolution":{"observed_at":"2026-07-04T00:49:19.181436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03409","last_updated":"2024-04-15T07:50:32Z","snapshot_observed_at":"2026-08-15T09:21:11.223719Z","submitted_at":"2023-09-07T00:07:15Z","title":"Large Language Models as Optimizers","version":3},"cited_work":{"arxiv_id":"2309.03409","doi":"10.48550/arxiv.2309.03409","metadata_source":"pith","pith_arxiv_id":"2309.03409","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models as Optimizers","venue":"cs.LG","work_id":"cacd55e1-79db-4dd6-9f1b-794fc09d75bb","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2309.03409","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:7b6055cf2f24b7d35442e72a2666c7a9a743caddb6745a572da21bbc70c2f935","observation_id":"cf4f49d8-1f70-489b-8683-ce1c00aa6e29","resolution":{"observed_at":"2026-07-04T00:49:19.235077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.496568+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.496568+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":"2205.01917","doi":"10.48550/arxiv.2205.01917","metadata_source":"pith","pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":"cs.CV","work_id":"5dd5bf10-d548-40ff-9b6c-6735129b27ee","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:6cc793c53fc6502c1d0a0074054489e1696aecaf3579c7c250905721971ffcc5","observation_id":"950179fd-155c-499d-88e5-8da671c702dd","resolution":{"observed_at":"2026-07-04T00:49:19.259387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Scaling vision transformers","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:e56570ea9b116407514fa9fb71b91c1492e330fd56f414df0ee8108446c78c0e","observation_id":"34451644-0e85-47e9-980a-7eefb87abe42","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19651","last_updated":"2024-06-24T23:41:29Z","snapshot_observed_at":"2026-08-18T13:43:51.783429Z","submitted_at":"2024-03-28T17:59:20Z","title":"MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions","version":2},"cited_work":{"arxiv_id":"2403.19651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.19651","snapshot_observed_at":"2026-07-04T00:49:19.246582Z","title":"Magiclens: Self-supervised image retrieval with open-ended instructions","venue":null,"work_id":"c942d433-c67a-4aa0-9bd6-7a407f890918","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2403.19651","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:a358cce703ec2f3a18544442b59f3d94e0102b9cf5602c2b6e31876d53df1213","observation_id":"43eea2a8-91f0-4808-b12d-7c5e1088cdb6","resolution":{"observed_at":"2026-07-04T00:49:19.250279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-16T13:45:25.658950Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:332f844d508753e76cd3e55d7482b030820cbeab36dced790e754b04a7a51bae","observation_id":"c764cc1d-0431-4631-ac7a-56970e5dd1b3","resolution":{"observed_at":"2026-07-04T00:49:19.255293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"However, its practical application and further development are subject to certain limitations, which also open avenues for future research","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:6e2865398745be904e172657142be6ed8094d6fd0af6c766400a755f93962adf","observation_id":"c24c57e1-e3a7-4ef1-b4f8-eda8f79322fb","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"(2021), SigLip Zhai et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:9ed60eb4bacb20b453d5d19dde26e293367903f1ae3ea4f0863a55789789c3a1","observation_id":"3026f273-31af-4762-aecd-544733f4dfb6","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Interestingly, by leveraging Gemini to evolve and generate different text prompts Yang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:c44a0764c1222060e08b3931ee984ef360fddf9c3926fedd4e82bbf56b82204b","observation_id":"b31ba3f7-e307-4343-9c7d-5eac1b8b6016","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:468616bea971d4491d262ebe037e380dbba34a4f69b14d27fcf7a2e6c7991901","observation_id":"4afd2aa5-0bde-41c6-a55b-97b803725cd8","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"The resulting distribution, visualized in Figure 13, reveals significant variations in instruction fre- quency","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:502cf1ecec35ece0e51b7aa3680f812543c4031efdd512f663efd5b3ba016059","observation_id":"f6d734c5-ba85-4df6-843c-595b9a9c37be","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:ccfe1ebb179e7b1f7a8bf3de435487132134638965c53a772a805470fdbe12ef","observation_id":"1f6a59b5-a165-44a2-99d0-43b7855c8550","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":3,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":8,"verified_exact":23,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2606.19584."}