{"as_of":"2026-08-11T16:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5757919399af65404c4b710b4c1f108a3c72de0616c437f3014f96a96280fdff","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T05:49:25.572256Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06445/citation-record","integrity":"/paper/2607.06445/integrity","json":"/paper/2607.06445/citation-record.json","paper":"/paper/2607.06445"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:f40513f6b6e7b1da613f4d569483ca3e095783d5cd583d2ad1308952b969de39","observation_id":"aad35dad-f979-4e0c-89a9-72819d3edc08","resolution":{"observed_at":"2026-07-08T05:54:33.573554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.14133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:33.546281Z","title":"Dar, G., Geva, M., Gupta, A., and Berant, J","venue":null,"work_id":"e22a1757-54f1-4e7b-a22f-4afecbbe933f","year":2026},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:4987c062e89f38e7cea05368b13d36febae1d9fb09df276c654cc49093dc28da","observation_id":"0e49c2a6-39cb-408a-ab15-2dfd325304d4","resolution":{"observed_at":"2026-07-08T05:54:33.547907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02535","last_updated":"2023-12-24T23:11:19Z","snapshot_observed_at":"2026-08-10T04:19:02.056520Z","submitted_at":"2022-09-06T14:36:57Z","title":"Analyzing Transformers in Embedding Space","version":3},"cited_work":{"arxiv_id":"2209.02535","doi":"10.48550/arxiv.2209.02535","metadata_source":"pith","pith_arxiv_id":"2209.02535","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Preprint","venue":"cs.CL","work_id":"c380335a-7738-461a-b4c3-a818f55ef3ea","year":2022},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2209.02535","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:7616dd2bf528c942b3d8260f031f636fdcdb3fa82285899706edc435ecaf7673","observation_id":"51cb6c9f-4942-40ed-a626-e84896284fc5","resolution":{"observed_at":"2026-07-08T05:54:33.545444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:7758520f3af2c36fe05bb6a0893375d8a3c72a0b32cfe28ade4208b01d56012b","observation_id":"2d884595-620a-4dae-a9f4-eab353ce17d5","resolution":{"observed_at":"2026-07-08T05:54:33.551545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-07T23:50:29.977330Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":"2012.14913","doi":"10.18653/v1/2021.emnlp-main.446","metadata_source":"pith","pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","venue":"cs.CL","work_id":"af95ed34-d603-4b8d-b5d5-582dd09e9938","year":2020},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:6ec9fb9c5e65e86a27846db5aba180045566b0532c6088a46d9e13307a9bbedc","observation_id":"6a6d1ddc-11f7-4971-b729-9a09a6eb69e9","resolution":{"observed_at":"2026-07-08T05:54:33.542671Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-03T23:38:07.231994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T23:38:07.231994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14680","last_updated":"2022-10-12T18:01:23Z","snapshot_observed_at":"2026-08-03T05:22:23.916601Z","submitted_at":"2022-03-28T12:26:00Z","title":"Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space","version":3},"cited_work":{"arxiv_id":"2203.14680","doi":"10.48550/arxiv.2203.14680","metadata_source":"pith","pith_arxiv_id":"2203.14680","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/abs/2203.14680","venue":"cs.CL","work_id":"4868c846-62bf-4572-bac5-adc004265c5d","year":2022},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2203.14680","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:6c6473e0ba80bb2b8444a0bc335b0487c0f0e1e7add606d00d684220fe8c92ea","observation_id":"c1d40b2a-e127-4743-b13c-8b960016e953","resolution":{"observed_at":"2026-07-08T05:54:33.557100Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.06876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.268531Z","title":"Generating an image from 1,000 words: Enhancing text-to-image with structured captions","venue":null,"work_id":"18689fc3-927f-4561-98f3-7dcc4c1cdb13","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:fd0e156633cf855db11731aafdbd6b18370e0c68bc204dbb18ebee3f5b614e2a","observation_id":"153eacbd-34eb-4737-9076-67a803745d13","resolution":{"observed_at":"2026-07-08T05:54:33.569864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:adde4b9353397a44dea99b6815c614903092c63bab4ef84b20b43e207c80a51f","observation_id":"57ddb86a-554b-47ca-8298-635aba06c398","resolution":{"observed_at":"2026-07-08T05:54:33.539837Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":"2208.01626","doi":"10.48500/arxiv.2208.01626","metadata_source":"pith","pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","venue":"cs.CV","work_id":"196f7eef-d65a-47e4-b815-9a188f6aedcf","year":2022},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:4d420e5e0901ee3ee528179823c54a95befa99bd7d79aab2c4cadad83f71d049","observation_id":"86cf63ad-536e-4fb5-86c9-285f1322b384","resolution":{"observed_at":"2026-07-08T05:54:33.568137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:2ad19c5fded3d81e7bc32ecde076eabe026252c0fc22edba8df259c024356e79","observation_id":"a7f0eec0-b394-48cd-8606-a5ede115aa8a","resolution":{"observed_at":"2026-07-08T05:54:33.566698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02762","last_updated":"2025-02-10T20:13:31Z","snapshot_observed_at":"2026-08-09T16:06:26.088504Z","submitted_at":"2024-10-03T17:59:57Z","title":"Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations","version":2},"cited_work":{"arxiv_id":"2410.02762","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02762","snapshot_observed_at":"2026-07-08T05:54:33.561588Z","title":"Interpreting and editing vision-language representations to mitigate hallucinations, 2025a","venue":"cs.CV","work_id":"7a001c38-c81c-4f29-9bba-1845d45b36cb","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2410.02762","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:8f75375c1975c36c4412de7f1f5fa3a09fe16cffdc26914b03aa0207ab33ec0f","observation_id":"67d74a6e-4e64-4164-a191-9bcd82c72c8b","resolution":{"observed_at":"2026-07-08T05:54:33.562879Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":"2411.17491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-07-08T05:54:33.575217Z","title":"What’s in the image? what survives in modern multimodal lms","venue":"cs.CV","work_id":"95c73d5c-ff49-4baa-a8c8-eaf7218b0276","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:055ddf89e47bf2a42c30bb80d241f987ff5f5effa94ff6476916aead4a8acc71","observation_id":"f099b476-2c82-4664-bae0-8de9a7610a42","resolution":{"observed_at":"2026-07-08T05:54:33.577235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-10T10:43:25.582099Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":"2506.15742","doi":"10.48550/arxiv.2506.15742","metadata_source":"pith","pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","venue":"cs.GR","work_id":"5dfe19d5-3541-4803-8fe9-3c8b9e29b281","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:2c5dd5e093d20efaacdfe049d4e4e6b1acbdf11e89abe8f1f8f47f609b72dfce","observation_id":"1a2f12fb-9cd9-43d0-af2f-1dc30bcc99ab","resolution":{"observed_at":"2026-07-08T05:54:33.547841Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:2c77c346ecfd8fbee860c60e3198beb7cc1e64a3ac445039862605973fdf495d","observation_id":"dd27a126-1e67-4c4f-acd4-0443c975e361","resolution":{"observed_at":"2026-07-08T05:54:33.523101Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-10T22:12:00.200330Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":"2501.02189","doi":"10.48550/arxiv.2501.02189","metadata_source":"pith","pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmark Evalua- tions, Applications, and Challenges of large Vision Language Models: a survey, 1 2025","venue":"cs.CV","work_id":"05c17b30-4aed-40bd-b731-cb5847fc9b8d","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:58730d9c13675ed45b5f560f7d11396883ff0a578e3039900af6e250960006c3","observation_id":"5a879df2-b80d-49ff-827a-d00aea8bb235","resolution":{"observed_at":"2026-07-08T05:54:33.572461Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:31.383389+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:31.383389+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:84a30d9ef83148b24c6414fb12b4679ccf4acb6706a63e0a8a4f16ddaefe0be9","observation_id":"36b15485-8046-4abd-9af9-931f173d5ae2","resolution":{"observed_at":"2026-07-08T05:54:33.536126Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-07-06T19:16:23.103921Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:78354c79d1c01e40dc1cd43ab933c7084988ae7c35d71b0dfa1c5a9dc483c1e7","observation_id":"e9ae30cd-31e1-49b4-b55f-ea999ddbf0a9","resolution":{"observed_at":"2026-07-08T05:54:33.575294Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.17771","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:33.524291Z","title":"Seeing but not believing: Probing the disconnect between visual attention and answer correctness in vlms","venue":null,"work_id":"86ab4537-55ce-4a99-b6c9-64abd30a26d0","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:446a68121972167ef3ee7e5e2019c756b4784fd385e53fbca887e6baa9cad7f4","observation_id":"f58b044a-45d3-4f44-b54d-0e9b11fbc372","resolution":{"observed_at":"2026-07-08T05:54:33.526094Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15162","last_updated":"2023-03-09T15:02:07Z","snapshot_observed_at":"2026-08-08T12:10:35.397433Z","submitted_at":"2022-09-30T01:17:18Z","title":"Linearly Mapping from Image to Text Space","version":3},"cited_work":{"arxiv_id":"2209.15162","doi":"10.48550/arxiv.2209.15162","metadata_source":"pith","pith_arxiv_id":"2209.15162","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Linearly mapping from image to text space","venue":"cs.CL","work_id":"1470dc2c-e9da-4e3f-aa62-808e9aa7bc2e","year":2022},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2209.15162","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:9e83986b0994f2400501717217f0b926af4418b93c7ab39c89456149d7d35819","observation_id":"5125282e-3e2d-40f2-9cec-e3e95d556f27","resolution":{"observed_at":"2026-07-08T05:54:33.565640Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-10T12:49:45.245447Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:2ab0275ae924e15aaddf798bf358c63fb8508259319e512758e6811783b1cd95","observation_id":"1e7fcd8f-d830-4ffa-ad08-ca62f0b97579","resolution":{"observed_at":"2026-07-08T05:54:33.570640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.09047","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:33.552693Z","title":"Same task, different circuits: Disentangling modality-specific mechanisms in vlms.arXiv preprint arXiv:2506.09047, 2025a","venue":null,"work_id":"5d1afffb-f173-4dfd-b666-e74e2531ac66","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:a7cae64650387dc8e2d94806c659a033a862407cbc7ba4167e90805333822a97","observation_id":"481f6402-548c-417a-b779-a5103a20432d","resolution":{"observed_at":"2026-07-08T05:54:33.554573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:33.882240Z","title":"Rezatofighi, H., Tsoi, N., Gwak, J., Sadeghian, A., Reid, I., and Savarese, S","venue":null,"work_id":"77b568ba-5ddf-44b5-ae9e-8d8c873a9229","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:448315472ec06e6fd516262cdc41fc5b409e4fa9dc71e3b03d8c3c8f007ef5d9","observation_id":"80aa4da0-cffb-44f4-9d95-5807e94bcce7","resolution":{"observed_at":"2026-07-08T05:54:33.883501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2112.10752","doi":"10.48550/arxiv.2112.10752","metadata_source":"pith","pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":"cs.CV","work_id":"f0270d36-2952-47fb-84c1-95e3ec341126","year":2021},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:753c9fee56f34e127b610a8cfa8c46601ec6968b5364d349cace84d3d9f1574a","observation_id":"b8c777e6-c106-4ede-88e0-ee5a5a87e18e","resolution":{"observed_at":"2026-07-08T05:54:33.553301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13884","last_updated":"2021-07-03T10:04:41Z","snapshot_observed_at":"2026-07-06T11:23:16.094906Z","submitted_at":"2021-06-25T21:07:09Z","title":"Multimodal Few-Shot Learning with Frozen Language Models","version":2},"cited_work":{"arxiv_id":"2106.13884","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.13884","snapshot_observed_at":"2026-07-08T05:54:33.578937Z","title":"Multimodal few- shot learning with frozen language models","venue":"cs.CV","work_id":"6332b353-92e6-45f5-9bb8-54b6757bd764","year":2021},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2106.13884","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:b6638aee315f33454d470515227792a38a1a5527be577ca02909d8b644517cb5","observation_id":"00ecc256-a3cd-4a70-97ea-4ffd0be5259c","resolution":{"observed_at":"2026-07-08T05:54:33.580326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07199","last_updated":"2025-04-28T14:16:29Z","snapshot_observed_at":"2026-07-06T19:48:36.508447Z","submitted_at":"2024-11-11T18:21:43Z","title":"OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision","version":2},"cited_work":{"arxiv_id":"2411.07199","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.07199","snapshot_observed_at":"2026-07-08T05:54:33.520626Z","title":"Omniedit: Building image edit- ing generalist models through specialist supervision","venue":"cs.CV","work_id":"97a720ba-6ad9-454d-806b-cae4a79bdcf0","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2411.07199","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:72c0706729c4ca7e09e68ad98a6807769869e6b23b204f81eeadfe72d78b814b","observation_id":"7a15bd3c-2bc1-4997-b72a-a2b2311f9306","resolution":{"observed_at":"2026-07-08T05:54:33.521874Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.03924","last_updated":"2018-04-10T19:25:07Z","snapshot_observed_at":"2026-08-08T03:05:32.889595Z","submitted_at":"2018-01-11T18:54:17Z","title":"The Unreasonable Effectiveness of Deep Features as a Perceptual Metric","version":2},"cited_work":{"arxiv_id":"1801.03924","doi":"10.48550/arxiv.1801.03924","metadata_source":"pith","pith_arxiv_id":"1801.03924","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Unreasonable Effectiveness of Deep Features as a Perceptual Metric","venue":"cs.CV","work_id":"3e71734c-1130-415b-8fb8-20fe9c737eec","year":2018},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/1801.03924","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:97755689bdc0edb399e2a554c4b2cae38f645e1d1b1192e4c95a603af464353b","observation_id":"8311148d-6b60-4cda-b5cc-6498e1eaee1d","resolution":{"observed_at":"2026-07-08T05:54:33.519294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:33.885917Z","title":"We choose FIBO due to its strong adherence to spatial layouts","venue":null,"work_id":"ea300547-f268-4e4d-a57d-9af996b83dc3","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:ca3dadd21732e60c3881b816d1892a5ac25501cedd564fdca2806906c5c9598a","observation_id":"9ffb9559-89cb-44ed-96c6-c0135f99bc60","resolution":{"observed_at":"2026-07-08T05:54:33.887144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:33.884042Z","title":"To stabilize the initial training phase, we apply a warmup period of 100 steps during which the model is optimized using only the L1 loss","venue":null,"work_id":"ddfdb902-d908-4bab-82ee-f1f039297f6c","year":2000},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:f9f6322fa3c2a2daa876a35b09611620fb0f9897a8a39f1940c070a817cdb59d","observation_id":"98cc5f86-8a70-4af4-b166-dd5f26f380bf","resolution":{"observed_at":"2026-07-08T05:54:33.885324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0460.0070","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:33.562004Z","title":"Recolour the bottom right clownfish to be black and white","venue":null,"work_id":"840d8989-6e2c-4c21-b9f1-4a3f5d3ccd30","year":2050},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:32571c5b74e9f47912263400f5d6d2c7751a1533b7c3af396f6a83575e9bb709","observation_id":"896f0a33-f442-4b4d-a9f4-1d83dfc38318","resolution":{"observed_at":"2026-07-08T05:54:33.563947Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:33.880102Z","title":"All automated Vision Question Answering evaluations and prompt generations utilizing the Gemini 2.5 Pro API (Gemini Team, Google,","venue":null,"work_id":"838cbd9e-d8ea-4087-82f9-e5c265ea9a89","year":2025},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:58e9d16e7bd561984fb3e29e27284cee3eb4dd23127a0ce29cce862902b4b7f4","observation_id":"e62b7b48-034c-4947-bb26-0b5a997dc9ac","resolution":{"observed_at":"2026-07-08T05:54:33.881647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":12,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":4},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2607.06445."}