{"as_of":"2026-08-20T01:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc055cb4ec683578bc229f8ba12a32b8348655495c557c6f85679a2f7de3f811","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:21:22.459302Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:09:18.020873Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T17:09:19.193011Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"cited_work":{"arxiv_id":"2502.00372","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00372","snapshot_observed_at":"2026-08-15T17:09:19.193011Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","venue":"cs.CV","work_id":"ba15cf00-06cb-46a1-ad36-51173fd0707b","year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-19T20:51:44.440472Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:18.020873Z"},"links":{"cited_paper":"/paper/2502.00372","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:6cecd5415e7bd6f619e1f9507327665e0c9d354b22f10eb5b996371dc105917c","observation_id":"d45b8d54-c1a7-4f87-a5ad-e3061a8e04f4","resolution":{"observed_at":"2026-08-15T17:09:19.196908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00372/citation-record","integrity":"/paper/2502.00372/integrity","json":"/paper/2502.00372/citation-record.json","paper":"/paper/2502.00372"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.903281Z","title":"Words Aren’t Enough, Their Or- der Matters: On the Robustness of Grounding Visual Refer- ring Expressions","venue":null,"work_id":"b9497602-c6cb-43ff-bdaf-28c9691476d1","year":2020},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.072967Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:d5a009f0633feec1d4d31464ab2820e22c4e6c1ab115950bb61c5564bbd076e0","observation_id":"d6639aa5-f542-4942-8658-4114c6c30a7d","resolution":{"observed_at":"2026-08-09T19:21:23.907645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.889292Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sa- hand Sharifzadeh, Mikołaj Bi ´nkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Karén Simonyan","venue":null,"work_id":"0b209436-292d-40a9-9358-77ced55f0c02","year":2022},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.078694Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:e49822c87cf975a1719b58a35f4c48448e9223a5daf299fa56797de78b1b3c9e","observation_id":"bcc7def2-ce42-4eba-ba17-dfc6f8a45a74","resolution":{"observed_at":"2026-08-09T19:21:23.893800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.874304Z","title":"Neuro-Symbolic Visual Reasoning: Disentangling","venue":null,"work_id":"b9aabf41-bfa5-42cc-b536-397bc0915084","year":2020},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.083345Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:8ba541ea3225c2e2f7ac8bdedde5c3a3ead1149c9ab453158b8fd9dde648509f","observation_id":"b6defd9b-b9dc-44e9-83a4-fbaccbb86a99","resolution":{"observed_at":"2026-08-09T19:21:23.879277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-09T19:21:22.088741Z","title":"Qwen2.5-VL Technical Report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.088741Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:206f96f71d4abc42782ae60db249fadeb557baf58a1ef47b4c10d7bfa114d400","observation_id":"058c88b8-f54a-4f49-ae26-c407b353a43e","resolution":{"observed_at":"2026-08-09T19:21:22.088741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-09T19:21:22.094229Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.094229Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:5412002e3560b9442c1ac0e0ac76d9404856efcdecf3bf7e6cecd9f9f9a990d8","observation_id":"1fc24f05-2638-4ebb-9139-ceb4c5f19d45","resolution":{"observed_at":"2026-08-09T19:21:22.094229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.858456Z","title":"Language Models are Few-Shot Learners","venue":null,"work_id":"ef3013c1-ce67-4a20-88c2-ba47e8cb1076","year":1901},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.100399Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:7e3ea0505514e023614f3951a78e7ed9cae0afc3cbdaaf3571db1b17ae50f77b","observation_id":"b7463ed9-a233-4a9a-b950-a44f74d3e711","resolution":{"observed_at":"2026-08-09T19:21:23.863541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.841428Z","title":"SpatialVLM: Endow- ing Vision-Language Models with Spatial Reasoning Capa- bilities","venue":null,"work_id":"ed71a18b-b4b7-4ebc-8cda-952f86e6502b","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.106680Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:1dc7e1182e3e902de104068bf0360ad63fe5806ac4e67a0e465c3489a9eb3427","observation_id":"31dd632b-0b6e-4719-9afc-503ba9145641","resolution":{"observed_at":"2026-08-09T19:21:23.847163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.824615Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathemat- ical Expression","venue":null,"work_id":"a7a0f69a-4b02-4f32-9022-522b059ea2aa","year":2022},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.111681Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:f3cd2d1e0842a9f8bf99c8062adf4f229be6fdeda0d36b6cd3c13ece1c1bef8d","observation_id":"59907a97-ae24-46fb-a19a-a9470ceb1a22","resolution":{"observed_at":"2026-08-09T19:21:23.829752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-09T19:21:22.117180Z","title":"MiniGPT-v2: large language model as a uni- fied interface for vision-language multi-task learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.117180Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:5463b8f87fcb35fac99f5b0ce0af20dce88f829711cc41076a21d1b0dee2f01a","observation_id":"b8063a8f-5f6e-456f-923a-12b6e79e4f1e","resolution":{"observed_at":"2026-08-09T19:21:22.117180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.808064Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":null,"work_id":"705a182c-3638-45ae-9f03-193d345e13f9","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.123211Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:4e35fef32c74e80f0f1033a9e9fc53d624a77c12aba74bee221a481f9838d421","observation_id":"c89b175b-0b3c-4705-bb6c-33462768bc20","resolution":{"observed_at":"2026-08-09T19:21:23.813610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.791616Z","title":"YOLO-World: Real-Time Open-V ocabulary Object Detection","venue":null,"work_id":"e0b0450e-035c-4746-8d89-b0514243acfe","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.129737Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:7ced6f8bff366f1159c6a86990a79190c1028c2db44d76e3154e6ac2d82ad857","observation_id":"9b161f01-49b7-40e2-9338-50d4c7ec2563","resolution":{"observed_at":"2026-08-09T19:21:23.796691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.775524Z","title":null,"venue":null,"work_id":"b26b5ef6-4145-4b68-9f33-0df0bdef4a88","year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.134922Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:c5fa4d5a4d40ef40e471b6c89c9a1e30115159d9d70766dd81a0bc58ce11a631","observation_id":"11a1c6fb-c042-4573-8190-0bd4794905c6","resolution":{"observed_at":"2026-08-09T19:21:23.780375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.759450Z","title":"SimVG: A Simple Framework for Visual Grounding with Decoupled Multi-modal Fusion","venue":null,"work_id":"c055be2e-6b16-4ba4-b06d-c04b2e81159f","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.140257Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:f385c9fe3ee62882006d1c292f3b113e6ac403e5ddf050c78a62cd3dd2a6de70","observation_id":"31a371a9-7fde-4fc3-a3de-acc4ea461166","resolution":{"observed_at":"2026-08-09T19:21:23.764754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:22.145505Z","title":"InstructBLIP: Towards General- purpose Vision-Language Models with Instruction Tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.145505Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:36ceed7b1d67455a3851ab83c8ee546940a18d744a521a7c698b1e47bccd9f6a","observation_id":"673e0e28-8bfe-43ea-9e43-9ae2b3e79906","resolution":{"observed_at":"2026-08-09T19:21:22.145505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.732868Z","title":"ProbLog: a probabilistic prolog and its application in link discovery","venue":null,"work_id":"8b3947f6-03e6-4596-8fad-3cef8da9616d","year":2007},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.157235Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:d76fd125eb24bde2f292f7b10261224e6dfc78845fff049281e333a863f35b9c","observation_id":"f28592fc-8cc2-47b2-80ae-43541ac96b98","resolution":{"observed_at":"2026-08-09T19:21:23.737699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-09T19:21:22.162212Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.162212Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:640bd499de984186b96447aaaa5889058a57bb005e28a3bc0b388d6910508a36","observation_id":"6d7a8aeb-fb7e-4485-b387-d0195e7c062d","resolution":{"observed_at":"2026-08-09T19:21:22.162212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.717289Z","title":"Vision-Language Transformer and Query Generation for Re- ferring Segmentation","venue":null,"work_id":"b42fa653-9b14-4c18-a953-115049240b33","year":2021},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.167727Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:570bc59820e95778a186d123625aeb9ff87be70958615abea2967e0198fc4819","observation_id":"2dd95166-f5ec-42d6-bc57-471da1c52eaf","resolution":{"observed_at":"2026-08-09T19:21:23.722690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.701402Z","title":"The Llama 3 Herd of Models, 2024","venue":null,"work_id":"7b75a195-3899-4ca0-8a8f-5334ddb64eb2","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.172924Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:05e7855d8ca7829f565c315f39c2d7f8cb76e419855a8ed7901f51c8d8efe9fe","observation_id":"858a74b3-8f84-4879-ba2b-612389f6eada","resolution":{"observed_at":"2026-08-09T19:21:23.706289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.685064Z","title":"Visual Program- ming: Compositional Visual Reasoning Without Training","venue":null,"work_id":"5aad1f31-bdfa-41c0-978e-9263e68700a1","year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.178028Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:91827e257a92c7b15ee1d4645fb52ac28144d8d69e0be1e4b1839036d1384bac","observation_id":"7bf0417c-9e0d-41bb-9fa5-2ef9f4a6b56c","resolution":{"observed_at":"2026-08-09T19:21:23.691404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.669799Z","title":"Video OWL-ViT: Temporally-consistent Open-world Localization in Video","venue":null,"work_id":"adf5f9cf-c9d5-4c58-9d06-cf4320a4fcda","year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.183138Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:227d05d8b3735dcdb75854ca78540667068a3211d15ad90dac22d8eb7d8dd523","observation_id":"cc9040eb-c2f4-44b0-b399-6eb28f0f04da","resolution":{"observed_at":"2026-08-09T19:21:23.674438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.653450Z","title":"ReferItGame: Referring to Objects in Pho- tographs of Natural Scenes","venue":null,"work_id":"b0fff636-d4ce-42b6-814e-d1df11c57558","year":2014},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.188494Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:124112d2441aefb234b9c19c7e0b608b6662b37a629fff11783ed05cf3aa9cb1","observation_id":"eafc050e-a398-4b8a-ad93-d9e9b54e5424","resolution":{"observed_at":"2026-08-09T19:21:23.658492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.635615Z","title":"HYDRA: A Hyper Agent for Dynamic Compositional Visual Reasoning","venue":null,"work_id":"7c447335-abb7-433b-8a4b-76708356569c","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.193736Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:fc8a1f0c7e4900d0ef78e6b081668650bb08f8eff2067f3353f669a7f3251a1d","observation_id":"b7a9271c-8b80-445a-846e-cc548993ec8e","resolution":{"observed_at":"2026-08-09T19:21:23.640787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-09T19:21:22.204372Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.204372Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:ed99ac5286509fd311753f9e5b6209c701ed616002adf30f718330a19bec7c18","observation_id":"0066eba5-fccc-4e59-a488-e583db03f4d7","resolution":{"observed_at":"2026-08-09T19:21:22.204372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.601946Z","title":"LISA: Reasoning Seg- mentation via Large Language Model","venue":null,"work_id":"312ba622-af12-47f9-aaf7-db407b76f40b","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.209975Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:8086bba0d0af6af5cb69ebb09941e86a6d3a42b8439e7b90da5ad6658c6c2294","observation_id":"a6bbe0b8-3650-4a0c-9f28-0bfdfeed0284","resolution":{"observed_at":"2026-08-09T19:21:23.607109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-09T19:21:22.215330Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.215330Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:67f4fc8b1b938f7860ba87b48238a848d1fd2f8e4a3ecf497278d07b04d7f3f1","observation_id":"635c4a1d-3db7-4901-aa9a-a9a9be8a92fa","resolution":{"observed_at":"2026-08-09T19:21:22.215330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.583265Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"a9999aee-7c79-4fd5-8bcd-e5cc9e74be25","year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.220888Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:c01f2cd2c5fafbede93b1de17ce1cb85d8216528ae1c1b4b43f70c78936bab3b","observation_id":"e2ee7a45-9a72-42d3-ad53-d822732f5b3c","resolution":{"observed_at":"2026-08-09T19:21:23.588928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.568081Z","title":"Grounded Language-Image Pre-Training","venue":null,"work_id":"f9be421b-4a38-4982-bd01-999d95d5fe36","year":2022},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.225228Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:f1771536dbe0bdb1d83f9923838dc5129dccbcf9ca39d4e575e9247066783ecf","observation_id":"4f29b02a-279f-4de1-bdd0-4a74d9057284","resolution":{"observed_at":"2026-08-09T19:21:23.573052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.553041Z","title":"Scallop: A Lan- guage for Neurosymbolic Programming","venue":null,"work_id":"52ae9dea-8f4a-49e2-bbc2-4d9ce5dbb2fa","year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.229629Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:b809555792a0525f8886ae5e89cfde898fe1205082bef9360778bf6a772d1b35","observation_id":"7f14091b-929b-42ed-8698-4aa5b43c44fa","resolution":{"observed_at":"2026-08-09T19:21:23.557753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.537294Z","title":"GRES: Gen- eralized Referring Expression Segmentation","venue":null,"work_id":"0787fba7-fa7b-4394-bf67-87739ca57cf9","year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.233935Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:4a8d3c5b5c44ac392c032cee45707bfd10bc00e8197b31e463e88c1281a52e68","observation_id":"16008e4b-fcd4-43e3-9578-ba5edafa03e9","resolution":{"observed_at":"2026-08-09T19:21:23.542239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-09T19:21:22.238320Z","title":"Improved Baselines with Visual Instruction Tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.238320Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:2fbc02caa67af244b491a9f390f5e2a28029c4b8002e971aa2592415f2877ec0","observation_id":"7219750f-7efb-4088-aa01-9cdaaea59751","resolution":{"observed_at":"2026-08-09T19:21:22.238320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-09T19:21:22.242857Z","title":"Visual Instruction Tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.242857Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:ffd445ee100d7931ed6677a2277aad31b3c08bc1d5480378abaefbe63c10dd7c","observation_id":"b465832c-150d-45c4-8ea4-17b23d782d85","resolution":{"observed_at":"2026-08-09T19:21:22.242857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.521314Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection,","venue":null,"work_id":"78c5ded8-d190-4bf9-9171-e49e9fef0061","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.247511Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:5944d750b94b035e907680eb3c0def57dadc966c850dbcc4e14a8f41f332984e","observation_id":"28ffe688-f29a-4dde-a1db-792d5e1e5c62","resolution":{"observed_at":"2026-08-09T19:21:23.526504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.505251Z","title":"Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models","venue":null,"work_id":"083780c3-5f66-4191-ac59-aa52a102b288","year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.257759Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:22fc13ffe9680218fd8f278f0cb79a021c568a6d307e5df73efb8fcb0ce2fec8","observation_id":"8a0f35a8-5794-414c-979a-45d5f353eff8","resolution":{"observed_at":"2026-08-09T19:21:23.510559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.487692Z","title":"Multi-Task Collabora- tive Network for Joint Referring Expression Comprehension and Segmentation","venue":null,"work_id":"8b4a9aac-cdb2-4015-a42b-2eeb8a12d263","year":2020},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.262858Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:a44a7775c39c92039773f7894727a307b872677067c7eb8a7d6fab651aa6d8b3","observation_id":"19f2f243-e1c1-4c2e-a7c1-cd2090574d27","resolution":{"observed_at":"2026-08-09T19:21:23.493566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-09T19:21:22.252109Z","title":"2, 3, 6, 7, 8","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.252109Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:bce586fec19df898089b0e91efb3306886d93ad677e3f7485bc4112b171af4fc","observation_id":"cf47f353-1114-4f8f-9ed3-e3dd2cf67b9a","resolution":{"observed_at":"2026-08-09T19:21:22.252109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.455343Z","title":"GPT-4o System Card, 2024","venue":null,"work_id":"cdcaec60-f156-4e04-8458-56d6e1e45334","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.273010Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:cd3faaa13cf7d54f6417db4c2cd2bdcbf79183364566f53f06a3c0cdea3216a0","observation_id":"ef2bf3cf-038f-42e6-9119-e48b06d418ca","resolution":{"observed_at":"2026-08-09T19:21:23.459981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.441105Z","title":"Christiano, Jan Leike, and Ryan Lowe","venue":null,"work_id":"c4d99328-4857-49b6-a798-fadd6eaa0102","year":2022},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.278013Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:8bfd62a9ffecc51e438bccd6ea1185814fc92c612ea3bec87cfca3f6cc2367ec","observation_id":"18e9c71d-6314-422e-b5e6-5e9c7c7d05a3","resolution":{"observed_at":"2026-08-09T19:21:23.445602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.470737Z","title":"Scaling Open-V ocabulary Object Detection","venue":null,"work_id":"218dbe36-7331-4ff6-9506-701f1cc222d2","year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.267940Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:dadd2ff73e8fb2103c54243a59c79283a268ad56dc242abd06c71f665851e0a1","observation_id":"636e7608-8c33-4e83-b740-3b8a787115f8","resolution":{"observed_at":"2026-08-09T19:21:23.476105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-09T19:21:22.288779Z","title":"Kosmos-2: Ground- ing Multimodal Large Language Models to the World, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.288779Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:c5f11a126885548955d766186721adcf8996cd17f6acd8ce42871ad3fde0be86","observation_id":"cfa9d043-281e-4300-a349-fcce7730aed4","resolution":{"observed_at":"2026-08-09T19:21:22.288779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.411265Z","title":"PerceptionGPT: Effectively Fusing Visual Percep- tion into LLM","venue":null,"work_id":"01068e72-9cc2-460b-942a-517e448bd2ff","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.294444Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:d7b0b78725cf81a3ad752194b098d45379177f333d2fc3ebd24e668714e7f90b","observation_id":"b438e301-e867-4968-9a69-cccb0519f80e","resolution":{"observed_at":"2026-08-09T19:21:23.415996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.426571Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","venue":null,"work_id":"559e4208-382b-4586-948f-6389e6b6eabb","year":2019},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.283060Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:9e827f99bbad445b8b286a310933926509b1d570bc83a0bbfb47bb3eba0a52f0","observation_id":"ad6f9421-5caf-4284-981b-f694c4ba7320","resolution":{"observed_at":"2026-08-09T19:21:23.431240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.384969Z","title":"Anwer, Eric Xing, Ming-Hsuan Yang, and Fahad S","venue":null,"work_id":"4613ad06-3b28-4e3b-98b5-186d89a3897f","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.304626Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:2e918b4b96aef22211b9fd07aba03dd3c0f593e48290c7396c827a219576d57d","observation_id":"d0d9da8c-6868-4a37-8486-a8b9abca8f41","resolution":{"observed_at":"2026-08-09T19:21:23.390115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.369318Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face,","venue":null,"work_id":"1af644e3-7582-41f3-8a38-10925d6bd5f2","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.310038Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:defd29e198c63ab5d713f6bb85f01ea7f86e1832957b27c2f6229485ced0e20b","observation_id":"8ed197d9-5b23-4c00-bd0d-0a709d72d192","resolution":{"observed_at":"2026-08-09T19:21:23.374381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:22.299518Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.299518Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:1515c7c433e3ff273e6f4e6375a8a14554e01c36619eaf33d57dc8700b7126dd","observation_id":"158df1f1-bce1-4be1-95d7-52fd3a0d73e2","resolution":{"observed_at":"2026-08-09T19:21:22.299518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08128","last_updated":"2023-03-14T17:57:47Z","snapshot_observed_at":"2026-08-19T22:37:31.458598Z","submitted_at":"2023-03-14T17:57:47Z","title":"ViperGPT: Visual Inference via Python Execution for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08128","snapshot_observed_at":"2026-08-09T19:21:22.326159Z","title":"ViperGPT: Visual Inference via Python Execution for Reasoning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.326159Z"},"links":{"cited_paper":"/paper/2303.08128","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:9dafa7bae0cec39509bd9092a253061ac88e5808c47689497a54fc436a3fcb0a","observation_id":"801fb7c1-26c1-49a1-b9b4-00660efe8695","resolution":{"observed_at":"2026-08-09T19:21:22.326159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-09T19:21:22.331855Z","title":"Gemma 2: Improving Open Language Mod- els at a Practical Size, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.331855Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:947c7e87f90f90c0179ad78a9a208f6006ed9464f739bba3e1856c01acae4036","observation_id":"b313a20f-a130-4ece-aa42-1db54810ae0b","resolution":{"observed_at":"2026-08-09T19:21:22.331855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-12T12:50:51.005571Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-08-09T19:21:22.315609Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.315609Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:c812674c47d0b8c9fa1eac0bbf515b6ead9ae0ea1350cbab9fca21266c3d06c7","observation_id":"303c93aa-f55b-448a-9493-d46515b391de","resolution":{"observed_at":"2026-08-09T19:21:22.315609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.353920Z","title":"Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers","venue":null,"work_id":"51a42154-07ba-42bd-9d7f-a3b7cec0bc54","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.321165Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:2b2adfc2edc28a9c728f4ff410a33b08b1d15954561d5a753e573c2556884dd1","observation_id":"c8d15d09-73c9-4158-b08b-53d52a851ef5","resolution":{"observed_at":"2026-08-09T19:21:23.358955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.322306Z","title":"CRIS: CLIP- Driven Referring Image Segmentation","venue":null,"work_id":"5cd77a6d-c078-4ada-9e07-283a02b3a306","year":2022},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.353958Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:8985d7e4ff931d1f65901c06bab979f7a5b2b377185228165bad77a30e912537","observation_id":"2dab5cce-0165-443d-b23a-46ecc6ae5b64","resolution":{"observed_at":"2026-08-09T19:21:23.327510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-15T10:03:23.497428Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-09T19:21:22.358878Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.358878Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:13a0eb4c901ec93edade68ff1e9ebc6ec7939f89f4a4f72a7efaea0cb10df3c5","observation_id":"0828f7ac-e6ee-4f1f-88cd-065ac54e2dbe","resolution":{"observed_at":"2026-08-09T19:21:22.358878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04325","last_updated":"2024-06-04T22:09:46Z","snapshot_observed_at":"2026-08-18T12:09:18.268408Z","submitted_at":"2022-10-26T00:28:40Z","title":"Will we run out of data? Limits of LLM scaling based on human-generated data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.04325","snapshot_observed_at":"2026-08-09T19:21:22.337684Z","title":"Will we run out of data? Limits of LLM scaling based on human- generated data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.337684Z"},"links":{"cited_paper":"/paper/2211.04325","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:08fd707a6a99be2db7d3655d6981a3ac21a3e10c1ef9b7fa3f0b363fd7bea737","observation_id":"4731627e-7fa4-4e11-a8e2-dc5e07e6b0df","resolution":{"observed_at":"2026-08-09T19:21:22.337684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.338383Z","title":"VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks,","venue":null,"work_id":"40dcf604-0ccb-4194-b0e4-2cfa3a33e61f","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.343222Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:b72facf88c7724730e7a43ac0f6c326b7f172b1d683f23de59ca976141bf336e","observation_id":"de374cc4-7d5c-4d3e-83f8-e18810316348","resolution":{"observed_at":"2026-08-09T19:21:23.343366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11175","last_updated":"2023-05-25T15:02:07Z","snapshot_observed_at":"2026-08-19T02:52:41.071391Z","submitted_at":"2023-05-18T17:59:42Z","title":"VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11175","snapshot_observed_at":"2026-08-09T19:21:22.348314Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.348314Z"},"links":{"cited_paper":"/paper/2305.11175","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:d4659ac42f1f28744b2ce44292a0de390df6d7479d629fd99eb68f88aae9b5b8","observation_id":"6aaae9ad-0aa3-4802-992e-9e3a7360e4e9","resolution":{"observed_at":"2026-08-09T19:21:22.348314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:22.378332Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.378332Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:a7eee455620e0f872ea3d8e18d975bcc99d509bb0b7524f5401d75ae59c6f233","observation_id":"a96f5036-d889-42c1-984c-4acd7ad1c729","resolution":{"observed_at":"2026-08-09T19:21:22.378332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-09T19:21:22.382440Z","title":"Set-of-Mark Prompting Un- leashes Extraordinary Visual Grounding in GPT-4V, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.382440Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:d8159539755494638c0537ff20ce007e6cf98c97e2160da6b22edc74813e3b72","observation_id":"aa0e58d1-885b-422d-9749-ff4462c09c4f","resolution":{"observed_at":"2026-08-09T19:21:22.382440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-09T19:21:22.364061Z","title":"NExT-GPT: Any-to-Any Multimodal LLM, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.364061Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:fffcb05db32e48fac304261a46626ea3f260a42b7c06d0fbe45936e8089fe1f0","observation_id":"871c4183-e5c8-4bfa-98bc-e6d6e3c02401","resolution":{"observed_at":"2026-08-09T19:21:22.364061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.202104Z","title":"GSV A: Generalized Segmentation via Multimodal Large Language Models","venue":null,"work_id":"50478af3-f02f-4fb4-be3e-c2ea96d99a4f","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.369269Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:1421fb1487dc8ef0cb1af2b91b402b6bbd0053b082f6fadb8b12390068e23a1a","observation_id":"f52294ea-dba9-488e-a57e-552a7d76b732","resolution":{"observed_at":"2026-08-09T19:21:23.311665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.185680Z","title":"Florence-2: Advancing a Unified Representation for a Va- riety of Vision Tasks","venue":null,"work_id":"178f9308-91cf-430c-b712-8aa574ac009e","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.373917Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:aa04d9d0a2eda8c50d47ef5000d38791b482283e891a8e55e7da96f896b877cf","observation_id":"f4be7c81-dd03-4907-a27d-19caae15154b","resolution":{"observed_at":"2026-08-09T19:21:23.190942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.137130Z","title":"IdealGPT: Iteratively Decomposing Vision and Lan- guage Reasoning via Large Language Models","venue":null,"work_id":"ed0f6083-0aec-4ce3-aeb1-222de84c76f9","year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.399485Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:f9bd09954c6f2a91c2e5c81b840471c87729d99c893c9f24975cac9b614030f4","observation_id":"cf5111f1-ef1d-498b-90c9-e1d0bcbfcc34","resolution":{"observed_at":"2026-08-09T19:21:23.142095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.120637Z","title":"Berg, and Tamara L","venue":null,"work_id":"534656d4-9959-47c6-bfdd-5db7442abc11","year":2016},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.403779Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:ca6a396b841ea6256e173ee6396aa8cffd6767bc4706a0797cdefb012bad1f53","observation_id":"ee68c0b7-80ea-4f64-9e94-6db57a70e0eb","resolution":{"observed_at":"2026-08-09T19:21:23.125998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-09T19:21:22.386798Z","title":"Depth Any- thing V2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.386798Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:03d08940b22c64c2facc9ccca0ebcbc36baac62191d65d0ebcd117b495b1126f","observation_id":"204ca23d-d05b-4f61-8bab-778710993bb4","resolution":{"observed_at":"2026-08-09T19:21:22.386798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.168854Z","title":"Cross-Modal Rela- tionship Inference for Grounding Referring Expressions","venue":null,"work_id":"36bd83de-6f53-4596-8555-0178b02efec0","year":2019},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.391084Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:1e073bd4902c577a57b7f14eb5a723222aa0b00c8b6e54f48fc2d28e3e607991","observation_id":"3f5e6032-e629-4330-afe5-ef8985c5386c","resolution":{"observed_at":"2026-08-09T19:21:23.174061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.152681Z","title":null,"venue":null,"work_id":"c17c4044-cbe6-4370-82f4-11cf7ec36d73","year":2022},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.395185Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:26ecc76b67215729a095c5578c02cf6769fa2123f6fbcc6ff5b5cb55f6af91c0","observation_id":"ea5fc35b-df3a-45ab-b4b1-d35a4ce2b789","resolution":{"observed_at":"2026-08-09T19:21:23.157455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.104281Z","title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","venue":null,"work_id":"7c7a1c08-d831-41c8-9898-d464ba332619","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.408130Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:d31f56d240ddefde7343570bb39f302aa0c291dbc10362c1829d2b0ee61ac335","observation_id":"0fdb9299-4307-4693-9fd3-6e763cecfb25","resolution":{"observed_at":"2026-08-09T19:21:23.109629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14598","last_updated":"2024-03-21T17:50:47Z","snapshot_observed_at":"2026-08-16T14:07:35.311024Z","submitted_at":"2024-03-21T17:50:47Z","title":"PSALM: Pixelwise SegmentAtion with Large Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2403.14598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14598","snapshot_observed_at":"2026-08-09T19:21:22.517767Z","title":"PSALM: Pixelwise SegmentAtion with Large Multi-Modal Model","venue":"cs.CV","work_id":"015ea4cb-49e9-443c-aaa4-93fe9af87d6b","year":2024},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.413504Z"},"links":{"cited_paper":"/paper/2403.14598","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:798a4e97e2f5a9e9d4f87fd8cefbbe92e60718ca88497f71f7e224eb06975f13","observation_id":"c5662df4-091f-4c5e-a5f9-8449060109a6","resolution":{"observed_at":"2026-08-09T19:21:22.525450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:22.418661Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.418661Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:2e26de7578a29fb47a807af55545deada45ed2731cef234a95f1a7d014f10fe6","observation_id":"6fb6f62e-3ad3-4506-8ab4-010f3d7ca1c6","resolution":{"observed_at":"2026-08-09T19:21:22.418661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-09T19:21:22.424064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.424064Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:bc27874251accc1ca71d84c16c90872ab771a7470d84c417c18146fc8873e5aa","observation_id":"c660ab1a-4fdf-409a-8e52-8013b95abe95","resolution":{"observed_at":"2026-08-09T19:21:22.424064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.077892Z","title":"Table 9 presents a quantitative comparison on the RefCOCO, RefCOCO+, RefCOCOg [21], and Ref- Adv [1] datasets","venue":null,"work_id":"76fe69a0-05f9-4b44-921b-84ed58db6dcf","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.429171Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:15c8c2cdf69bb226f9ea930ee1db82c7e8e0a90bec3775f1c147e4a0b932028c","observation_id":"0ad299b5-34e6-4a09-97a9-3db4dbf26d03","resolution":{"observed_at":"2026-08-09T19:21:23.082917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.061477Z","title":"For a fair comparison, we use the same foundation models and LLM for the ex- periments","venue":null,"work_id":"51b9aee6-5a2e-4514-90b4-f60f92978b66","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.434128Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:4dc5d862c3b53fa172a36c8bb03378cf5f09097979fa7bee70728b3d2f9a5bda","observation_id":"9b871822-dd7c-4635-ab03-3c39b278c443","resolution":{"observed_at":"2026-08-09T19:21:23.067105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.045846Z","title":"The results are shown in Table 11","venue":null,"work_id":"8262ce33-7b40-4fed-8d75-fd994ddb3bec","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.439036Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:1f157a881d9463fb4af26d00db707cb01dcbdb3c4524010a79ee8635f0915afb","observation_id":"781c9b0b-4f0d-4c1e-a214-78337446f75f","resolution":{"observed_at":"2026-08-09T19:21:23.050044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.029381Z","title":"In this mechanism, each time the system transitions into the self-correction state (indicated by a red arrow in Figure 2), it is counted as one retry","venue":null,"work_id":"8c1607f3-3b1b-46a9-961d-dce15fc17236","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.444127Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:9bdcf5aeef3328dce584d9af9a58c6a1cb15939213778bbd91dec4a4e2a5198e","observation_id":"504a224c-bc61-4fc1-8b62-96165ff670e5","resolution":{"observed_at":"2026-08-09T19:21:23.034758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.012922Z","title":"The results, shown in Figure 4, indicate that NA VER consistently reaches SoTA performance compared to all baselines regardless of query length","venue":null,"work_id":"1072055c-01ec-493d-b848-b4040aa4d7be","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.449051Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:20fb6cf8280f61b83c9437a83dd51e47419db958fe4ed9784b5aba45fd56d3bd","observation_id":"53f673b3-c505-4da8-94d8-5b95494c63aa","resolution":{"observed_at":"2026-08-09T19:21:23.018330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:22.996344Z","title":"An intuitive alternative is to skip captioning and ask the VLM to predict categories directly","venue":null,"work_id":"0cf87a32-1dbf-4e85-99b1-c51e78b95804","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.454378Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:558796d9593dcab8c509e58a830ef895c379fe7c9a230fe8790213fd284203ec","observation_id":"3ce02b20-ac36-4fb9-a623-5a0cfb14e61f","resolution":{"observed_at":"2026-08-09T19:21:23.002013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:22.980275Z","title":"Yes” or “No","venue":null,"work_id":"1035a0a8-1906-4ffa-8a51-a5182e59fe36","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.459302Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:145a1bf6843fd201c8f829b4b7dbe0526bac3b7ea5e235d276f9e29d0353c0c3","observation_id":"91e6a8e7-9401-490a-b0c7-454915489a28","resolution":{"observed_at":"2026-08-09T19:21:22.985311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-09T19:21:22.151438Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.151438Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:003d96ff682c0bb8199e84b54927c2a3954991a2c7e65fbfdf4cea131ccac5a3","observation_id":"c2fe5022-c14a-4810-bd90-a991e5487999","resolution":{"observed_at":"2026-08-09T19:21:22.151438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:21:23.618337Z","title":"2, 3, 4, 6, 7, 1","venue":null,"work_id":"fd1bba53-6c83-4a4c-a9a0-07020ae0cd59","year":null},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.199123Z"},"links":{"citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:8b9c7ed0294c0ba37f33433602c2f013c935669f9b2b6102c14633e6bb2d0fe4","observation_id":"bcdb2266-fb07-4797-9585-249b93d864fc","resolution":{"observed_at":"2026-08-09T19:21:23.624357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T22:21:40.883127Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 1 inbound Pith citation observation for arXiv:2502.00372."}