{"as_of":"2026-08-09T05:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1d00c4ae439893eb8e61afce2b5779bae4366552079773fe66242ce2bace2ab","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:57:12.082156Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06154/citation-record","integrity":"/paper/2608.06154/integrity","json":"/paper/2608.06154/citation-record.json","paper":"/paper/2608.06154"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:16.685543Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"2c259c0e-18f8-4135-b94f-f67bf88afe7a","year":2021},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.270889Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:f4bf1fea1a8c9a34ee59ed9f873f106b0673426793776f1ab260a8ec076e872c","observation_id":"a603f8c3-022b-4147-8169-63fe57346953","resolution":{"observed_at":"2026-08-07T13:57:16.790543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T13:57:08.301524Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.301524Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:9a70be395a1fcbd1b27095ec08ca080b68be13e455634f2197a21b3e7a2c0f3a","observation_id":"0e43c405-639a-4c5b-b059-ff170912dad6","resolution":{"observed_at":"2026-08-07T13:57:08.301524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:57:08.373123Z","title":"Qwen2-VL: Enhancing vision-language model’s per- ception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.373123Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:71a80eee8d7cb51cfd1747882ba3f0ba366f8fa5f4a0a6238fdf30014b7089dd","observation_id":"4603868a-d4e8-4c73-89f7-1d53b5515177","resolution":{"observed_at":"2026-08-07T13:57:08.373123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:57:08.442796Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.442796Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:2a074685e22351c72a6cbad686d9d26386135f444e3e0e1a0670bee40f37f21a","observation_id":"a1a210d9-32bb-4b99-8083-5b762cb6b2ef","resolution":{"observed_at":"2026-08-07T13:57:08.442796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T13:57:08.553499Z","title":"MiniCPM-V: A GPT-4V level MLLM on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.553499Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:5095cb380972061afffa0e1be871708ee55474675edb661731b35e8df11c9863","observation_id":"dbb8b77a-3727-4987-a03a-e8a06282aa5f","resolution":{"observed_at":"2026-08-07T13:57:08.553499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-07T13:57:08.643309Z","title":"Qwen3-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.643309Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:0402d6d09ed20fe92c290a00a37dfde398b095bbeb62691f7c3bf5acda7b712e","observation_id":"fb1a59d1-ed3d-4bad-9ccb-6af984254bd5","resolution":{"observed_at":"2026-08-07T13:57:08.643309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-07T07:26:54.689579Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-07T13:57:08.729258Z","title":"Gemma 4 technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.729258Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:a002137361f08f8addd66320ecd6e17eb9c1266021a188c9e7c1052c536b0a49","observation_id":"4d55ec77-a452-4a5a-becb-390200596896","resolution":{"observed_at":"2026-08-07T13:57:08.729258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:16.504356Z","title":"Qwen3.5: Towards native multimodal agents,","venue":null,"work_id":"5c4f3b5b-4500-4b13-9918-15dfa61724ac","year":2026},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.814585Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:4761140e5f4a3dfe31d60abd2b9c9ce3c01d632136d626db38adde55745fc3a8","observation_id":"ec3159d7-5976-4240-90d2-7389098270cd","resolution":{"observed_at":"2026-08-07T13:57:16.579700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:16.288638Z","title":"Introducing Mistral 3,","venue":null,"work_id":"7145b049-192d-4841-a075-01d83544c0f8","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.880443Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:ef1ed3df33289de1b5b1b4afbefda85bd9fffb5ef7927cafbab9cbe0b0d2e6a3","observation_id":"f585939b-9dd9-4c7b-88d2-52e812ad10b1","resolution":{"observed_at":"2026-08-07T13:57:16.388390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-07-06T22:30:31.933240Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-07T13:57:08.961126Z","title":"MiniCPM-V 4.5: Cooking efficient MLLMs via architec- ture, data, and training recipe,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:08.961126Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:6420fc8210d40b6b0c7bb4c77f52ae51ad4b170f5c10fc1db4f52f0c61f9cf71","observation_id":"06420827-4300-4bed-81da-c6f12310a09a","resolution":{"observed_at":"2026-08-07T13:57:08.961126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-07T13:57:09.055707Z","title":"SmolVLM: Redefining small and efficient multi- modal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.055707Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:dd0e92ceb1fccee09a92972819df4a7a08f2edc2296b639644f5939eccc5fdd7","observation_id":"9ffb7a4b-5bc3-433f-b84e-657efa32534c","resolution":{"observed_at":"2026-08-07T13:57:09.055707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:16.106582Z","title":"NavGPT: Explicit reasoning in vision- and-language navigation with large language models,","venue":null,"work_id":"a98ee7bc-1132-4bd1-8c91-1a425c3e61d9","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.150370Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:19fec9a9f270d83066c51490c79438da96138fb756287cbd89499726bc59f434","observation_id":"2e96abb8-7e75-49cf-bad1-44b987d96f15","resolution":{"observed_at":"2026-08-07T13:57:16.185974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.893590Z","title":"VLM-Social-Nav: Socially aware robot navigation through scoring using vision-language models,","venue":null,"work_id":"5ad1e7da-413f-4a4d-bbc9-eb6996244817","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.191891Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:5de4b61fd803cef4a61253f1b525aa4267d620cb4ea10ee89283225cb0b1455b","observation_id":"2ac4a8d0-ddbe-4845-83ab-753e13619f30","resolution":{"observed_at":"2026-08-07T13:57:15.988861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.700842Z","title":"VLM-GroNav: Robot navigation using physically grounded vision-language models in outdoor environments,","venue":null,"work_id":"f8136e3b-f5bf-43ca-b99d-43971f237680","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.271864Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:a290da1c1e8fe15d22cfb705237b290ab21818b84c51f718ad24897b35cd0ede","observation_id":"1617f2b0-e8b3-4d04-a32d-24e9620e142a","resolution":{"observed_at":"2026-08-07T13:57:15.794638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.528957Z","title":"MapNav: A novel memory representation via annotated semantic maps for VLM-based vision-and-language navigation,","venue":null,"work_id":"e34dd467-bd4b-458b-b314-f378a1b452e9","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.376035Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:07c8ec02f760c671314e72125ded58d9acdc58fed2cfaf63240b035d1707fb85","observation_id":"f31e68ee-2539-4c67-bb19-0ef0a3340012","resolution":{"observed_at":"2026-08-07T13:57:15.624658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.295007Z","title":"HazardVLM: A video language model for real-time hazard description in automated driving systems,","venue":null,"work_id":"2d1e1ac4-d74c-407a-84f1-b89d06c1dcde","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.469350Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:21d7ee7f29bd3a94500c6e02d9cd5f7ab95d4f18f55712926562ea6c12a639a4","observation_id":"70fc3451-2ab0-43bf-bfdb-0fc46a2249cf","resolution":{"observed_at":"2026-08-07T13:57:15.405609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:15.095499Z","title":"LLM-powered cooperative perception framework for mixed UA V-vehicle platoons,","venue":null,"work_id":"1ae7d762-c769-4ae1-b3a0-665d6191b18a","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.543585Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:ec0a5e8d5000b57b629e08d94f81d4690ac7e9aa4d1150a825866cb46a54aa32","observation_id":"25951574-ea08-42cf-87f1-209bb847b839","resolution":{"observed_at":"2026-08-07T13:57:15.178944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.862742Z","title":"Semantic scene understand- ing with large language models on unmanned aerial vehicles,","venue":null,"work_id":"a8c99aad-0786-41f1-ac58-e2cc6edaba79","year":2023},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.642706Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:4394a0d16f5f587556e92cd1363c6b50353f43afa75a4e4de35bef8fba2317e9","observation_id":"c5278006-8a5e-4c69-99f3-2bcd668bf024","resolution":{"observed_at":"2026-08-07T13:57:14.962984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:09.715223Z","title":"Shortcut learning in deep neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.715223Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:2185ea1809b5648d73b22676d7773d8958c07af7f635ea936c3f1f7d0d556adc","observation_id":"91026761-6ef7-4e28-b7b5-ce3798e118e0","resolution":{"observed_at":"2026-08-07T13:57:09.715223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.658741Z","title":"Beyond accuracy: Behavioral testing of NLP models with CheckList,","venue":null,"work_id":"97bb3861-005b-4ae6-ba76-17d34e8e8ec8","year":2020},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.835083Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:6a2d3ce1f03a11a3c316e1ee79a9b8a8def5928e9439cb9f49fae149ef5d6a7b","observation_id":"f29b433f-6864-482b-8456-418ec2180865","resolution":{"observed_at":"2026-08-07T13:57:14.751966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T13:57:09.972585Z","title":"Holistic evaluation of language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:09.972585Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:f17810d31dd4a2d19d13c4570f943bff4bc05d4b5d33546089d4814463093081","observation_id":"ca7c9e58-04a9-4a16-9f56-56cadde12161","resolution":{"observed_at":"2026-08-07T13:57:09.972585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:10.087742Z","title":"Metamorphic testing: A review of challenges and opportunities,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.087742Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:6f545110c4cd5970b06ee23ee04738d2edab81776af5f8be2e8ea01a174de87a","observation_id":"e00c28b0-ce6a-4c24-a854-1d9bf318dca4","resolution":{"observed_at":"2026-08-07T13:57:10.087742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.391443Z","title":"DeepTest: Automated testing of DNN-driven autonomous cars,","venue":null,"work_id":"7eb721e7-a6f7-4617-8720-716234b531a3","year":2018},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.174166Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:a63ed50a605af3a7b0793f11b018d5733e93b5e74230381cb62bf17c222e6dba","observation_id":"c77f0cb6-c974-420b-b245-66d362744f41","resolution":{"observed_at":"2026-08-07T13:57:14.544924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.217308Z","title":"DeepRoad: GAN-based metamorphic testing and input validation framework for autonomous driving systems,","venue":null,"work_id":"0a6a8288-9b16-4e61-bbd2-7e55a7865623","year":2018},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.263345Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:f222fb865c0e6600d1884660a3dbc7c3f3d986b6851c48fcabae36b01cf9d4ea","observation_id":"7e56556c-58b4-4bdd-8297-6dc57e25b612","resolution":{"observed_at":"2026-08-07T13:57:14.289522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:14.053953Z","title":"Metamorphic testing for semantic invariance in large language models,","venue":null,"work_id":"b9495180-2069-4f6e-b69d-2227b07eed8d","year":2025},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.360725Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:2b5ad129cec7a24b893ce350f7cc746db4d9b6b7070b618159ff5d89e6e1da25","observation_id":"3d13e243-58ed-4600-a09d-910ea348d10e","resolution":{"observed_at":"2026-08-07T13:57:14.128045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.900589Z","title":"Semantic invariance in agentic AI,","venue":null,"work_id":"d18324f7-b244-4c3e-91d7-1f0e7418a3ee","year":2026},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.489405Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:d615d9a418b664df133d00a8f97fd60e0b654fd65ab843b1e61984b850cdd160","observation_id":"b0ec6d09-d4c1-48cf-8a38-2302de9e0bad","resolution":{"observed_at":"2026-08-07T13:57:13.966883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.714130Z","title":"Energy-aware multilingual evaluation of large language models,","venue":null,"work_id":"9993896e-0647-4066-bcd7-f96092992f61","year":2026},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.601401Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:8284d4aa2727ef9359475d4f74da0fe4b656a06f4eb5c3bded9d16618a4e81a9","observation_id":"30cb1895-c93d-4bb4-a201-3ef5de9543b3","resolution":{"observed_at":"2026-08-07T13:57:13.818647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.531657Z","title":"EdgeShard: Efficient LLM inference via collaborative edge computing,","venue":null,"work_id":"5c1ae2c2-9e95-4c32-9685-5e89988bb38e","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.719094Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:6b21735021e6422495d40cc59af4caf3e1b5cdef5acb72811986c6e7a96c82cd","observation_id":"d6c3c2ca-c79c-444a-b2a7-7605c6b4ab47","resolution":{"observed_at":"2026-08-07T13:57:13.611251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.390261Z","title":"Power hungry processing: Watts driving the cost of AI deployment?","venue":null,"work_id":"71c46c32-2af6-4edc-bfad-aea4e1dff0dd","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.811054Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:16e3807bc8fbcebc7b595f1dcd655bb39dd987b861da5f284eac541bb597c561","observation_id":"225b71da-b3d6-4df4-9682-930d474951cf","resolution":{"observed_at":"2026-08-07T13:57:13.454238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.234335Z","title":"An environment for autonomous driving decision- making,","venue":null,"work_id":"8b12bb82-9ab4-40dc-9cc5-0fb721b0e665","year":2018},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:10.906404Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:62be7a64c0590cf9435330c3149403d0378f5f2f721bfd39613565d2f292aa96","observation_id":"87e4c2cd-8ee4-431e-a0bb-8a28e650ca2b","resolution":{"observed_at":"2026-08-07T13:57:13.313176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:13.078053Z","title":"Learning to fly—a Gym environment with PyBullet physics for reinforcement learning of multi-agent quadcopter control,","venue":null,"work_id":"4b9aeb27-8dd9-4348-a6f0-09c39a4f92c5","year":2021},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.001892Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:efaecbf5a8cda8f714ebfd7010f9f68ecbc335b7a50eda1a64e5d9819362583a","observation_id":"ff57a3ee-4a1a-4b0c-a83c-a2dc768af9cd","resolution":{"observed_at":"2026-08-07T13:57:13.146672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-07T13:57:11.105161Z","title":"Gymnasium: A standard interface for reinforcement learning environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.105161Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:9fdc52c30d4877073470039ab3d34987a2ba67c43477cb694b8b790ff9835ddc","observation_id":"74bdaa22-0965-492e-9f57-c6556a94b078","resolution":{"observed_at":"2026-08-07T13:57:11.105161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:11.192482Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.192482Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:37a1a5f3fc17ec3829651e76348fd6e30bd3ac16beab4364afeb83b3bf935d56","observation_id":"7b990891-95c6-4224-a76f-fa9af2c2d912","resolution":{"observed_at":"2026-08-07T13:57:11.192482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.925339Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain- of-thought prompting,","venue":null,"work_id":"29b286ee-e319-4847-b877-30f81310a452","year":2024},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.303725Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:09f8237a3cb5e42f0e47cdc657e4530c375cc83cf3315003cddd82eb5f9120d4","observation_id":"e81779ee-264f-462c-bdf0-47724d25e710","resolution":{"observed_at":"2026-08-07T13:57:13.001615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-07T13:57:11.374361Z","title":"Measuring faithfulness in chain-of-thought reason- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.374361Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:12a6aa97f2694573dad456d1b65369059666c29874779c6e92cb879650c3cb11","observation_id":"4ec7dd12-c123-451e-b0c2-20d72d6cdf58","resolution":{"observed_at":"2026-08-07T13:57:11.374361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01247","last_updated":"2022-04-21T16:03:20Z","snapshot_observed_at":"2026-07-06T11:43:54.154781Z","submitted_at":"2021-09-02T23:46:36Z","title":"Do Prompt-Based Models Really Understand the Meaning of their Prompts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01247","snapshot_observed_at":"2026-08-07T13:57:11.478970Z","title":"Do prompt-based models really understand the meaning of their prompts?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.478970Z"},"links":{"cited_paper":"/paper/2109.01247","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:04390460c75c774c2de0554a35e65aa00905459901fd74fdfe1a824f864c6bf4","observation_id":"db19dba4-69c2-4470-8fa9-744f8721c355","resolution":{"observed_at":"2026-08-07T13:57:11.478970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-08-07T20:45:44.253504Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-08-07T13:57:11.549507Z","title":"PromptBench: Towards evaluating the robustness of large language models on adversarial prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.549507Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:f08b8b3e60a82510889f160897a7b025f5b40370d33e0b96b44d17054304ff7a","observation_id":"d7353651-c3b0-43ac-b1a7-9db0d51c80dc","resolution":{"observed_at":"2026-08-07T13:57:11.549507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.770031Z","title":"Measuring and improving consistency in pretrained language models,","venue":null,"work_id":"012c99e7-235e-46c6-96ba-843fca602a5e","year":2021},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.628585Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:d3e5aa874f2b005b9ad7290a87ad4e3c17ad003456b67723074fb3fc4d6b113a","observation_id":"8ebd7ffe-3c10-49de-9ef6-83dd799032d7","resolution":{"observed_at":"2026-08-07T13:57:12.854441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08786","last_updated":"2022-03-03T12:10:58Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T09:29:16Z","title":"Fantastically Ordered Prompts and Where to Find Them: Overcoming Few-Shot Prompt Order Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08786","snapshot_observed_at":"2026-08-07T13:57:11.698424Z","title":"Fantastically ordered prompts and where to find them: Overcoming few-shot prompt order sensitivity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.698424Z"},"links":{"cited_paper":"/paper/2104.08786","citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:239a9fd5d1196739f570b5ce7146d367a6cdc2ad968cb67a6dfaf2d724bc7c25","observation_id":"0cfbf370-8663-4870-bbf6-caf7a772d722","resolution":{"observed_at":"2026-08-07T13:57:11.698424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.628667Z","title":"Probing classifiers: Promises, shortcomings, and ad- vances,","venue":null,"work_id":"e0abc724-540a-499e-b090-324ebd035641","year":2022},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.782731Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:cb6c1fc70359a15feca2e926280b1c1a2793f443e7530d3ae961273a0502314a","observation_id":"57408b9b-37d8-41a9-ba60-92e3229aad1c","resolution":{"observed_at":"2026-08-07T13:57:12.691304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:11.866001Z","title":"Con- strained model predictive control: Stability and optimality,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.866001Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:c56cae075526a78203959d80afeff4fd2947d3773c04be77351ca15f228e7596","observation_id":"3e1d8560-31a1-4c9a-b891-4f3e30f6441a","resolution":{"observed_at":"2026-08-07T13:57:11.866001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:11.927436Z","title":"A simple sequentially rejective multiple test procedure,","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:11.927436Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:25b6e734e7a4846bb182852418f35c331d3bd5e91768a7a4d0a8c27acf9079a1","observation_id":"bc9e8cc5-c59c-41d8-881c-0040b5fd8e28","resolution":{"observed_at":"2026-08-07T13:57:11.927436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.502036Z","title":"SciPy 1.0: Fundamental algorithms for scientific computing in Python,","venue":null,"work_id":"de59e919-0ebf-4a66-9f00-aa3ea7f73eb7","year":2020},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:12.001667Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:40783cc1127817c9259af9f820993d9448863572de1574e95c13aa2c72e51d93","observation_id":"0a71f3cc-ccf6-462e-aee2-b81059cc820c","resolution":{"observed_at":"2026-08-07T13:57:12.541497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:57:12.346130Z","title":"Transformers: State-of-the-art natural language pro- cessing,","venue":null,"work_id":"22f42fa4-8e1e-4c5a-b205-011269b5644a","year":2020},"citing_paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:57:12.082156Z"},"links":{"citing_paper":"/paper/2608.06154"},"observation_digest":"sha256:b23d86707f968d25a38c2d83738d1985f370e0a6b8cf2b40982e29c3c99b8b96","observation_id":"f6350d25-8935-4296-a0fa-a42e0757c57c","resolution":{"observed_at":"2026-08-07T13:57:12.424487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06154","last_updated":"2026-08-06T15:21:42Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T05:13:29.246112Z","submitted_at":"2026-08-06T15:21:42Z","title":"Visual Grounding in Zero-Shot Vision-Language Control"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.06154."}