{"as_of":"2026-08-21T03:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd6b3a9d8d1a0ebf616a8efaf25b0a8eecbf6f0ccdbffbb979460fa1e703556f","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T08:29:01.477958Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05122/citation-record","integrity":"/paper/2607.05122/integrity","json":"/paper/2607.05122/citation-record.json","paper":"/paper/2607.05122"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1902.04601","last_updated":"2019-02-12T19:32:48Z","snapshot_observed_at":"2026-08-14T17:17:19.423535Z","submitted_at":"2019-02-12T19:32:48Z","title":"Contrastive Variational Autoencoder Enhances Salient Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04601","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Contrastive variational autoencoder enhances salient features.arXiv preprint arXiv:1902.04601, 2019","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/1902.04601","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:f71de58ab5c20236546ada4324ad37c680f97919415d3baaa57d9822071a0462","observation_id":"619c6f72-e8cc-4123-a220-525fa1e712da","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:5f6f79a3d2965982395f854287ccfcc57fc10a5c71f4eb8c52175d935fd1180a","observation_id":"95981706-a1f6-4313-9a39-272a257540ec","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-17T17:58:31.496050Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:d873853c293d8709dc7cc19391fcf237ed7d99767758a1c83a530b6dd9fb1b17","observation_id":"b6e50527-e702-4417-aa23-4552559563ad","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07775","last_updated":"2024-07-12T14:37:08Z","snapshot_observed_at":"2026-08-16T13:35:23.650773Z","submitted_at":"2024-07-10T15:49:07Z","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07775","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Mobility vla: Multimodal instruction navigation with long-context vlms and topo- logical graphs.arXiv preprint arXiv:2407.07775, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/2407.07775","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:7f3a9fb3d4d51424aaa79b0c00a969ea54f26fe0d1d2a8dbcb7b7cfb83bd4e0b","observation_id":"e010aa7e-79b6-4b1e-9885-a936b56077a3","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Gpt-3: Its nature, scope, limits, and consequences.Minds and machines, 30(4):681–694, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:e4f33e837df63bcf6d54fd102552d0f6a4c4cd8785dabfddb1a90b48ac7a3c80","observation_id":"1730f73e-b5d0-4755-aa67-b7726b034c66","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18164","last_updated":"2026-07-08T16:25:37Z","snapshot_observed_at":"2026-08-19T21:01:10.634184Z","submitted_at":"2026-02-20T11:57:52Z","title":"GrandTour: A Legged Robotics Dataset in the Wild for Multi-Modal Perception and State Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.18164","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Grandtour: A legged robotics dataset in the wild for multi-modal perception and state estimation.arXiv preprint arXiv:2602.18164, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/2602.18164","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:f5fd8d4ffb9789e23e1ec49c09acb66b961803afc050bd6977ec5f670860d348","observation_id":"a3b959a2-c5a7-4942-b205-63fae6310e2e","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13446","last_updated":"2026-06-08T21:52:42Z","snapshot_observed_at":"2026-08-19T06:57:04.432294Z","submitted_at":"2025-08-19T02:01:06Z","title":"CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13446","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Cast: Counterfactual labels improve instruction following in vision-language-action models.arXiv preprint arXiv:2508.13446, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/2508.13446","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:72a1fd46982963aabd67d5b20c1c9930b53d3f6aa4d63cd022c5c9c03621689b","observation_id":"b6ca0b24-073a-4443-bb2f-b6814daef2e6","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Run-time observation interventions make vision- language-action models more visually robust","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:5fae1fc4db28c3bfed5a12f832660425c6a1c6bb1c0410424267e80b0981e43d","observation_id":"8eacd32a-40a9-4412-af01-7699a5566722","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Omnivla: An omni-modal vision- language-action model for robot navigation.arXiv preprint arXiv:2509.19480, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:f906fcb4939387b865376f0b7ce432ad5575d988b92d9806ff821e4e96f5c1b9","observation_id":"fd7bb761-36fe-486e-9797-a71e6e109af2","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Visual language maps for robot navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:831baa78a633af2f3ea02f599f9b2fe8f9fe14dc87800bb92959cf4d9c90522d","observation_id":"07f8d2b6-620e-4201-bec6-d11316cae1e4","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Language is not all you need: Aligning perception with language models.Advances in Neural Information Processing Systems, 36:72096–72109, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:afd7d6b080f6bdd75cfc34c309d8f9c3b97f1044fd57af034cf69e03ca3a02b3","observation_id":"cf0d5938-d2f0-448b-a87f-98b9b5aaa8c3","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:dd2b4c59a3e0b6f20ad6442feaf5161bb233402715d2e75afe59733223d9589c","observation_id":"92b39c66-40fe-4edc-b114-a2a062a06390","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-19T17:18:24.172135Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms.arXiv preprint arXiv:2402.07872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:8ca6f32315bfbbff99b98aba4f158ae1656ce545c9766210720aa221a4a34826","observation_id":"cd4561a9-4371-447c-8fda-5928d69a8e9c","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:489d09d2d3ed42c5d190ea86ab503d2585f560bbafca3c91a267d8648cd25460","observation_id":"4ccb6bed-6e12-4596-9726-cdc3e94a3ff1","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Lm- nav: Robotic navigation with large pre-trained models of language, vision, and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:97be42b428a1ac31d57dcc4e8d070243084c63bfd03d52f3c4b94cad46567332","observation_id":"30b4e02d-41ea-49de-9572-de954ec5420a","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Vl-tgs: Trajectory generation and selection using vision language models in mapless outdoor envi- ronments.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:e02a03a3de702b97717b942909848bd0f4e1761b2dab56ce163907283170b6ed","observation_id":"0ae1ffc2-1c5a-4431-a8ef-68508a0b0abd","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"A comprehensive review of yolo architectures in computer vision: From yolov1 to yolov8 and yolo-nas.Machine learning and knowledge extraction, 5(4):1680–1716, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:ea05fe0f88d742c899149cbb7d5167022acdbee97c286e2b787834defc13e2c3","observation_id":"11562855-92c8-455f-ba19-b9ce3b119783","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Segformer: Sim- ple and efficient design for semantic segmentation with transformers.Advances in neural information processing systems, 34:12077–12090, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:7db167413e09b7e64ec5654cd45d844f0c1773c12bbdd3e66901598e6197cfca","observation_id":"bec28576-1e4e-49ab-9be9-8a08b6153636","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:4fcd01ef1733943fc2fefbfebce56a114e3dfd104cbfb2d20b685982c849bc6d","observation_id":"348aaec1-2dd5-47bd-b44c-df6a9852b279","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T08:29:01.477958Z","title":"Segment everything everywhere all at once.Advances in neural information processing sys- tems, 36:19769–19782, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T08:29:01.477958Z"},"links":{"citing_paper":"/paper/2607.05122"},"observation_digest":"sha256:cd6060d1c235dd21d885d0299597d1106688694e16b2fc81622678b4e0630a3f","observation_id":"247dbdb6-fb27-471a-8678-ad10435ccfcb","resolution":{"observed_at":"2026-07-11T08:29:01.477958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05122","last_updated":"2026-07-06T14:11:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T00:00:40.513858Z","submitted_at":"2026-07-06T14:11:27Z","title":"Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.05122."}