{"as_of":"2026-08-13T14:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17e6a174c894251704b36651572433b7fafeb22e128089e30512b06a6d6384a7","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T21:23:44.253416Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T15:45:43.483298Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.25360","snapshot_observed_at":"2026-07-11T15:45:43.483298Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04652","last_updated":"2026-07-06T04:17:15Z","snapshot_observed_at":"2026-08-06T07:39:58.360532Z","submitted_at":"2026-07-06T04:17:15Z","title":"KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T15:45:43.483298Z"},"links":{"cited_paper":"/paper/2606.25360","citing_paper":"/paper/2607.04652"},"observation_digest":"sha256:d4fc304acc61f1bb6df050a9371c95fe969752af959ce6932308cdb65d0eb7a9","observation_id":"eb82373d-f568-47a7-b9b6-aecb5a80be73","resolution":{"observed_at":"2026-07-11T15:45:43.483298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.25360/citation-record","integrity":"/paper/2606.25360/integrity","json":"/paper/2606.25360/citation-record.json","paper":"/paper/2606.25360"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:f35293f0f068fbf1e95da439f32214c9745decf19b01841b0133d56949fae123","observation_id":"fa56e012-6ce6-40a4-b48b-d5e80e006be1","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"OpenVLA: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:a3b10fe2fddb9c89d1835eb6161d5e43edf40ef7b98e06cecd2ef918e65161e0","observation_id":"034c7b5b-f9de-4e31-82d0-fc7538c38318","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:a5de5f047e53afe01b871a95df0382e0bd6555ced206c917e22d68a1a7ccd077","observation_id":"c6e1ab2f-2136-4386-9e4c-5fea8e64ece3","resolution":{"observed_at":"2026-07-04T19:20:07.157528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"ALVINN: An autonomous land vehicle in a neural network,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:066e63a0238d60a21f5a10dd9db888031e43a06c79ae5247ae1cb75ec3b11f8e","observation_id":"74b78b5e-a78e-4084-aa7a-c55801a491c4","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17449","last_updated":"2025-09-04T16:46:34Z","snapshot_observed_at":"2026-08-12T15:17:35.772655Z","submitted_at":"2025-08-24T17:01:15Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","version":2},"cited_work":{"arxiv_id":"2508.17449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.17449","snapshot_observed_at":"2026-07-09T20:46:33.635839Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","venue":"cs.RO","work_id":"a6a3c7b8-3934-4eb0-bca0-bcb50f12f50b","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"cited_paper":"/paper/2508.17449","citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:02db38b501dd59b7cff6585331be6b042765edfce35e54a90e7df4f8b0a34c46","observation_id":"3239d6f8-2b3f-4200-a385-b3431935b6c8","resolution":{"observed_at":"2026-07-04T19:20:07.152003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:7733261c9508c3791267365c3620e91a436f566c9deb9f48d8e606c74d7a5f2f","observation_id":"bb255f11-f354-47d4-84f7-7d2e69fc3472","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:067525beb377ca17adfa040be99ebd57a8593a18fce843bba73bbc92ef8b694b","observation_id":"6a2444a1-2ec6-403e-b4a2-ba672a804eca","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:999234434a2c9af48afe19b078fd2dd6047137424e31b190c7ec5ba6cd042968","observation_id":"0d921627-8eff-4cbe-a854-7f02fd358531","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:900da27e273c8df692ccbc94f1066853f8c73e0d487f096f12f3827cbe6e5a13","observation_id":"988e34b6-fd3d-4425-9b4a-a98309529043","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:76b8ba92ee485f9a98db91cc7b019c025dd58e65ac715146b6211a2a2a546a22","observation_id":"fb07ed91-7e93-4a20-a6f1-c0e0ac4f51c6","resolution":{"observed_at":"2026-07-04T19:20:07.149183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"3D diffusion policy: Generalizable visuomotor policy learning via simple 3D representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:bc5a203fb04c9aebc2c3a5485f2985471714506340d88605224da54d141f52ff","observation_id":"2c10252d-d4a1-421f-a607-2e71311693ec","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"RISE: 3D perception makes real-world robot imitation simple and effective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:fb757376b26a6ea2d02f1371fae0886245c655fc6704144f6a3a9d3e35ce8582","observation_id":"3a72c63c-cce9-42f8-88fb-9f599b8d6e4c","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:9ea581a48e7aab946852231326ba5e2e2ac954b889b606b505c483de492e541f","observation_id":"ed1ddf3b-764b-42c5-9e64-83c472a43a57","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Dense object nets: Learn- ing dense visual object descriptors by and for robotic manipulation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:76582dff486ca3ae951b7c8acd81d5d2f3b19b3bd02be9fbfa92ce7b7523bf05","observation_id":"e85e71e3-8618-49c5-a24a-8e2cc70719ec","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"VIMA: General robot manipu- lation with multimodal prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:2d163a9b1aa85c1b2808bc2240dcfe8392ed9f15631cd9af0abd817f022ebd15","observation_id":"f67ef300-7f55-4893-b806-b931d961480b","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"MOKA: Open-vocabulary robotic manipulation through mark-based visual prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:c98a568e9d385864f1cacb19ca7cc6865b36e52101ab7c4db330c6906215e54f","observation_id":"68320909-8301-4fd9-8cb8-0ffbc1d4656d","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"ReKep: Spatio- temporal relational keypoint constraints for generalizable robotic ma- nipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:b877855caf7b952d11324fb3c977657ab9d3cce3f822b41406022630d4a2635f","observation_id":"5ad94462-be3c-472f-a3b8-350a8bda9438","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20014","last_updated":"2024-12-28T04:23:47Z","snapshot_observed_at":"2026-08-12T17:59:05.652111Z","submitted_at":"2024-12-28T04:23:47Z","title":"ProtCLIP: Function-Informed Protein Multi-Modal Learning","version":1},"cited_work":{"arxiv_id":"2412.20014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.20014","snapshot_observed_at":"2026-07-04T19:20:07.153269Z","title":"Bring my cup! personalizing vision-language-action models with visual attentive prompting,","venue":null,"work_id":"4a81014f-f6ed-48fa-ad6c-23303b466099","year":2024},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"cited_paper":"/paper/2412.20014","citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:4fb05bea5d22e86e1288763eee5f6f2dca1cef833055fcd7405c5aa872899a33","observation_id":"596185ce-c585-4a7d-952d-58411ee7f0e5","resolution":{"observed_at":"2026-07-04T19:20:07.154799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:16:29.394965Z","title":"Spatial forcing: Implicit spatial representation alignment for vision- language-action model","venue":null,"work_id":"0de0fc11-052f-4fee-af32-850d60b54a52","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:bf03854b493f2967aba9f5407f4fd8aadcda586187ddea61a1c496542bd3471c","observation_id":"1001b5fe-7477-4d1d-80f9-c7768c154381","resolution":{"observed_at":"2026-07-04T19:20:07.143749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10912","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:44:59.714149Z","title":"More than a point: Capturing uncertainty with adaptive affordance heatmaps for spatial grounding in robotic tasks,","venue":null,"work_id":"9f3306ef-4f42-448c-9b60-c491fc9dccb0","year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:6e7f6c31f8fdc7e18d956ca7f19c4785fa1160947ae611da83008c2b1f139d22","observation_id":"26a75245-f23b-4850-902a-b68bd98c7382","resolution":{"observed_at":"2026-07-04T19:20:07.146577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"SAM2Act: Integrating visual foundation model with a memory architecture for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:0830af01a58f064bfd25a867715c0b2f76746979b86e66cc8c8a7a95f83d786a","observation_id":"5d95502a-351d-48bb-abf4-29b917a635b1","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-25T21:23:44.253416Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-25T21:23:44.253416Z"},"links":{"citing_paper":"/paper/2606.25360"},"observation_digest":"sha256:cdccf5c1ec85ef6f932578151001e847a6f91c5aa5067e345de286c359441ec9","observation_id":"31ecf627-bde9-4b78-adf1-12745b35a77c","resolution":{"observed_at":"2026-06-25T21:23:44.253416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.25360","last_updated":"2026-06-24T03:45:06Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T09:22:56.337937Z","submitted_at":"2026-06-24T03:45:06Z","title":"Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2606.25360."}