{"as_of":"2026-08-19T12:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:972ba5a5e13fa68f55d56420cfdfd5002cf0b82fef0b7ff4707e4d9b56baeaf5","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:07:05.277615Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:57:26.612635Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:57:31.251745Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"cited_work":{"arxiv_id":"2504.21530","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.21530","snapshot_observed_at":"2026-08-07T00:57:31.251745Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","venue":"cs.RO","work_id":"d91941a4-8272-4c55-9820-b9dceb66320a","year":2025},"citing_paper":{"arxiv_id":"2506.12374","last_updated":"2025-06-24T10:01:18Z","snapshot_observed_at":"2026-08-16T05:58:22.870564Z","submitted_at":"2025-06-14T07:11:44Z","title":"AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:26.612635Z"},"links":{"cited_paper":"/paper/2504.21530","citing_paper":"/paper/2506.12374"},"observation_digest":"sha256:219472f66f0a2a347b2f7e0172236e531ab42224f0aaf93ad1c4df361103e584","observation_id":"7c29c10a-ade1-4c72-91e6-45a7d04c8a88","resolution":{"observed_at":"2026-08-07T00:57:31.256067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.21530/citation-record","integrity":"/paper/2504.21530/integrity","json":"/paper/2504.21530/citation-record.json","paper":"/paper/2504.21530"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T05:07:05.014417Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.014417Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:10dd025231a96f0ae2964ebcbd235b79e9c16ac6c3c45476297e88819426d3a2","observation_id":"f074e8e6-36cd-4847-9400-191526bc441e","resolution":{"observed_at":"2026-08-16T05:07:05.014417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-16T05:07:05.020787Z","title":"Rt-h: Action hierarchies using language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.020787Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:9ce816734f4a8007a949c7e51048d9b846c4d56ed2b730be47783f85fe72dc5f","observation_id":"0d461be6-308f-4049-b4c4-d4bf31ce7dd9","resolution":{"observed_at":"2026-08-16T05:07:05.020787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:06.104868Z","title":"Track2act: Predicting point tracks from internet videos enables diverse zero-shot robot manip- ulation, 2024","venue":null,"work_id":"82c4e7e6-dada-46c4-ac5c-053349f315b5","year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.026019Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:3a63488fca9ed5c681e9c763b6da1781f559073f5d9b0044172ac68c3d8ff064","observation_id":"0ef83400-73fb-493f-aebc-6736262fa895","resolution":{"observed_at":"2026-08-16T05:07:06.109718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-16T05:07:05.030891Z","title":"Zero-shot robotic manipulation with pretrained image- editing diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.030891Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:699d2f81f3cf010e9ef165537aeb6f29802e30a39a35bad031295bd94e2de647","observation_id":"4836559d-3557-4069-804f-920f4084e771","resolution":{"observed_at":"2026-08-16T05:07:05.030891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-16T05:07:05.036033Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.036033Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:cd7335105324be48fee1e3feac1354cb884fbff11c1bdf8b16636362addfc5d9","observation_id":"8ce6648c-e311-409c-9a1d-44ef3561d056","resolution":{"observed_at":"2026-08-16T05:07:05.036033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09016","last_updated":"2024-10-16T08:38:07Z","snapshot_observed_at":"2026-08-16T13:18:43.276321Z","submitted_at":"2024-09-13T17:45:07Z","title":"Closed-Loop Visuomotor Control with Generative Expectation for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09016","snapshot_observed_at":"2026-08-16T05:07:05.041332Z","title":"Closed-loop visuomotor control with gener- ative expectation for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.041332Z"},"links":{"cited_paper":"/paper/2409.09016","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:f75eb861f6bfc1324cb0f6623c8816e45431dae48d25945a946f5b6e104adc04","observation_id":"2824a6d8-0541-4ffe-89e4-b040ff4cfe62","resolution":{"observed_at":"2026-08-16T05:07:05.041332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:06.089001Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic, 2023","venue":null,"work_id":"dc5eb52f-dce3-4692-ba24-f69840f9336c","year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.046596Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:14fa83fb39445487b84fc8c007d4dff41b909c1fadb7e7ea4199fe5a8ecf8be2","observation_id":"46e141c7-077d-4b04-9206-4332712dbd01","resolution":{"observed_at":"2026-08-16T05:07:06.093942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:06.073403Z","title":"Diffusion policy: Visuomotor policy learning via action dif- fusion","venue":null,"work_id":"37826a47-512b-4eb2-9aa3-5e1e1bdbdfaa","year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.051125Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:a32122f04a3bc6cd3b740bcfaf23c0f2806f440ec8e8d4e644488cc28d0d8ba2","observation_id":"69db985e-c967-4495-bffa-78c239e509c5","resolution":{"observed_at":"2026-08-16T05:07:06.078264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.056513Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.056513Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:ac391156ebee21114a0e84127921fd10f83c33d9a9b8a2bd82307a968f33a8a8","observation_id":"61ba1ce3-9d6c-4b66-b236-ad5704926dfb","resolution":{"observed_at":"2026-08-16T05:07:05.056513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16309","last_updated":"2023-10-17T16:34:46Z","snapshot_observed_at":"2026-08-17T19:38:34.311897Z","submitted_at":"2023-05-25T17:58:14Z","title":"Imitating Task and Motion Planning with Visuomotor Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16309","snapshot_observed_at":"2026-08-16T05:07:05.061342Z","title":"Imitating task and motion planning with visuomotor transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.061342Z"},"links":{"cited_paper":"/paper/2305.16309","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:977e93d57b9e682a2ccdb3e6516e54942ccc69cb3ae5c93b76d0aa11bc99fc84","observation_id":"cb84a066-c793-414a-9616-46a80439ccf0","resolution":{"observed_at":"2026-08-16T05:07:05.061342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.066352Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.066352Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:6c2d0c7908654126f266a1623ce77170e17c799e2fbd0bbb94ad68d4c7937b5a","observation_id":"5fb40c13-a3c4-425a-9999-85db878aed17","resolution":{"observed_at":"2026-08-16T05:07:05.066352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.04382","last_updated":"2024-05-02T16:17:25Z","snapshot_observed_at":"2026-08-16T17:01:35.444955Z","submitted_at":"2022-05-09T15:35:33Z","title":"FlowBot3D: Learning 3D Articulation Flow to Manipulate Articulated Objects","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.04382","snapshot_observed_at":"2026-08-16T05:07:05.071158Z","title":"Flowbot3d: Learning 3d articulation flow to manipulate articulated ob- jects","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.071158Z"},"links":{"cited_paper":"/paper/2205.04382","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:da84fde82e183f34e18b89caf0a00f43e59ad5440daf091a210aa534ccbdd5fd","observation_id":"ee4c90f3-db52-4217-9d5d-df1c49c4340b","resolution":{"observed_at":"2026-08-16T05:07:05.071158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.076200Z","title":"Anygrasp: Robust and efficient grasp perception in spa- tial and temporal domains","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.076200Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:2abc2f263275ac047f31d858b3cfb47b77de15a33ee7e2909aacffb2ef700721","observation_id":"db5e5724-441e-4e18-a801-d1e2dfe57d50","resolution":{"observed_at":"2026-08-16T05:07:05.076200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:06.028305Z","title":"Moka: Open-world robotic manipulation through mark- based visual prompting","venue":null,"work_id":"720d42bc-4047-4692-b5fc-b759ecd8e1ff","year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.081370Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:487129f14b12b6158ddd1bb102592f847446029790417ffba7caa287d08618e2","observation_id":"67075254-6d1b-4dfb-b3a4-b71e2eac5973","resolution":{"observed_at":"2026-08-16T05:07:06.033158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-16T14:46:11.532367Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-16T05:07:05.085786Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.085786Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:1839081c0f0e82729e7d44732ddea7d1c6c2d81611d2c246fecd39535d4f92eb","observation_id":"dce6ae1b-891a-4f92-acf5-519d726b0f15","resolution":{"observed_at":"2026-08-16T05:07:05.085786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.090760Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.090760Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:58e6341fe27399e2b9f9c2a1386ad0ff34f8d85a446eab1b5d09475c7d17e888","observation_id":"1c440137-15a8-49d7-8e4e-808e75f09171","resolution":{"observed_at":"2026-08-16T05:07:05.090760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.095555Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.095555Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:5a64b2f37a87e3a4e45a3b795953d7ad06e9d45255da3b9771a2441d22c25dba","observation_id":"94e26d11-60ca-461b-9501-8ae73a4335c9","resolution":{"observed_at":"2026-08-16T05:07:05.095555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.993539Z","title":"Rlbench: The robot learning benchmark & learning environment","venue":null,"work_id":"481d3428-7344-4fac-b1f0-a9b9d6c675c4","year":2020},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.100013Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:ed1292aa81e0e632c9e0c60b67b0255967242e1e5987d1d19d9ad86246394bc0","observation_id":"2064a1ad-e8e5-4fd1-90f3-81836ef34b23","resolution":{"observed_at":"2026-08-16T05:07:05.998329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-16T05:07:05.104695Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.104695Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:940f497f44127388af49e46c662312679e17f98bd11bf5bdbeace21c28876946","observation_id":"6dcf33ae-c757-4c84-9011-f240efd95410","resolution":{"observed_at":"2026-08-16T05:07:05.104695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-16T05:07:05.109396Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.109396Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:9b0ace51938815a3f66cd010273089faf0c210886c1e2ebfba8448c9e9a8f07b","observation_id":"2a032ea2-8a3c-4f81-9829-da414ccef191","resolution":{"observed_at":"2026-08-16T05:07:05.109396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.978342Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"a47f1c05-d439-493a-bff3-ea5e81f21e79","year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.114382Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:e9a92df2f333cfb866e29df82bd45ab3a92ebe90cf7682a12e183118de5a6358","observation_id":"cb65e6f4-5702-4e09-908b-9d2c06834f18","resolution":{"observed_at":"2026-08-16T05:07:05.983337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.118904Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.118904Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:694c29ffa363e7c1905830c77529b1768ce5d3d4aee22ea57a5973572610a36d","observation_id":"8b745074-d37b-41b5-bb85-14f9fa64895e","resolution":{"observed_at":"2026-08-16T05:07:05.118904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.123999Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.123999Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:6a9286c70cc7eba0ecd0d7cf8d10f094e10be7947bb367cc4b3ee6c584969fda","observation_id":"e331e974-d1ec-41bc-b1a0-a22077e7d56e","resolution":{"observed_at":"2026-08-16T05:07:05.123999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.943459Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":"a51ad1df-59bf-4e16-b62e-e8445e14c7c4","year":2025},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.128581Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:f20107771c9773432210ff02522796abf14df3288b3021e2bf4c70fd63eaafb6","observation_id":"e4e6f5ae-d174-4aec-aec3-fd7c21ea9676","resolution":{"observed_at":"2026-08-16T05:07:05.948299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-08-14T11:25:08.505775Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-16T05:07:05.133010Z","title":"What mat- ters in learning from offline human demonstrations for robot manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.133010Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:58e2de9723e332f1c3a474e6191257a18fd3adbe82beeae032bbda280c1cc444","observation_id":"03b09d70-72d5-49f7-8dcf-899593fbd439","resolution":{"observed_at":"2026-08-16T05:07:05.133010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17596","last_updated":"2023-10-26T17:17:31Z","snapshot_observed_at":"2026-08-13T22:05:40.944747Z","submitted_at":"2023-10-26T17:17:31Z","title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17596","snapshot_observed_at":"2026-08-16T05:07:05.137762Z","title":"Mimicgen: A data generation system for scalable robot learning using human demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.137762Z"},"links":{"cited_paper":"/paper/2310.17596","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:5296548be1073332d9d94e399764f30f620c2cd01fc597b41f30be03de45925e","observation_id":"d7ad62f4-ff13-4623-9aaf-bdb8c8051f59","resolution":{"observed_at":"2026-08-16T05:07:05.137762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.143620Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot manip- ulation tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.143620Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:b0871cad48fd0d03e4435090f3928c7e68331c7165240a692c3bbb76a0e2521f","observation_id":"f5354ceb-51cd-440b-9a55-78753364ebba","resolution":{"observed_at":"2026-08-16T05:07:05.143620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-08-16T06:47:25.140028Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-08-16T05:07:05.148191Z","title":"Robocasa: Large-scale simula- tion of everyday tasks for generalist robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.148191Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:15244063936f0ca270856081afeeb0222c44243b83614a9fd274c3d0bc0bbdd3","observation_id":"837e1179-462f-4f19-a917-b055c634894f","resolution":{"observed_at":"2026-08-16T05:07:05.148191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.917787Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":"a5dea844-0975-4ba5-a3c6-6f7c2daf8323","year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.153083Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:8989e3c51fb2e2fcdaff89149704a6ba59495bb2b97447fa380789d9d8233334","observation_id":"c1715922-d1dd-4aab-9682-659c4505358a","resolution":{"observed_at":"2026-08-16T05:07:05.922762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.902183Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":"c4f0f8d5-7016-4ee5-bcf9-178b516f8420","year":2018},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.157617Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:0a83cddb2cd8019ea5c2fc34f44a767decb6c8d0c71b29af2f23ecef3e34e2ab","observation_id":"ddd45b25-6d60-4b09-a78c-13707d575483","resolution":{"observed_at":"2026-08-16T05:07:05.907274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.162217Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.162217Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:eb3bbf3981708de1f84a8d95d17ec012ebee9932c4d042c82d29d8eca085f877","observation_id":"b2365aef-51a9-4f86-b86b-8a121f1917be","resolution":{"observed_at":"2026-08-16T05:07:05.162217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.876872Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"f2854917-f9f9-4f08-8df6-10ab30507ae0","year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.166814Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:0261172ba51e05f509344f20e67f299ec1a4a9cd5ba525f5bfe6b0984dfc75b4","observation_id":"0eefa914-6846-4363-95fe-df26598a7180","resolution":{"observed_at":"2026-08-16T05:07:05.881722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.171351Z","title":"Toolflownet: Robotic manipulation with tools via predicting tool flow from point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.171351Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:7a2a0b142ff9b2035a2607c14141d164a0a5f3a7e9afc4d5d4ed73d18f671d9c","observation_id":"4775d94b-b1f0-4892-a54a-ec08ba8c47ff","resolution":{"observed_at":"2026-08-16T05:07:05.171351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.850793Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":"81b8f1b4-6d69-47f6-a87f-12545914c5bf","year":2022},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.175851Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:62574263f6de789b128fd6bda86451d56758e0d3b722e13277017e42baf9f281","observation_id":"6ea02a72-57ef-4be3-876c-634121302f77","resolution":{"observed_at":"2026-08-16T05:07:05.856222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-08-16T15:51:32.614520Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-16T05:07:05.180657Z","title":"Open-world ob- ject manipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.180657Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:7548557dc69b96c0dbb76e334fe426999bf500d2c555c3ed7bfb02cc27d9aa2c","observation_id":"c4303925-de3e-4ff7-b20f-e2d8fda771b3","resolution":{"observed_at":"2026-08-16T05:07:05.180657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16605","last_updated":"2023-10-11T18:09:59Z","snapshot_observed_at":"2026-08-16T15:20:13.491520Z","submitted_at":"2023-06-29T00:12:21Z","title":"KITE: Keypoint-Conditioned Policies for Semantic Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16605","snapshot_observed_at":"2026-08-16T05:07:05.185666Z","title":"Kite: Keypoint-conditioned policies for seman- tic manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.185666Z"},"links":{"cited_paper":"/paper/2306.16605","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:bd775b992adfa82316fa75cecc36d6348cfdd67db2ace1b8056f881cbd26c7e2","observation_id":"06adf63a-fb02-466e-917e-62a3edf1ff75","resolution":{"observed_at":"2026-08-16T05:07:05.185666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.835587Z","title":"Rt-sketch: Goal-conditioned imitation learning from hand-drawn sketches","venue":null,"work_id":"9ffb24c0-d14b-4f1c-b8d5-6fac854da71d","year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.190494Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:b7fd8b8d2ffb2ebfc9a6205463d1c43f800da4111d7df74c349022a6b56dbb3f","observation_id":"99ce5b5c-6f34-4606-8ad6-b484b9192006","resolution":{"observed_at":"2026-08-16T05:07:05.840640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-08-18T07:25:34.849820Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-16T05:07:05.195110Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.195110Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:5bdf4ae9b57b8eff6c5677b63c95576cf5640df9d8ecb33c4aadea5f0b3d9e22","observation_id":"3c951082-1103-41b6-a1fd-93714512b2d4","resolution":{"observed_at":"2026-08-16T05:07:05.195110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.820056Z","title":"Robotap: Tracking arbitrary points for few-shot visual imitation","venue":null,"work_id":"b231b1e4-a1a4-4b1c-ac3d-5615e4a9c2e1","year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.200214Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:e52c18dbec03a7dfbab0b3698ff1fefdda4d592c506e4788cf75f61a42611108","observation_id":"aa50c0e3-b952-419d-8fb3-7bb6e17d6376","resolution":{"observed_at":"2026-08-16T05:07:05.825296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01361","last_updated":"2024-01-21T21:01:12Z","snapshot_observed_at":"2026-08-19T11:42:31.654057Z","submitted_at":"2023-10-02T17:23:48Z","title":"GenSim: Generating Robotic Simulation Tasks via Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01361","snapshot_observed_at":"2026-08-16T05:07:05.205184Z","title":"Gensim: Generating robotic simulation tasks via large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.205184Z"},"links":{"cited_paper":"/paper/2310.01361","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:51d235ada38a04304fae6a155ac373a254e1750fcab0186f4023bb4c38650351","observation_id":"1f055d2a-0859-4feb-8b4d-d4d2e90921cb","resolution":{"observed_at":"2026-08-16T05:07:05.205184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19474","last_updated":"2024-08-23T07:20:57Z","snapshot_observed_at":"2026-08-16T14:14:00.076855Z","submitted_at":"2024-02-29T18:59:17Z","title":"The All-Seeing Project V2: Towards General Relation Comprehension of the Open World","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19474","snapshot_observed_at":"2026-08-16T05:07:05.209945Z","title":"The all-seeing project v2: Towards general relation comprehension of the open world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.209945Z"},"links":{"cited_paper":"/paper/2402.19474","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:b4f021b682ac433776371bc94f5fe8722f02c4084b227899f73989cfce24db78","observation_id":"c4c29b91-de0c-400b-b238-62856187c9ae","resolution":{"observed_at":"2026-08-16T05:07:05.209945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-16T05:07:05.214926Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.214926Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:c50d0fbf642e77271dec1aa6474badb20ab7c6759d6b3510419d4360377097af","observation_id":"9c87fe91-406e-482f-9f33-dd3d4e553154","resolution":{"observed_at":"2026-08-16T05:07:05.214926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-16T05:07:05.219984Z","title":"Unleashing large-scale video generative pre- training for visual robot manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.219984Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:837bd8f50f787f3e2ecf954e42b8ced4fc4cbce861dbcfa9688fc0f04d34f93a","observation_id":"38f1035b-a4ea-4dd2-91ed-9445a9c65e77","resolution":{"observed_at":"2026-08-16T05:07:05.219984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.805134Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"6a17949e-5656-4534-bbc2-3b651e302d7c","year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.224660Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:f9a5cb2e05ce43f1d0935ef4abcdd0492f821ade44ba00c24411b8e065fe437f","observation_id":"7f07915e-3277-4d46-a68e-a438cba7f124","resolution":{"observed_at":"2026-08-16T05:07:05.809925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.788871Z","title":"Flow as the cross-domain manipulation interface","venue":null,"work_id":"7e75eb5e-eed2-4282-b9d5-bc0e719a6fee","year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.229333Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:cae7c5ed04cd2b220699633e94d7352cfde7a018dbec45c989895c33627cc65f","observation_id":"029ea9f6-7685-4cf3-9bce-2e865967315b","resolution":{"observed_at":"2026-08-16T05:07:05.794214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-16T05:07:05.233862Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.233862Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:d6a79389ef66b84db8fb7520a31a83dd9bcfafd6eadacf746ddd2b432a7b7a7b","observation_id":"ecbbc05a-5278-44fc-8150-7e04daaf905a","resolution":{"observed_at":"2026-08-16T05:07:05.233862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11439","last_updated":"2024-09-23T08:22:04Z","snapshot_observed_at":"2026-08-18T19:41:40.971251Z","submitted_at":"2024-01-21T09:39:11Z","title":"General Flow as Foundation Affordance for Scalable Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11439","snapshot_observed_at":"2026-08-16T05:07:05.238702Z","title":"General flow as foundation affordance for scalable robot learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.238702Z"},"links":{"cited_paper":"/paper/2401.11439","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:791bf3750ec3f9c3eb9aa45e31714e160a62550056ef430d7b61d98d3e6b44d3","observation_id":"e7e61a4b-e04a-4e2f-8d5c-e7aee350d623","resolution":{"observed_at":"2026-08-16T05:07:05.238702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-18T18:35:53.970346Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-16T05:07:05.244349Z","title":"Ferret- v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.244349Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:e7ec08f9a6abc8ec3f324bcb7bddae6d528c2824fd8cce03719330db57b6d71c","observation_id":"169caaa6-595d-4751-b87d-a9bd1b76cd8c","resolution":{"observed_at":"2026-08-16T05:07:05.244349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.771905Z","title":"Sprint: Scalable policy pre-training via language instruc- 10 tion relabeling","venue":null,"work_id":"a2606f6f-fa06-4963-9061-ff52563468ef","year":2024},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.249417Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:d81a44bbfae86f9df3f59bc625f3bea28591d762e31beb361d63383dacd54d4a","observation_id":"7c18a2de-149d-4851-8d80-6174614df944","resolution":{"observed_at":"2026-08-16T05:07:05.776430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-16T05:07:05.254066Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.254066Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:3e15f35ddf2719c3d930a5b06e2ba7dbbad309df188ec3c4094f7b77a6e24573","observation_id":"6872fe4e-93ad-48de-b552-228b094bfe3d","resolution":{"observed_at":"2026-08-16T05:07:05.254066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-16T05:07:05.258931Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.258931Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:99921523cc666c152127c4b7d2387105aa4c38ac5b2a9262fd3ccf13d4ce7b9e","observation_id":"9ae6efb6-9784-4b30-86a4-c8cf4450b3b9","resolution":{"observed_at":"2026-08-16T05:07:05.258931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.755984Z","title":null,"venue":null,"work_id":"979deb92-b430-4a27-9185-5f0a80e4ecb9","year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.263792Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:d63719222b946ec5b33884cb72e0983692a38d94a53f3b1b48207456f6f1e603","observation_id":"4c314359-1979-466b-9693-1c318cd8b848","resolution":{"observed_at":"2026-08-16T05:07:05.760836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.740601Z","title":null,"venue":null,"work_id":"29ab5997-afd5-43de-9e8c-83ed68d1869c","year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.268368Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:fd822773f7fb401be7fcce6ba08e64d293a2121b659f4d26fdab7256979128fc","observation_id":"c5833f51-b78b-47a2-9536-ba3c34ab632e","resolution":{"observed_at":"2026-08-16T05:07:05.745175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.725338Z","title":null,"venue":null,"work_id":"84697a79-add6-437a-a877-855bb8257f3d","year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.273044Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:86bd1cef65d32becbf314cdcaaa22e84d1564856b01d2b42e5e8d642c0b4575f","observation_id":"71b8116e-2fb6-44ad-bc13-402a9bbaa1d2","resolution":{"observed_at":"2026-08-16T05:07:05.729786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:07:05.708183Z","title":"yellow surface with brown spots","venue":null,"work_id":"537fc726-0344-4e76-bfea-84196e2c138a","year":null},"citing_paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:07:05.277615Z"},"links":{"citing_paper":"/paper/2504.21530"},"observation_digest":"sha256:1ab0df0f5f05f9005ab5099fb24fced9a2ea33e3fd5f8fdf8c005f7a27485664","observation_id":"a133c291-10b0-4dfa-b7c8-e906210a3e78","resolution":{"observed_at":"2026-08-16T05:07:05.714651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.21530","last_updated":"2025-04-30T11:26:40Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T17:25:54.985349Z","submitted_at":"2025-04-30T11:26:40Z","title":"RoboGround: Robotic Manipulation with Grounded Vision-Language Priors"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2504.21530."}