{"as_of":"2026-08-10T07:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dbcf063ea99668eed57a24a59758c090d2b7c60b2b7581dfb269fa618d05cc76","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:47:34.807801Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":24,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T08:57:22.299028Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2307.05973"},"observation_digest":"sha256:02977a5363537fcee46113a76923164bfa29327bd84a663f132f12057e27a91f","observation_id":"6e6e8e92-5167-437a-8f8e-3ba29a7018f1","resolution":{"observed_at":"2026-05-13T08:57:22.570726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-11T17:23:24.255829Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2310.08864"},"observation_digest":"sha256:fa4fb39ff72c0c95bd7f1c3f85959823739170664fbf640a18337a63a350df7f","observation_id":"ab904600-e585-4a6e-9663-7038b8ae26e5","resolution":{"observed_at":"2026-05-11T17:23:24.351434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T05:54:58.940428Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2310.10639"},"observation_digest":"sha256:30e55195ef5e44a2146273f11eef56d2e2cef2904852f52f14ecebaaad66bb9e","observation_id":"9e46c221-234c-4ae0-acd1-72c5d6fb3d78","resolution":{"observed_at":"2026-05-16T05:54:59.132287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:49d92e6e9c3a85ed9224a08c5697151e736d3ab8399170e8ea8a57c053409caf","observation_id":"9435dbc9-57ce-45f9-9a79-2a792a253746","resolution":{"observed_at":"2026-05-24T01:25:54.465586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:33c4edf3cd30575c3a90d0c1daf7d15496e6bfaf6528ec42bb1eace294ce04e5","observation_id":"b8513001-5337-4b36-9899-284f6eaff38c","resolution":{"observed_at":"2026-05-10T14:46:36.281682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-15T18:27:22.760982Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2412.10345"},"observation_digest":"sha256:6ccf736030d62df25d02a6ea9d86ebc541195d9a3eeba578bbe9b7104c30d809","observation_id":"94e238f7-627f-4b2d-884d-609a3aaea92d","resolution":{"observed_at":"2026-05-15T18:27:22.835880Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:d9c273bbad671caf53c667f9cc2bc912197425606d9a0ddf2646ae35cd544688","observation_id":"ca32e68d-fc72-41e1-957f-8f24fc0e225e","resolution":{"observed_at":"2026-05-15T22:53:37.275383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:f61436f9c43927be77d75611747468d226e19d7dd3b7a0e14a4d4d90a8701b91","observation_id":"c1c0d234-863a-4774-98df-cc50b82325de","resolution":{"observed_at":"2026-05-11T04:35:32.851181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:206e08aa220b8585515dc87112460cbf48f24238a8a22e5dcfb57ec05c833c77","observation_id":"8a97b39f-b308-47ce-a50e-cf8997c5a9b2","resolution":{"observed_at":"2026-05-22T18:05:00.899383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:4bfd1b8075ff55e68aa6bc1027db872160356bd88f3a0c1ce94c1cde648f0ad0","observation_id":"3f51432a-c1c2-4e04-9d52-b14534762b3a","resolution":{"observed_at":"2026-05-17T20:55:52.251612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T14:47:34.807801Z","title":"Open-world object manipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17673","last_updated":"2025-05-23T09:38:55Z","snapshot_observed_at":"2026-08-10T03:59:50.427391Z","submitted_at":"2025-05-23T09:38:55Z","title":"Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolution","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:34.807801Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2505.17673"},"observation_digest":"sha256:5ff455dcaced3f146135db8a2ba6499551202a2812a5f5f7f377769423d64be4","observation_id":"d4f4ba6d-b274-456f-aa46-4dabfa91c6d3","resolution":{"observed_at":"2026-08-07T14:47:34.807801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T12:16:14.782958Z","title":"Open-world object manipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.782958Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b94082077c8944c37b878653b577f6fb3834faed6e392dde55772a56a3ca10ce","observation_id":"e6059b5a-5b2a-4cda-8596-327f9ed638db","resolution":{"observed_at":"2026-08-07T12:16:14.782958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T10:50:51.025191Z","title":"Open-world object manipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04484","last_updated":"2025-07-16T20:26:15Z","snapshot_observed_at":"2026-08-07T10:38:35.558486Z","submitted_at":"2025-06-04T22:03:57Z","title":"Online Adaptation of Terrain-Aware Dynamics for Planning in Unstructured Environments","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:51.025191Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2506.04484"},"observation_digest":"sha256:96e7a37a2676cd3762c2e01b6e7f49198cff7addb089d807d719f596450e65d3","observation_id":"09c8304c-6549-4f81-968c-8a364ea7238a","resolution":{"observed_at":"2026-08-07T10:50:51.025191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T04:49:28.691014Z","title":"Open-world object manipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09557","last_updated":"2025-06-11T09:41:46Z","snapshot_observed_at":"2026-08-09T00:11:49.117375Z","submitted_at":"2025-06-11T09:41:46Z","title":"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:28.691014Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2506.09557"},"observation_digest":"sha256:85862eac674543d6b2b4834890a4313586f739e7074ed094b0e07c1ef016070b","observation_id":"b027233a-d907-4edb-8e0f-25c3e11a2d26","resolution":{"observed_at":"2026-08-07T04:49:28.691014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T04:17:11.391124Z","title":"Open-world ob- ject manipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10966","last_updated":"2025-06-12T17:59:04Z","snapshot_observed_at":"2026-08-07T13:44:57.666142Z","submitted_at":"2025-06-12T17:59:04Z","title":"GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:11.391124Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2506.10966"},"observation_digest":"sha256:c1c9f035d0837bcca678fb5114ea43cc4a89fff839231694cacd0f6eee2cc0c7","observation_id":"d66f160d-33b8-4cbe-ac89-b41817523580","resolution":{"observed_at":"2026-08-07T04:17:11.391124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T00:23:01.797762Z","title":"Open- world object manipulation using pre-trained vision- language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14507","last_updated":"2025-06-17T13:31:05Z","snapshot_observed_at":"2026-08-09T03:57:16.083004Z","submitted_at":"2025-06-17T13:31:05Z","title":"Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:01.797762Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2506.14507"},"observation_digest":"sha256:9a4b19efd0655d1211cbeb2475a3f7b33cad7554e91cbb9dd7b112d1f2ca27ad","observation_id":"775a35c4-692f-4f85-976b-691f70366aa1","resolution":{"observed_at":"2026-08-07T00:23:01.797762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-06T21:09:04.932385Z","title":"Open-world object manipulation using pre-trained vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00917","last_updated":"2025-09-03T01:44:58Z","snapshot_observed_at":"2026-08-06T21:00:05.983801Z","submitted_at":"2025-07-01T16:23:00Z","title":"A Survey: Learning Embodied Intelligence from Physical Simulators and World Models","version":3},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-08-06T21:09:04.932385Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2507.00917"},"observation_digest":"sha256:fb952188c91ddcd095aee1fe392e84c3ae1afd221892e1f1e827094145c718a1","observation_id":"269b8b36-d51e-41e6-a5e5-4ec9ffa785ae","resolution":{"observed_at":"2026-08-06T21:09:04.932385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-06T19:51:09.416270Z","title":"Open-world object manipulation using pre-trained vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04524","last_updated":"2025-07-06T20:27:11Z","snapshot_observed_at":"2026-08-07T12:49:49.719720Z","submitted_at":"2025-07-06T20:27:11Z","title":"VLM-TDP: VLM-guided Trajectory-conditioned Diffusion Policy for Robust Long-Horizon Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:09.416270Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2507.04524"},"observation_digest":"sha256:0fc3ab3486fa7b76efd13cb6a488cdcc73026ccb89af48cdcefdc459cd0b3e65","observation_id":"f4fba82f-c035-4cf4-8bbb-c75da4c5110b","resolution":{"observed_at":"2026-08-06T19:51:09.416270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-06T17:43:53.247504Z","title":"Open-world object manipulation using pre-trained vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10087","last_updated":"2025-07-14T09:13:07Z","snapshot_observed_at":"2026-08-09T16:03:14.420559Z","submitted_at":"2025-07-14T09:13:07Z","title":"Foundation Model Driven Robotics: A Comprehensive Review","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T17:43:53.247504Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2507.10087"},"observation_digest":"sha256:836c53bb37cf9d1ebd0d4ddb71f42c508b637f2ddc5e031f4972a73072280255","observation_id":"39cc3fd0-199a-4889-8db1-d86491b93ee3","resolution":{"observed_at":"2026-08-06T17:43:53.247504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-06T14:54:08.590931Z","title":"Open-world object manipulation us- ing pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17379","last_updated":"2025-07-23T10:23:15Z","snapshot_observed_at":"2026-08-08T15:02:00.249367Z","submitted_at":"2025-07-23T10:23:15Z","title":"Language-Conditioned Open-Vocabulary Mobile Manipulation with Pretrained Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:08.590931Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2507.17379"},"observation_digest":"sha256:29df15e2da3f3d4fe8ae7d65dcdfdb35c65a97f5c0d025a20e77c722ce85318f","observation_id":"4fa67f4f-e27e-4362-b65d-396862d5500c","resolution":{"observed_at":"2026-08-06T14:54:08.590931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T22:51:57.719892Z","title":"Open-world object manipulation using pre-trained vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06257","last_updated":"2025-08-08T12:22:36Z","snapshot_observed_at":"2026-08-08T22:12:49.743145Z","submitted_at":"2025-08-08T12:22:36Z","title":"Multi-Omics Analysis for Cancer Subtype Inference via Unrolling Graph Smoothness Priors","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T22:51:57.719892Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2508.06257"},"observation_digest":"sha256:a6311f40e6e0f0f97b32de1569e78c3c078820d36908852a4222391392f02e41","observation_id":"f27ff8c3-ca20-4a21-aa1e-46a9ded69031","resolution":{"observed_at":"2026-08-05T22:51:57.719892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2511.15279","last_updated":"2026-04-03T06:36:12Z","snapshot_observed_at":"2026-07-06T22:36:24.466921Z","submitted_at":"2025-11-19T09:42:08Z","title":"Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T21:03:28.341042Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2511.15279"},"observation_digest":"sha256:7e33c8a8d2d6a8692c69a8f1ad4f4ceb74acc2758ef1e6120600d8cef5bc8e92","observation_id":"56f02102-3db8-4d18-9986-01ad136caf58","resolution":{"observed_at":"2026-05-17T21:05:15.672460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-02T21:43:09.897136Z","title":"Open-world object manipulation us- ing pre-trained vision-language models.arXiv preprint arXiv:2303.00905,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19313","last_updated":"2026-07-22T22:14:13Z","snapshot_observed_at":"2026-08-02T21:43:05.758047Z","submitted_at":"2026-02-22T19:25:48Z","title":"TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T21:43:09.897136Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2602.19313"},"observation_digest":"sha256:dd90faad854cb8537948c639225b5e9882e5c09f3a9352a5aed0bf0c1b7d06b5","observation_id":"ed491bfc-b2bb-4772-9e84-699379fa0973","resolution":{"observed_at":"2026-08-02T21:43:09.897136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-02T18:13:10.246106Z","title":"arXiv preprint arXiv:2303.00905 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-07T00:53:09.787457Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.246106Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:96142dfea4dd21efd5bd1500dfe62352165803dc325ccc259c95de46689a3424","observation_id":"c80735aa-51fb-49ea-b4f0-a69e76cfb67e","resolution":{"observed_at":"2026-08-02T18:13:10.246106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T11:42:34.409651Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2604.15483"},"observation_digest":"sha256:cf2b99b7680e5241feb886681ffd950372dff0db7c3b7b52ad5b4f4e809edb00","observation_id":"35314711-93ca-455e-b754-e5bb313e6b82","resolution":{"observed_at":"2026-05-10T11:45:21.565939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2605.00438","last_updated":"2026-05-01T06:15:43Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:15:43Z","title":"Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T19:51:05.220627Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2605.00438"},"observation_digest":"sha256:b5e72f61b6326cd0fb322e98e01723ff3d408cb4a24fd09653a0dba3e329ce77","observation_id":"74c964fd-9da7-453c-99a8-06e4da12d3dd","resolution":{"observed_at":"2026-05-11T15:31:07.233360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2605.11114","last_updated":"2026-05-11T18:23:04Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:23:04Z","title":"SEVO: Semantic-Enhanced Virtual Observation for Robust VLA Manipulation via Active Illumination and Data-Centric Collection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T02:50:35.117038Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2605.11114"},"observation_digest":"sha256:a131df9c75db4d5c8bfd5171a743edc97f2a1a98ed180f7e7530e8e8e150fe4f","observation_id":"9294b453-f12e-4635-a6e4-bc7a40285662","resolution":{"observed_at":"2026-05-13T02:52:08.744611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2605.12655","last_updated":"2026-06-10T15:03:44Z","snapshot_observed_at":"2026-08-08T21:43:49.970250Z","submitted_at":"2026-05-12T19:01:16Z","title":"Robust Instruction Compliance in Cooperative Multi-Agent Reinforcement Learning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:35.277901Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2605.12655"},"observation_digest":"sha256:c3bdef4ecfc7c795e4ba0e45fa6229f85ab4d7b32dace9ba06b25d8166c3cd42","observation_id":"3c615202-ee07-43c2-bd21-08cd1dc63ac1","resolution":{"observed_at":"2026-06-30T22:15:05.889350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:67cc471e1a0c4404782e1e9fd571db41ecaa33a8eace1a36cabe44cb0d7dc3f9","observation_id":"9be766c6-d92c-41cf-a173-1d58118890eb","resolution":{"observed_at":"2026-05-20T12:43:17.300839Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2606.12910","last_updated":"2026-06-11T05:09:34Z","snapshot_observed_at":"2026-08-07T00:25:57.251102Z","submitted_at":"2026-06-11T05:09:34Z","title":"Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T06:46:45.209053Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2606.12910"},"observation_digest":"sha256:1bcd9f2116fe861b37763743709c73563bc1fd99d580cc52313f85faf3b17cdf","observation_id":"3da45ba8-22cc-43d9-b07f-ef683d0fb025","resolution":{"observed_at":"2026-07-03T14:58:33.491536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2606.25585","last_updated":"2026-06-24T08:56:48Z","snapshot_observed_at":"2026-08-04T14:09:28.537223Z","submitted_at":"2026-06-24T08:56:48Z","title":"FeVOS: Foresight Expression Video Object Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-25T21:13:21.500674Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2606.25585"},"observation_digest":"sha256:42aa17a228b83d1bc1ca2c62afde19fba66b5cb8a485f67df823579513c7ab84","observation_id":"2740f7c6-48d1-4492-b47b-64ec4d8d0694","resolution":{"observed_at":"2026-07-04T19:30:08.043849Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2606.26588","last_updated":"2026-06-25T04:20:08Z","snapshot_observed_at":"2026-08-07T09:51:22.326073Z","submitted_at":"2026-06-25T04:20:08Z","title":"Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T05:32:52.472573Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2606.26588"},"observation_digest":"sha256:20cbff2246cc0936f2912e679ee55e2d137e1562eb0995e972ba04a370761eee","observation_id":"b1813dd7-829b-4727-bde7-d7c5c2cd8a35","resolution":{"observed_at":"2026-07-04T13:09:50.140694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-02T02:25:55.766741Z","title":"Open- world object manipulation using pre-trained vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14341","last_updated":"2026-07-15T20:10:09Z","snapshot_observed_at":"2026-08-09T18:47:24.103791Z","submitted_at":"2026-07-15T20:10:09Z","title":"Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T02:25:55.766741Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2607.14341"},"observation_digest":"sha256:9373e408d56d5452366f1feea222aeb0effc27158bfe828d86579adec71b9cf1","observation_id":"7382167f-f5a6-4da5-91ab-de49c429aa6d","resolution":{"observed_at":"2026-08-02T02:25:55.766741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-01T14:39:52.346741Z","title":"arXiv preprint arXiv:2303.00905 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-08T18:57:26.098275Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":211,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:52.346741Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:4017972ae5c256f58e97bf41ec85beb6f4b473c5b9c5d656355558876c02bfd5","observation_id":"6ca2a3f3-8f35-440b-9e23-158707323d9f","resolution":{"observed_at":"2026-08-01T14:39:52.346741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-04T06:10:34.688795Z","title":"Open-world object manipulation using pre-trained vision- language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02497","last_updated":"2026-08-03T17:02:04Z","snapshot_observed_at":"2026-08-10T03:03:42.557157Z","submitted_at":"2026-08-03T17:02:04Z","title":"Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T06:10:34.688795Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2608.02497"},"observation_digest":"sha256:b4f2a0b17c67c89a9e488eb5933958005643843cce8f4154996687c9b299dba1","observation_id":"64c74535-d0a0-461b-8f49-1c20b198fbf9","resolution":{"observed_at":"2026-08-04T06:10:34.688795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.00905/citation-record","integrity":"/paper/2303.00905/integrity","json":"/paper/2303.00905/citation-record.json","paper":"/paper/2303.00905"},"outbound":[],"paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2303.00905."}