Pith. sign in

Paper Citation Record · LEDGER

Open-World Object Manipulation using Pre-trained Vision-Language Models

As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2303.00905.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2303.00905 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 35 of 35 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 35 of 35 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:47:34.807801Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

24
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 6e6e8e92-5167-437a-8f8e-3ba29a7018f1 · inbound

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models cites this paper.

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-13T08:57:22.570726Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-13T08:57:22.299028Z digest=sha256:02977a5363537fcee46113a76923164bfa29327bd84a663f132f12057e27a91f

Observation ab904600-e585-4a6e-9663-7038b8ae26e5 · inbound

Open X-Embodiment: Robotic Learning Datasets and RT-X Models cites this paper.

Open X-Embodiment: Robotic Learning Datasets and RT-X Models Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 115

Resolution
verified exact
arxiv_id, observed 2026-05-11T17:23:24.351434Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-11T17:23:24.255829Z digest=sha256:fa4fb39ff72c0c95bd7f1c3f85959823739170664fbf640a18337a63a350df7f

Observation 9e46c221-234c-4ae0-acd1-72c5d6fb3d78 · inbound

Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models cites this paper.

Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 57

Resolution
verified exact
arxiv_id, observed 2026-05-16T05:54:59.132287Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-16T05:54:58.940428Z digest=sha256:30e55195ef5e44a2146273f11eef56d2e2cef2904852f52f14ecebaaad66bb9e

Observation 9435dbc9-57ce-45f9-9a79-2a792a253746 · inbound

A Survey on Vision-Language-Action Models for Embodied AI cites this paper.

A Survey on Vision-Language-Action Models for Embodied AI Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 98

Resolution
verified exact
arxiv_id, observed 2026-05-24T01:25:54.465586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-24T01:25:10.150459Z digest=sha256:49d92e6e9c3a85ed9224a08c5697151e736d3ab8399170e8ea8a57c053409caf

Observation b8513001-5337-4b36-9899-284f6eaff38c · inbound

OpenVLA: An Open-Source Vision-Language-Action Model cites this paper.

OpenVLA: An Open-Source Vision-Language-Action Model Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-10T14:46:36.281682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T14:46:35.942338Z digest=sha256:33c4edf3cd30575c3a90d0c1daf7d15496e6bfaf6528ec42bb1eace294ce04e5

Observation 94e238f7-627f-4b2d-884d-609a3aaea92d · inbound

TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies cites this paper.

TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 16

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T18:27:22.835880Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-15T18:27:22.760982Z digest=sha256:6ccf736030d62df25d02a6ea9d86ebc541195d9a3eeba578bbe9b7104c30d809

Observation ca32e68d-fc72-41e1-957f-8f24fc0e225e · inbound

Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models cites this paper.

Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-15T22:53:37.275383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-15T22:53:37.120692Z digest=sha256:d9c273bbad671caf53c667f9cc2bc912197425606d9a0ddf2646ae35cd544688

Observation c1c0d234-863a-4774-98df-cc50b82325de · inbound

Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success cites this paper.

Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-11T04:35:32.851181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-11T04:35:31.914360Z digest=sha256:f61436f9c43927be77d75611747468d226e19d7dd3b7a0e14a4d4d90a8701b91

Observation 8a97b39f-b308-47ce-a50e-cf8997c5a9b2 · inbound

$\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization cites this paper.

$\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-05-22T18:05:00.899383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T18:02:23.305313Z digest=sha256:206e08aa220b8585515dc87112460cbf48f24238a8a22e5dcfb57ec05c833c77

Observation 3f51432a-c1c2-4e04-9d52-b14534762b3a · inbound

GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data cites this paper.

GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 60

Resolution
verified exact
arxiv_id, observed 2026-05-17T20:55:52.251612Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-17T20:55:52.109166Z digest=sha256:4bfd1b8075ff55e68aa6bc1027db872160356bd88f3a0c1ce94c1cde648f0ad0

Observation d4f4ba6d-b274-456f-aa46-4dabfa91c6d3 · inbound

Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolution cites this paper.

Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolution Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:47:34.807801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:47:34.807801Z digest=sha256:5ff455dcaced3f146135db8a2ba6499551202a2812a5f5f7f377769423d64be4

Observation e6059b5a-5b2a-4cda-8596-327f9ed638db · inbound

Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces cites this paper.

Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-07T12:16:14.782958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:16:14.782958Z digest=sha256:b94082077c8944c37b878653b577f6fb3834faed6e392dde55772a56a3ca10ce

Observation 09c8304c-6549-4f81-968c-8a364ea7238a · inbound

Online Adaptation of Terrain-Aware Dynamics for Planning in Unstructured Environments cites this paper.

Online Adaptation of Terrain-Aware Dynamics for Planning in Unstructured Environments Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T10:50:51.025191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:50:51.025191Z digest=sha256:96e7a37a2676cd3762c2e01b6e7f49198cff7addb089d807d719f596450e65d3

Observation b027233a-d907-4edb-8e0f-25c3e11a2d26 · inbound

AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions cites this paper.

AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T04:49:28.691014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:49:28.691014Z digest=sha256:85862eac674543d6b2b4834890a4313586f739e7074ed094b0e07c1ef016070b

Observation d66f160d-33b8-4cbe-ac89-b41817523580 · inbound

GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation cites this paper.

GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T04:17:11.391124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:17:11.391124Z digest=sha256:c1c9f035d0837bcca678fb5114ea43cc4a89fff839231694cacd0f6eee2cc0c7

Observation 775a35c4-692f-4f85-976b-691f70366aa1 · inbound

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? cites this paper.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.797762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.797762Z digest=sha256:9a4b19efd0655d1211cbeb2475a3f7b33cad7554e91cbb9dd7b112d1f2ca27ad

Observation 269b8b36-d51e-41e6-a5e5-4ec9ffa785ae · inbound

A Survey: Learning Embodied Intelligence from Physical Simulators and World Models cites this paper.

A Survey: Learning Embodied Intelligence from Physical Simulators and World Models Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 165

Resolution
unresolved
no resolver link, observed 2026-08-06T21:09:04.932385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:09:04.932385Z digest=sha256:fb952188c91ddcd095aee1fe392e84c3ae1afd221892e1f1e827094145c718a1

Observation f4fba82f-c035-4cf4-8bbb-c75da4c5110b · inbound

VLM-TDP: VLM-guided Trajectory-conditioned Diffusion Policy for Robust Long-Horizon Manipulation cites this paper.

VLM-TDP: VLM-guided Trajectory-conditioned Diffusion Policy for Robust Long-Horizon Manipulation Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T19:51:09.416270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:51:09.416270Z digest=sha256:0fc3ab3486fa7b76efd13cb6a488cdcc73026ccb89af48cdcefdc459cd0b3e65

Observation 39cc3fd0-199a-4889-8db1-d86491b93ee3 · inbound

Foundation Model Driven Robotics: A Comprehensive Review cites this paper.

Foundation Model Driven Robotics: A Comprehensive Review Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-06T17:43:53.247504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:43:53.247504Z digest=sha256:836c53bb37cf9d1ebd0d4ddb71f42c508b637f2ddc5e031f4972a73072280255

Observation 4fa67f4f-e27e-4362-b65d-396862d5500c · inbound

Language-Conditioned Open-Vocabulary Mobile Manipulation with Pretrained Models cites this paper.

Language-Conditioned Open-Vocabulary Mobile Manipulation with Pretrained Models Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T14:54:08.590931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:54:08.590931Z digest=sha256:29df15e2da3f3d4fe8ae7d65dcdfdb35c65a97f5c0d025a20e77c722ce85318f

Observation f27ff8c3-ca20-4a21-aa1e-46a9ded69031 · inbound

Multi-Omics Analysis for Cancer Subtype Inference via Unrolling Graph Smoothness Priors cites this paper.

Multi-Omics Analysis for Cancer Subtype Inference via Unrolling Graph Smoothness Priors Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T22:51:57.719892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:51:57.719892Z digest=sha256:a6311f40e6e0f0f97b32de1569e78c3c078820d36908852a4222391392f02e41

Observation 56f02102-3db8-4d18-9986-01ad136caf58 · inbound

Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception cites this paper.

Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-17T21:05:15.672460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-17T21:03:28.341042Z digest=sha256:7e33c8a8d2d6a8692c69a8f1ad4f4ceb74acc2758ef1e6120600d8cef5bc8e92

Observation ed491bfc-b2bb-4772-9e84-699379fa0973 · inbound

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics cites this paper.

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 2015

Resolution
unresolved
no resolver link, observed 2026-08-02T21:43:09.897136Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T21:43:09.897136Z digest=sha256:dd90faad854cb8537948c639225b5e9882e5c09f3a9352a5aed0bf0c1b7d06b5

Observation c80735aa-51fb-49ea-b4f0-a69e76cfb67e · inbound

Tactile Modality Fusion for Vision-Language-Action Models cites this paper.

Tactile Modality Fusion for Vision-Language-Action Models Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-02T18:13:10.246106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:13:10.246106Z digest=sha256:96142dfea4dd21efd5bd1500dfe62352165803dc325ccc259c95de46689a3424

Observation 35314711-93ca-455e-b754-e5bb313e6b82 · inbound

${\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities cites this paper.

${\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 76

Resolution
verified exact
arxiv_id, observed 2026-05-10T11:45:21.565939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T11:42:34.409651Z digest=sha256:cf2b99b7680e5241feb886681ffd950372dff0db7c3b7b52ad5b4f4e809edb00

Observation 74c964fd-9da7-453c-99a8-06e4da12d3dd · inbound

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation cites this paper.

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-11T15:31:07.233360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-09T19:51:05.220627Z digest=sha256:b5e72f61b6326cd0fb322e98e01723ff3d408cb4a24fd09653a0dba3e329ce77

Observation 9294b453-f12e-4635-a6e4-bc7a40285662 · inbound

SEVO: Semantic-Enhanced Virtual Observation for Robust VLA Manipulation via Active Illumination and Data-Centric Collection cites this paper.

SEVO: Semantic-Enhanced Virtual Observation for Robust VLA Manipulation via Active Illumination and Data-Centric Collection Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-13T02:52:08.744611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-13T02:50:35.117038Z digest=sha256:a131df9c75db4d5c8bfd5171a743edc97f2a1a98ed180f7e7530e8e8e150fe4f

Observation 3c615202-ee07-43c2-bd21-08cd1dc63ac1 · inbound

Robust Instruction Compliance in Cooperative Multi-Agent Reinforcement Learning cites this paper.

Robust Instruction Compliance in Cooperative Multi-Agent Reinforcement Learning Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-06-30T22:15:05.889350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-30T22:11:35.277901Z digest=sha256:c3bdef4ecfc7c795e4ba0e45fa6229f85ab4d7b32dace9ba06b25d8166c3cd42

Observation 9be766c6-d92c-41cf-a173-1d58118890eb · inbound

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization cites this paper.

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 49

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T12:43:17.300839Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-20T12:39:50.004269Z digest=sha256:67cc471e1a0c4404782e1e9fd571db41ecaa33a8eace1a36cabe44cb0d7dc3f9

Observation 3da45ba8-22cc-43d9-b07f-ef683d0fb025 · inbound

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning cites this paper.

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-07-03T14:58:33.491536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-27T06:46:45.209053Z digest=sha256:1bcd9f2116fe861b37763743709c73563bc1fd99d580cc52313f85faf3b17cdf

Observation 2740f7c6-48d1-4492-b47b-64ec4d8d0694 · inbound

FeVOS: Foresight Expression Video Object Segmentation cites this paper.

FeVOS: Foresight Expression Video Object Segmentation Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 34

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T19:30:08.043849Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-25T21:13:21.500674Z digest=sha256:42aa17a228b83d1bc1ca2c62afde19fba66b5cb8a485f67df823579513c7ab84

Observation b1813dd7-829b-4727-bde7-d7c5c2cd8a35 · inbound

Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure cites this paper.

Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-07-04T13:09:50.140694Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-26T05:32:52.472573Z digest=sha256:20cbff2246cc0936f2912e679ee55e2d137e1562eb0995e972ba04a370761eee

Observation 7382167f-f5a6-4da5-91ab-de49c429aa6d · inbound

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution cites this paper.

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T02:25:55.766741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:25:55.766741Z digest=sha256:9373e408d56d5452366f1feea222aeb0effc27158bfe828d86579adec71b9cf1

Observation 6ca2a3f3-8f35-440b-9e23-158707323d9f · inbound

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation cites this paper.

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 211

Resolution
unresolved
no resolver link, observed 2026-08-01T14:39:52.346741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T14:39:52.346741Z digest=sha256:4017972ae5c256f58e97bf41ec85beb6f4b473c5b9c5d656355558876c02bfd5

Observation 64c74535-d0a0-461b-8f49-1c20b198fbf9 · inbound

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models cites this paper.

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T06:10:34.688795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T06:10:34.688795Z digest=sha256:b4f2a0b17c67c89a9e488eb5933958005643843cce8f4154996687c9b299dba1