Pith. sign in

Paper Citation Record · LEDGER

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation

As of 17 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 3 inbound Pith citation observations for arXiv:2505.02166.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.02166 v1

Coverage vector

measured 64 of 64 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T01:07:35.526355Z

measured 67 of 67 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T21:30:14.233767Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-22T05:31:07.993966Z

Reference resolution

64 of 64 outbound references displayed

  • verified exact0
  • verified fuzzy20
  • unresolved44
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 149a569b-af01-4ed9-844e-39c17f3230d7 · outbound

This paper cites GPT-4 Technical Report.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.126630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.126630Z digest=sha256:743d4f72b82b9f952f0872a0798cdf23aaf9ac9b308f8701a284b358f8f50724

Observation cafd527c-69ef-48a8-abd2-88bd6f46f709 · outbound

This paper cites Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.131633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.131633Z digest=sha256:761ec0170798efae0f096f76d2381da81c49c83c567a8f5e26c41ab5dc9cff7b

Observation 7188436a-2f6d-48b0-a1a2-4d280e77feb9 · outbound

This paper cites Rgbmanip: Monocular image-based robotic ma- nipulation through active object pose estimation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Rgbmanip: Monocular image-based robotic ma- nipulation through active object pose estimation

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.488881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.136133Z digest=sha256:e00d4c82793fc0e57165ae7406ea79a6b6512d2c7776fb2aabded4d3a0d645a7

Observation 4e711a6a-0e03-4dc9-843f-3ea5df4da4f8 · outbound

This paper cites Affordances from human videos as a versatile representation for robotics.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Affordances from human videos as a versatile representation for robotics

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.469049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.141145Z digest=sha256:1bc6a2fdb9a7075729c7f63d470b32fb8826c22db3fe568e41c10713d4061818

Observation fc9eb02c-b355-4af0-b1bf-65c2f83c7758 · outbound

This paper cites RT-H: Action Hierarchies Using Language.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation RT-H: Action Hierarchies Using Language

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.145605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.145605Z digest=sha256:52e17577f043bc66eddb3ae08084cbc955a175698cf910116efc13b296923067

Observation fb27b0b9-b5f2-413e-8a87-a169fa01260e · outbound

This paper cites Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.150528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.150528Z digest=sha256:af804a8266a37a64196ee504b071bd4e5c7a58adc3f7ef1a1d1cc96d0d603e5d

Observation 9d2d146d-9c51-430f-96de-23a1a7c99e8c · outbound

This paper cites RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.155195Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.155195Z digest=sha256:9810c469b49b31d579f4cebd283a5717cad6c1c5bb1d79f8f47c56ad083cb5e9

Observation 2910a782-760d-4c34-8932-5c32285f7682 · outbound

This paper cites RT-1: Robotics Transformer for Real-World Control at Scale.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation RT-1: Robotics Transformer for Real-World Control at Scale

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.160529Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.160529Z digest=sha256:b5ac5bf3761d9a937020bd13b4cf1020dbebb7d452c2a8e0cfdc5d7fe66daddf

Observation dbf9e7bf-de14-4dc5-bad1-eaa521c79943 · outbound

This paper cites RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.164782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.164782Z digest=sha256:176731db40d1235f9f0218f9316314a9215f9a0bcae16788d1762316ccb1a7fb

Observation 21d186c3-6e44-4105-bce6-7b73dfac9a7f · outbound

This paper cites Learn- ing video-conditioned policies for unseen manipulation tasks.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Learn- ing video-conditioned policies for unseen manipulation tasks

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.454661Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.168925Z digest=sha256:4e9ea5805225f0c674aaf61117a18c342954660dd360e8f76f27c375969b1bee

Observation c1ed4c0e-aa83-4a38-bd77-c34491eab921 · outbound

This paper cites Diffusion Policy: Visuomotor Policy Learning via Action Diffusion.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Diffusion Policy: Visuomotor Policy Learning via Action Diffusion

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.173309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.173309Z digest=sha256:143886d47f573808c8617ddf7c551ea7f8e834538df99fc0bdf72e8b439388e9

Observation 5963346b-1692-42c3-9918-3483dea17c5e · outbound

This paper cites Safe RLHF: Safe Reinforcement Learning from Human Feedback.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Safe RLHF: Safe Reinforcement Learning from Human Feedback

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.177187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.177187Z digest=sha256:e58fa5b92204db610165418846382e0428ff967e4870c39e76c1b9c45fdf7d3a

Observation d43521d7-4bb5-42e0-bb24-888acee1989d · outbound

This paper cites Video Language Planning.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Video Language Planning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.181199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.181199Z digest=sha256:375537a866eec5560751c69ffa9516dfd28aec005415601cf33378dc4c7b2e6d

Observation 7046bf35-aa0f-4ab3-9900-9807969bfc0e · outbound

This paper cites Learn- ing universal policies via text-guided video generation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Learn- ing universal policies via text-guided video generation

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.440876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.185082Z digest=sha256:deb89849b9f294715862efc940d35e4901dd0030e4b96b91740bba4d28cdebe2

Observation 75a1ed49-57b0-4b27-9547-4be82fda2325 · outbound

This paper cites FlowBot3D: Learning 3D Articulation Flow to Manipulate Articulated Objects.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation FlowBot3D: Learning 3D Articulation Flow to Manipulate Articulated Objects

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.190252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.190252Z digest=sha256:1dbe1c222168471d05cc94ae7035fd1cceaf6ebcef67f5641ede4e59d758b008

Observation e8381c6f-c703-4490-a06c-efcf8c2e8356 · outbound

This paper cites Anygrasp: Robust and efficient grasp perception in spatial and temporal domains.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Anygrasp: Robust and efficient grasp perception in spatial and temporal domains

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.426710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.195084Z digest=sha256:e76f6d51517fe391a50794a0002746de32bfad198d91e2f6877f6bade1c1ecdf

Observation 1b291b9d-6d36-4b4d-90ec-25c74d304061 · outbound

This paper cites The loss of orthogonality in the gram-schmidt orthogonalization process.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation The loss of orthogonality in the gram-schmidt orthogonalization process

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.411000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.199432Z digest=sha256:e4793059ecfb464358b16a378cbaf28019c1c1250f7b566276254a05104f7aaa

Observation 419d24ee-a5c2-49e0-b696-e9e7aafc89e2 · outbound

This paper cites Rvt: Robotic view transformer for 3d object manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Rvt: Robotic view transformer for 3d object manipulation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.203581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.203581Z digest=sha256:e4d73212fb78232e4af1b2e9575208514991dcc199f6a53e16c949670122cff7

Observation 40cdb43f-b7e8-42e4-b2e3-8c0d533e02e4 · outbound

This paper cites RVT-2: Learning Precise Manipulation from Few Demonstrations.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation RVT-2: Learning Precise Manipulation from Few Demonstrations

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.207771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.207771Z digest=sha256:e4d60778626fd0cbf13fe15fcb69ee6f92634e78be7971b903a4af0f181487e1

Observation 512f3712-147a-44da-ae93-130c623b0f62 · outbound

This paper cites RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.211653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.211653Z digest=sha256:7c6d2480340ac3e399b1488ff5028e1cb1d946651a447eea5460c13864d6262e

Observation 1d880a73-4860-453a-bccd-c258cc4363cd · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation LoRA: Low-Rank Adaptation of Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.216288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.216288Z digest=sha256:ca1692c0ff4063f5e7ffeeeb36f893724ce0c079d1ed99d977713dc494313e9b

Observation 53e8052e-3c34-483b-98ee-7ebdac955436 · outbound

This paper cites A3VLM: Actionable Articulation-Aware Vision Language Model.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation A3VLM: Actionable Articulation-Aware Vision Language Model

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.219922Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.219922Z digest=sha256:7e2b193c60c242087490d26a3eb784e5681b911c8366bb181302ac8f649fbc3a

Observation 3387ef3f-3795-44cc-a9ec-c32c97398095 · outbound

This paper cites ManipVQA: Injecting Robotic Affordance and Physically Grounded Information into Multi-Modal Large Language Models.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation ManipVQA: Injecting Robotic Affordance and Physically Grounded Information into Multi-Modal Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.225603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.225603Z digest=sha256:b7262e88e8c721159309d5341c49236d9d958d6f80d9c56e9861b529117124ff

Observation be39af2d-7905-4cef-bc5b-b1cc929f7b50 · outbound

This paper cites VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.229698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.229698Z digest=sha256:72fbe465051b8a0cbb234c818b60b9135232b82b262678596627ce6c16dfd6ac

Observation 20795b50-5080-4a3b-ae88-dd5b569e706a · outbound

This paper cites Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.233645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.233645Z digest=sha256:b69cdd499eccf373a5d1ab9999f4b7ba5c9c6c47d88c72e330f5cf194980ccc8

Observation ee134403-6dd6-4678-8e72-7e84d6e4391b · outbound

This paper cites VIMA: General Robot Manipulation with Multimodal Prompts.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation VIMA: General Robot Manipulation with Multimodal Prompts

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.238423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.238423Z digest=sha256:27406a21fb3785ccec79b01b9e06e1682816bca6e04a894c608f9393cbb408ef

Observation 3c68e8c8-eab8-4d7d-bb35-09bb7b6a6d09 · outbound

This paper cites Coarse-to-fine imitation learning: Robot ma- nipulation from a single demonstration.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Coarse-to-fine imitation learning: Robot ma- nipulation from a single demonstration

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.387026Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.243113Z digest=sha256:98cbc48c3c7bf84914ec57cf535c54fa3760736e2bb1374b29436e0d7b7be09f

Observation b215e8a4-1ea4-4a15-832f-bcb32abc63d1 · outbound

This paper cites Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot Manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot Manipulation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.248077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.248077Z digest=sha256:89b7098033e5b3364f2c3b7e69ee38e67c0c3f4aee62d656ae7294d516843e02

Observation 9a9ea00a-9d81-47a7-b9e0-a965452a455c · outbound

This paper cites 3D Diffuser Actor: Policy Diffusion with 3D Scene Representations.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation 3D Diffuser Actor: Policy Diffusion with 3D Scene Representations

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.253811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.253811Z digest=sha256:b132b79f70f1dc369e42441cc5fba767ae5bd28c1c4d0e676aea6cb70b6bf2eb

Observation c099829a-3357-4b76-b693-18df7cf92dea · outbound

This paper cites OpenVLA: An Open-Source Vision-Language-Action Model.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation OpenVLA: An Open-Source Vision-Language-Action Model

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.258200Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.258200Z digest=sha256:59b19e2e161eae8b34d6371814112e653533b2f8f48120b8ab4ac421eb63afd1

Observation 3fac0265-74f2-453e-91cd-92bd669f6edc · outbound

This paper cites Vision-Language Foundation Models as Effective Robot Imitators.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Vision-Language Foundation Models as Effective Robot Imitators

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.262416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.262416Z digest=sha256:62243e52c917cad6cc3d5c34a69d048c7bdd62fc4cbe34acefb21417f4e172db

Observation 02a51f70-9b6d-4cf2-b30f-44d193f3a556 · outbound

This paper cites Manipllm: Embodied multimodal large language model for object-centric robotic manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Manipllm: Embodied multimodal large language model for object-centric robotic manipulation

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.372556Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.266395Z digest=sha256:23a328c17f633968042f3b3b3736f5b5d1bc2ada03289b3a9db8ae907ceb2bad

Observation 1566ca6a-f171-4557-b65b-5ab1b4f43d54 · outbound

This paper cites HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.270105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.270105Z digest=sha256:77e65cd3c47900d47a3ad2f35f398298808f8b7d5f534d31550e0e345da44d00

Observation c0e6d8e9-c1e0-4dd3-9c9f-855c7f6c18b9 · outbound

This paper cites Code as policies: Language model programs for embodied con- trol.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Code as policies: Language model programs for embodied con- trol

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.358137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.274392Z digest=sha256:44e0f152f36c2dfcfe5751f0533b7f9d3aefa3c0ca795672fb49aa1201fe5b12

Observation 89dbd810-b2e4-4125-9901-5c6ff8836cc2 · outbound

This paper cites MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.278351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.278351Z digest=sha256:d8f0fc9d336aa8e3c56fc73922d490b51b6365d08424d5ede7b1cc0a2fc2fcab

Observation 04562526-a3f1-4989-8afb-14fc296782a2 · outbound

This paper cites RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.282918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.282918Z digest=sha256:d0e38668009cf59f09df96535b92f0d0d285ada4e47f3ea1a6e6fe291aa05dd5

Observation b1ac530c-dc2f-4d19-a25d-62e7b95dc98d · outbound

This paper cites HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.287180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.287180Z digest=sha256:06be547f0b442ed23709295f8ec7afbac25452f11636d72d0378aaf1b590bdca

Observation 28aea292-1a0e-4957-b264-d8c07c2543f3 · outbound

This paper cites Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.292014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.292014Z digest=sha256:7ac10d3a36c89dd62d6c4fcb52c0bf95d3214e9e56adb7be21870848b0b5a21b

Observation c4b565ab-2eb7-4eeb-994c-d35f458e15e2 · outbound

This paper cites SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.295577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.295577Z digest=sha256:c8310e84c63ae8bbfada96e36503133c239411a5e9edc4cf3d1a00dc78d06e0f

Observation 5b47ae7f-9ee8-49d6-8989-9f2a321aa454 · outbound

This paper cites Language Conditioned Imitation Learning over Unstructured Data.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Language Conditioned Imitation Learning over Unstructured Data

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.299878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.299878Z digest=sha256:3bb7563587048b79e835cb952eb48b569c982b0bbe8b227955d78d3bdbaca170

Observation 8641a92a-320e-4975-8dfb-ee076663109b · outbound

This paper cites Learning latent plans from play.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Learning latent plans from play

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.344518Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.303994Z digest=sha256:f2f046a541b3bc7add661979af447e8fe57e753c8c5d3168b02abb75a1c51d16

Observation 7c742dca-8b69-49e1-85d8-2d96bef0fb71 · outbound

This paper cites Where2act: From pixels to actions for articulated 3d objects.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Where2act: From pixels to actions for articulated 3d objects

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.329710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.309024Z digest=sha256:2993181813a16dd96e810d1ee681edcb9779ecb4078df6665bb968c21eb12f08

Observation a0d1f628-694a-4a2c-8e1d-07c7070e18e3 · outbound

This paper cites Learning language-conditioned robot behavior from offline data and crowd-sourced annotation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Learning language-conditioned robot behavior from offline data and crowd-sourced annotation

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.313634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.313893Z digest=sha256:f3e192aca81494e7f955780dc191bb70f9cd32592281efd31741c540da0f9e09

Observation 5d6588cb-0c37-4de2-ab3c-f02932a10a9e · outbound

This paper cites PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.318012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.318012Z digest=sha256:0ae6bf8fe5e29cf93c34326d6503e516c7e42e7431d9442d920edba1e3a6c0e0

Observation da29a8c2-eb90-4a24-93b1-aae4176697aa · outbound

This paper cites Review of deep reinforcement learning for robot manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Review of deep reinforcement learning for robot manipulation

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.299626Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.323198Z digest=sha256:af9d41b0249996f8c2d49511cb73ec5b7f233276986c8b0d02b1cf670cbf36ab

Observation 9ac2ea7d-d20a-4513-9dee-b5589bc27a84 · outbound

This paper cites Learning transferable visual models from natural language supervi- sion.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Learning transferable visual models from natural language supervi- sion

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.327247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.327247Z digest=sha256:d51e991d05fbdb9f86cd7c74529931741a58aa1638d7509a8ebfe08f9502e2b3

Observation 8209f9a8-1c32-475c-af83-a8cab96937e1 · outbound

This paper cites Cliport: What and where pathways for robotic manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Cliport: What and where pathways for robotic manipulation

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.331567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.331567Z digest=sha256:cce4b0e5467364a33ed66a943f08218f7decc09326d05252e99aeabb6b6471ce

Observation e353d407-2c3a-49ad-9822-b9dc662ca94f · outbound

This paper cites Perceiver- actor: A multi-task transformer for robotic manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Perceiver- actor: A multi-task transformer for robotic manipulation

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.267077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.335637Z digest=sha256:85e3263f665d36d42487e78cebd5024d72d7d1aa9b1405bfd37911566224130b

Observation 6a47ccc6-5063-4120-82c2-592f9f672f0e · outbound

This paper cites Open-World Object Manipulation using Pre-trained Vision-Language Models.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.339501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.339501Z digest=sha256:cff10ca5ae23e1f7c4dea82189ed6c042b9c2d2da6794302b801bb1910028b84

Observation 7420eb5e-d98a-4d61-a5ab-fd1d99439ac7 · outbound

This paper cites Curobo: Parallelized collision-free robot motion gener- 10 ation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Curobo: Parallelized collision-free robot motion gener- 10 ation

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.251139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.463721Z digest=sha256:ab4cb5503ae1227ad5af07ea72a3a9a8e33abd0af6ce6816ed5435cc2d937366

Observation 87521645-c0ae-4c13-8fbd-2ce83a7bc546 · outbound

This paper cites Rt-sketch: Goal-conditioned imitation learning from hand-drawn sketches.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Rt-sketch: Goal-conditioned imitation learning from hand-drawn sketches

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.236232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.467904Z digest=sha256:b067536d924f5a6b7e11d20e0553e4a6e43745cabddfebe542ad83c9e27d27fa

Observation 76f862e9-26e5-406e-9932-225a79cf0eb4 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Gemini: A Family of Highly Capable Multimodal Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.472078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.472078Z digest=sha256:a043b946cf3f327f386f443821a5a62894992037430fc40fbdf136693930a1fc

Observation e66015a5-5432-46b3-8376-4f8947683e94 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation LLaMA: Open and Efficient Foundation Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.476462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.476462Z digest=sha256:dd0487faac111c8299ad283f4f2c69b86b0b3872a5e7dd7c53b656b46dc46e23

Observation 53ba562b-7a78-42fe-bdf3-58199180b48e · outbound

This paper cites Any-point Trajectory Modeling for Policy Learning.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Any-point Trajectory Modeling for Policy Learning

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.480477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.480477Z digest=sha256:f76461b6aa9b3137ffef19415e7de8dd47cfcf82cffcab1dcd0e7fb543fa77ad

Observation 9771e031-8b41-4c7a-8962-61032fb1224c · outbound

This paper cites Chang, Leonidas J.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Chang, Leonidas J

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.223174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.484967Z digest=sha256:c7d9325e8ff2b6f4400d188204d414a17a8c0992fd43272037ce23f3c35f4782

Observation 19924dc0-9ceb-4302-8ec0-e2b42f218390 · outbound

This paper cites Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.489407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.489407Z digest=sha256:7a4b4432778bfa1215e65a4b29c88238fb7215f9380b028dc6706924fe57f3a0

Observation 10e15186-8752-4281-9942-41e2b490d81b · outbound

This paper cites AIC MLLM: Autonomous Interactive Correction MLLM for Robust Robotic Manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation AIC MLLM: Autonomous Interactive Correction MLLM for Robust Robotic Manipulation

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.493872Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.493872Z digest=sha256:4c37a463323ca37a33a24db1a7735e7bdc05e54d2e7f05aee6fb64035a9c26c2

Observation b8d67bd2-881f-45be-ac0d-c4eb4ed456c3 · outbound

This paper cites Universal manipulation policy network for articulated objects.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Universal manipulation policy network for articulated objects

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.209142Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.498881Z digest=sha256:7b368f68901045931bcea8bd85ef33ad81f67f699ece0a21fc3548cc898a613b

Observation f34b6cf2-c1d6-4b09-b634-81236354e53f · outbound

This paper cites Transferring Foundation Models for Generalizable Robotic Manipulation.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Transferring Foundation Models for Generalizable Robotic Manipulation

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.502912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.502912Z digest=sha256:8eb810b80759483d2afb77ece0242ed679f995c98491f571811eb499f3709fe2

Observation 44a2708f-6828-42cf-b414-4847988f5b3e · outbound

This paper cites Learning Interactive Real-World Simulators.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Learning Interactive Real-World Simulators

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.507787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.507787Z digest=sha256:9c187518d435538d70a429474c673422679080903bfbea324c2bc2c1bfc537cb

Observation 93487744-6e37-4959-8256-8abf4089c0fe · outbound

This paper cites M2t2: Multi-task masked transformer for object-centric pick and place.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation M2t2: Multi-task masked transformer for object-centric pick and place

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.196422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.512482Z digest=sha256:10c7e34f4b7bd47f218429e523dfa0b7b5826bbbcd7dced4e22068724b3eee73

Observation 18a9aea2-11bc-47c2-a9a4-3db97b8b70a3 · outbound

This paper cites RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.516610Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.516610Z digest=sha256:c1c433be156ebd098e4c0bfaaa82b463afaff3df22d29b1f15cfd85c0acac88e

Observation 32698faf-be29-4c0a-be09-1b7c8a0b4806 · outbound

This paper cites 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-16T01:07:35.520721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T01:07:35.520721Z digest=sha256:b09ccba1a2c56d26e570f6c99ff3921319439cbcb3caab680c500e050fe8ed2d

Observation 79ff5ae6-0f64-47c3-8e77-33ac2136edef · outbound

This paper cites Predict the contact point and orientation for manipulating the object. The hints in the image include the contact point with a blue dot. Specifically, the contact point is atap 0.

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation Predict the contact point and orientation for manipulating the object. The hints in the image include the contact point with a blue dot. Specifically, the contact point is atap 0

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T01:07:36.182953Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T01:07:35.526355Z digest=sha256:fc919be0d5c0910235c909d112502c8ee2dd057531171ca80467228103fb9bbb

Pith citing papers

Observation c09ebaf2-e8f3-4d1f-a84d-6e3e92ccfded · inbound

EnerVerse-AC: Envisioning Embodied Environments with Action Condition cites this paper.

EnerVerse-AC: Envisioning Embodied Environments with Action Condition CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T21:30:14.233767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T21:30:14.233767Z digest=sha256:7fd36130c9d9d361016761297f341310d8e2ab94e9ceda0ac23e89a2b9a2fc6a

Observation 677516cd-73b1-4364-9fe9-c089ce42d628 · inbound

RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot cites this paper.

RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T20:04:38.174259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:04:38.174259Z digest=sha256:257e122d6508b1c7bf04b1079335a3f53330c154b8f5ef9ddba2f5f651a8e6fb

Observation 5724532d-63a9-4b65-81f3-4873ec79ff14 · inbound

Action with Visual Primitives cites this paper.

Action with Visual Primitives CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-22T05:31:07.996827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-22T05:26:55.722814Z digest=sha256:40ae208cb727d973838fb831604f164afeb0ebca3d4404129ac3aba07bfadaa9