Pith. sign in

Paper Citation Record · LEDGER

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

As of 15 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2608.04765.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.04765 v1

Coverage vector

measured 22 of 22 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T17:14:27.945967Z

measured 22 of 22 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

22 of 22 outbound references displayed

  • verified exact0
  • verified fuzzy4
  • unresolved18
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation ec2b4004-2e21-407b-a086-73d84010ac79 · outbound

This paper cites Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:26.037934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:26.037934Z digest=sha256:9ec605a5e9c208e263df75a96b2f11e556e9e9365dc33b34fcc17b909ddeb494

Observation d2adf88a-c541-493b-b0df-1f6ffe2c69a6 · outbound

This paper cites PaliGemma: A versatile 3B VLM for transfer.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models PaliGemma: A versatile 3B VLM for transfer

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:26.111120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:26.111120Z digest=sha256:b36e7be9f5abfab6ad05ad90498508f4c30db83038ef4a14d915975d43067cfb

Observation 66f39838-00f2-4465-a131-21ab3c0956f3 · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:26.189732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:26.189732Z digest=sha256:60b58aa88b92cbcfc60eeea7c731142ee1259561b4b2462bd0f1efa57a270def

Observation f8e65588-ddd3-4d20-964f-ae43a6141cc3 · outbound

This paper cites Joycon-robotics: Low-cost, convenient teleoperation for one- and two-arm robots.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Joycon-robotics: Low-cost, convenient teleoperation for one- and two-arm robots

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T17:14:28.851693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T17:14:26.276539Z digest=sha256:000881f7cc21101cc576a2fd85584144185fef53cae93baabdcaafff8a659213

Observation c344ba2b-89a2-419f-a60a-e5025c4878d0 · outbound

This paper cites RT-1: Robotics Transformer for Real-World Control at Scale.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models RT-1: Robotics Transformer for Real-World Control at Scale

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:26.385568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:26.385568Z digest=sha256:ddedc1fc44cfc816ee62f0f61c8ac9725c3348b7a8cd6fe460238daa5ef11890

Observation 41feb185-f395-438e-bd57-e06e0979e0c2 · outbound

This paper cites Lerobot: State-of-the-art machine learning for real-world robotics in pytorch.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Lerobot: State-of-the-art machine learning for real-world robotics in pytorch

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T17:14:28.588740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T17:14:26.490968Z digest=sha256:3ea1954b239725f4456374fde343f7ebc85a7aae8ea16350357e522ec1de1d07

Observation fee69af2-5a7a-41c9-9555-f3a149b88d74 · outbound

This paper cites Inner Monologue: Embodied Reasoning through Planning with Language Models.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Inner Monologue: Embodied Reasoning through Planning with Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:26.588110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:26.588110Z digest=sha256:f82a8e156f093bae09e65c0726ee9eb78ee253bb95e28738e4257d7a9cfcc494

Observation 6735a986-ff53-484e-b4da-f1f423db95a7 · outbound

This paper cites OpenVLA: An Open-Source Vision-Language-Action Model.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models OpenVLA: An Open-Source Vision-Language-Action Model

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:26.712575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:26.712575Z digest=sha256:cc1149b1ea1627f1c99eda5e462ab4d169a5328d3a265fd6d31df3081a271655

Observation 65adc830-e97a-45cd-b04a-c739778869d7 · outbound

This paper cites HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:26.783152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:26.783152Z digest=sha256:3c318e0a5bd6d7ea68de6e3d2e18a8a2c3611bfba7e450ace9ae15d4426a0166

Observation f225bd11-9e7a-4f60-8bd4-51b1e6cb27c3 · outbound

This paper cites BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:26.871373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:26.871373Z digest=sha256:eb7d45d64e2fb596e5fd6711001026f091b48fe0af780326f8e54ec0f3226c91

Observation 237d394d-7864-4b49-a301-a7739ce01fa7 · outbound

This paper cites MAP-VLA: Memory-augmented prompting for vision-language-action model in robotic manipulation, 2025.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models MAP-VLA: Memory-augmented prompting for vision-language-action model in robotic manipulation, 2025

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T17:14:28.489749Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T17:14:26.952439Z digest=sha256:94bb106513ca022cd546e1ce24dd671f3b5885d4dc63abb23e15f01ce87bd04a

Observation 7c21e6dc-3e5c-4420-98ae-0615431a054b · outbound

This paper cites RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.000096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.000096Z digest=sha256:a2ac4a7d749beab8e81e3086d091e930c1b3a033a6c943791d870e6b5aff5007

Observation 3b1c435e-2a12-4b36-be43-6ff890490cab · outbound

This paper cites Octo: An Open-Source Generalist Robot Policy.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Octo: An Open-Source Generalist Robot Policy

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.106158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.106158Z digest=sha256:a3add2a54d847cb57fe71b85658e94a6af8a19905e6eebde9318c5516226b343

Observation f853134b-9a69-42aa-871a-2bf63528db39 · outbound

This paper cites $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.209877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.209877Z digest=sha256:6c31cfb32bdad946ac2ef9dbdbbba710578110bedbc8f46c44fd71c341e35ddb

Observation c0a42ada-1856-4df4-9adb-fdd227092620 · outbound

This paper cites Qwen3.5: Towards native multimodal agents, February 2026.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Qwen3.5: Towards native multimodal agents, February 2026

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.279263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.279263Z digest=sha256:422c073b6f7dff1368903069644d0c7e467db486cbe7321c5ee4ab68e146f4b7

Observation c915fb07-061a-43e5-b299-aada8e2681ad · outbound

This paper cites MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.367558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.367558Z digest=sha256:95d907195f0859232e735b86d631cf32f66514760b205e9e025b03105371ac1f

Observation a0ec2831-49aa-494e-a42e-a007edbdf222 · outbound

This paper cites XLeRobot: A practical low-cost household dual-arm mobile robot design for general manipulation.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models XLeRobot: A practical low-cost household dual-arm mobile robot design for general manipulation

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T17:14:28.370855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-06T17:14:27.485130Z digest=sha256:500d6cf186ead599d9356af210f3151e2cb55ac182ddab2df21f72f159b3f51f

Observation 55f0d4a2-5889-41ca-b91e-0f0405701a26 · outbound

This paper cites dVLA: Diffusion vision-language-action model with multimodal chain-of-thought, 2025.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models dVLA: Diffusion vision-language-action model with multimodal chain-of-thought, 2025

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.589065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.589065Z digest=sha256:e9f7a15ea800f16ece2100b3f46913ae124114fe6705360d89e221e3d49a39b7

Observation fdf76bb0-0b49-4392-a1e3-8ed27da973a7 · outbound

This paper cites Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.690161Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.690161Z digest=sha256:e578d3e3013ba27dc327515074352ee98463d190d45802e4b9708fb61f8e58ed

Observation fbfb4b99-ddd3-4431-bee1-9b98220acb78 · outbound

This paper cites Robotic Control via Embodied Chain-of-Thought Reasoning.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Robotic Control via Embodied Chain-of-Thought Reasoning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.759703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.759703Z digest=sha256:579f7d5ba329c24a6425aebdbac3d0d3db71cc76dfae0fe48b1e5bc5220f7c1c

Observation 4bb970a5-a952-4d1e-b542-1a3be5360814 · outbound

This paper cites DualCoT-VLA: Visual-linguistic chain of thought via parallel reasoning for vision-language-action models, 2026.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models DualCoT-VLA: Visual-linguistic chain of thought via parallel reasoning for vision-language-action models, 2026

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.833388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.833388Z digest=sha256:ed44dc77e14a792f48d29f2a71d221ffc546ea6c704562b4184558fab983de16

Observation eb76eb0c-77e0-4a74-8e22-b4f14cf602fc · outbound

This paper cites RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T17:14:27.945967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:14:27.945967Z digest=sha256:ea7b2ca3ff986c562d736e83f581bdb60815432f6c9bd44f2f6f2f4b21d37005

Pith citing papers

No inbound Pith citation observations are available.