Pith. sign in

Paper Citation Record · LEDGER

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?

As of 21 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2506.14507.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.14507 v1

Coverage vector

measured 26 of 26 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:23:01.919344Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-14T15:39:59.878169Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-14T23:13:15.774007Z

Reference resolution

26 of 26 outbound references displayed

  • verified exact1
  • verified fuzzy9
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e0499a38-1ba4-43d3-b5d9-aeb475c79970 · outbound

This paper cites Getting vit in shape: Scaling laws for compute-optimal model design,.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Getting vit in shape: Scaling laws for compute-optimal model design,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:23:02.555563Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:00.467925Z digest=sha256:0cf60e7bf9b0e51a622123d0b6b7648b16abead4037f18d463d3a5c2e260a930

Observation 40e9d7d8-c1a9-4405-acf3-7240dd96a381 · outbound

This paper cites Spatialvlm: Endow- ing vision-language models with spatial reasoning capabilities, 2024.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Spatialvlm: Endow- ing vision-language models with spatial reasoning capabilities, 2024

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:23:02.531508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:00.566662Z digest=sha256:acbfbbf7d14b8f441b1e311321405398e95daa32d1fe6dd459f424abb8d2cca0

Observation ed17b4aa-87dc-430f-a22e-7824d1b5cc3f · outbound

This paper cites NaVILA: Legged Robot Vision-Language-Action Model for Navigation.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? NaVILA: Legged Robot Vision-Language-Action Model for Navigation

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:00.630568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:00.630568Z digest=sha256:d1fe0015b9f4f3daaf5abaab4be4cc260cbc84471fdaf15a733bb67e9c842275

Observation 3c22e683-59c9-4af2-9a43-b6de6d942bcc · outbound

This paper cites CLIP-Nav: Using CLIP for Zero-Shot Vision-and-Language Navigation.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? CLIP-Nav: Using CLIP for Zero-Shot Vision-and-Language Navigation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:00.698604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:00.698604Z digest=sha256:634f163357eb69508c57c2008adeeab2d764402f32d103fce109a7455dcff3d5

Observation e5e2af88-9c60-4abf-99d4-6749b39fe012 · outbound

This paper cites Learning latent dynamics for planning from pixels, 2019.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Learning latent dynamics for planning from pixels, 2019

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:23:02.510339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:00.783826Z digest=sha256:163fa4107a095186b63ec5e7ace3dd52c7712e8d7c7cc18bab2693da14206719

Observation 481ba7a2-3ddb-421e-8953-a4f958356b26 · outbound

This paper cites Mastering Diverse Domains through World Models.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Mastering Diverse Domains through World Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:00.842906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:00.842906Z digest=sha256:3d70ba4b041fa43dbd29b7a4d15889d40f02f4142add81f23a86eee6a406a8f3

Observation 0040f366-669a-4909-8d08-e03002d5417c · outbound

This paper cites Visual language maps for robot navigation, 2023.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Visual language maps for robot navigation, 2023

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:23:02.486795Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:00.924004Z digest=sha256:f4f06cb757677b2b8980b98dbb902197e5e5d4f3ee167da4c10188acb38e4e63

Observation 987b5551-2994-42c3-9cad-e7c8825761ad · outbound

This paper cites BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:00.963437Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:00.963437Z digest=sha256:8ed2e55288336e29b980ff6b0bb6d3b4b56a09d87666ea97944007493d4e8adf

Observation a2d883d2-6d9b-4aea-8c14-1e0f207b4e51 · outbound

This paper cites ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:00.968433Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:00.968433Z digest=sha256:e335c403326e671c88ccf133243ad61f9a2e64da66c00c2c571869d818678f72

Observation c9a54b4f-259b-4157-ab69-694ee5098b09 · outbound

This paper cites Distilling Realizable Students from Unrealizable Teachers.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Distilling Realizable Students from Unrealizable Teachers

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.023823Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.023823Z digest=sha256:5148216b57d65b728013b4d92515f3c482b0d276eac921e8efe2b2422c9341bc

Observation 1049ce38-98fd-44b0-a912-d685f452942f · outbound

This paper cites Constrained Behavior Cloning for Robotic Learning.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Constrained Behavior Cloning for Robotic Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.104551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.104551Z digest=sha256:ce38d66ddde26473e1115f5b45d5056026969a4fed1bab0c7ed5084e2bc2d7c1

Observation 8389b828-de7b-4414-97ee-71e84bdaa3ed · outbound

This paper cites ZSON: Zero-shot object-goal navigation using multimodal goal embeddings.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? ZSON: Zero-shot object-goal navigation using multimodal goal embeddings

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:23:02.465031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:01.190903Z digest=sha256:7e207149f65109ef7fc45d96a7bb9372236d78338fcf09ecaff20a4f74172a72

Observation d45a9c07-9fde-4449-b71f-79f99530b241 · outbound

This paper cites Orbit: A unified simulation framework for interactive robot learning environ- ments.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Orbit: A unified simulation framework for interactive robot learning environ- ments

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.237600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.237600Z digest=sha256:db0efe824ccdb93dbabe9ab4726526e48973e79790be913beb20839a08e754ec

Observation c28bb70d-a4d7-4b7d-93d9-cfd44f9e2958 · outbound

This paper cites Language-Conditioned Offline RL for Multi-Robot Navigation.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Language-Conditioned Offline RL for Multi-Robot Navigation

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.301764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.301764Z digest=sha256:9a5e7f4b75b9db1d892d0a0978bce0ed7a7152bdd7c3aec96440604cf6c9a1d8

Observation 173f7ab1-8664-42c0-a57b-22d6abed694e · outbound

This paper cites R3m: A uni- versal visual representation for robot manipulation,.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? R3m: A uni- versal visual representation for robot manipulation,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:23:02.446687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:01.359403Z digest=sha256:d783f291f8165ddda188441bb4d8e43760b21a5797631ef897439dc6c86fb530

Observation 9032cfc7-51d1-4bf7-b85a-1c46bfcda798 · outbound

This paper cites Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.486633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.486633Z digest=sha256:78310c6016d2436d5db50e0e01796f92e1984da1e3aba293956691748fe6a818

Observation 4dc5ed25-58df-4883-b710-8c2e4851e655 · outbound

This paper cites Isaac sim.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Isaac sim

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:23:02.425411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:01.494307Z digest=sha256:1d3b0ca65c2685ff1408b73cdbffb0f433b2c30ac7f9d52a1233d69b6606f503

Observation 30a9500b-81ca-4169-880a-acde40926f46 · outbound

This paper cites Learning Transferable Visual Models From Natural Language Supervision.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Learning Transferable Visual Models From Natural Language Supervision

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.525716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.525716Z digest=sha256:a63f617ca0e72c9fe177eac16d642cb11cbc7428c857c47ee88a41e0179fb1bf

Observation c66757b3-508a-4717-aa66-2dc5e06524df · outbound

This paper cites Latent Plans for Task-Agnostic Offline Reinforcement Learning.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Latent Plans for Task-Agnostic Offline Reinforcement Learning

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:23:02.127836Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:01.592832Z digest=sha256:02643f75e6751666535d81c4292127fc69adc534fcd50d35b18d255b3fc754e5

Observation 3f7cb8c2-75c1-4d4f-921f-d2a1ed275cf4 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Proximal Policy Optimization Algorithms

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.655232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.655232Z digest=sha256:8248c30b07c3ca70200e910b9189c048f276daad183247d2269d6b76abd06836

Observation 3fa81a0a-5c6a-4212-8c6e-6968a2ccc98d · outbound

This paper cites Vlm-social-nav: Socially aware robot navigation through scoring using vision-language models, 2024.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Vlm-social-nav: Socially aware robot navigation through scoring using vision-language models, 2024

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:23:02.404975Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:01.734952Z digest=sha256:f708ab17eb18b2113445150e44389e0d8dde6d020bfa53b339415d130418cd12

Observation 775a35c4-692f-4f85-976b-691f70366aa1 · outbound

This paper cites Open-World Object Manipulation using Pre-trained Vision-Language Models.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Open-World Object Manipulation using Pre-trained Vision-Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.797762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.797762Z digest=sha256:2e85939af0b0e869fe2ca617f4189ab17fd0b701e8b1b849667f6054ac4cadd0

Observation c50d8b92-015b-4c1a-8568-5378e6677997 · outbound

This paper cites Sigmoid Loss for Language Image Pre-Training.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Sigmoid Loss for Language Image Pre-Training

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.862440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.862440Z digest=sha256:3251f48bd59ea49887c84096b9428c69bcb07f155ad6f803ceaefc821419f7be

Observation 8e4c8fb4-92e4-4e61-b02a-a8b3e0cf5ee3 · outbound

This paper cites RT-2: Vision- language-action models transfer web knowledge to robotic control.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? RT-2: Vision- language-action models transfer web knowledge to robotic control

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:23:02.385497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T00:23:01.919344Z digest=sha256:d498d0ea6a0d3c5012745434599132f0809c18b4427ff282ea65257de59ffff8

Observation 41596763-d6ca-4f0a-ad20-f00e05c1f39b · outbound

This paper cites R3M: A Universal Visual Representation for Robot Manipulation.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? R3M: A Universal Visual Representation for Robot Manipulation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:01.438793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:01.438793Z digest=sha256:33a82cac7aa08c5b424d4f62a221eae13cf207c3e6541b2e0bb097089adbcb9c

Observation b7bdfaf7-9860-469c-845b-9238aa34cd6f · outbound

This paper cites Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design.

Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation? Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T00:23:00.522629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:23:00.522629Z digest=sha256:792a9016330d15261f8d0f4b572103b5ed3a7b4ad6169cd008b2ac47c3f81f82

Pith citing papers

Observation bcff18d3-129c-4ce3-a3e5-0edbe42ff4a2 · inbound

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory cites this paper.

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?

Reference 248

Resolution
verified exact
arxiv_id, observed 2026-05-14T23:13:15.777167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-05-14T23:13:15.016486Z digest=sha256:f995ae90130c6014855f7f10df53112b5f03af0662b6e943a122330624aedc6e

Observation b634dbf6-4d76-4ab7-98b0-f537bcf8a414 · inbound

A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation cites this paper.

A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation Can Pretrained Vision-Language Embeddings Alone Guide Robot Navigation?

Reference 238

Resolution
unresolved
no resolver link, observed 2026-07-14T15:39:59.878169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T15:39:59.878169Z digest=sha256:e0bb6426fcf27699a7001661eabcd0209a42a90c48f71a64ddefb394d8121809