Pith. sign in

Paper Citation Record · LEDGER

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation

As of 20 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 6 inbound Pith citation observations for arXiv:2505.11383.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.11383 v1

Coverage vector

measured 60 of 60 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:59:11.164370Z

measured 66 of 66 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 6 of 6 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-01T12:04:39.821353Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T14:37:03.075467Z

Reference resolution

60 of 60 outbound references displayed

  • verified exact1
  • verified fuzzy21
  • unresolved38
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 01d8955a-8656-45e7-b7e4-24c4531b860d · outbound

This paper cites Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.849564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.849564Z digest=sha256:20cdb6a8e2fb34d1dc438dbf2a7d26231726634277f7b107c5cc9084c247c226

Observation d038db71-6345-4fb3-ad16-aeb9a5715e14 · outbound

This paper cites Reverie: Remote embodied visual referring expression in real indoor environments.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Reverie: Remote embodied visual referring expression in real indoor environments

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.903499Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.903499Z digest=sha256:625b83b56e1fb7fed07b6917eebff664543eb247843c36f49dde75ccaf9e71cf

Observation d9e9caf6-4b13-4bed-8dd9-b3e6c09b2f2c · outbound

This paper cites Beyond the nav- graph: Vision-and-language navigation in continuous environments.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Beyond the nav- graph: Vision-and-language navigation in continuous environments

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.936174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.936174Z digest=sha256:0e13bf4177c420d2e49215113ea12db06ab6075f8214c70b7cf889162e813ac5

Observation 45278d17-f96a-4c42-baeb-20620e5e5c34 · outbound

This paper cites NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLM.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLM

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.939678Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.939678Z digest=sha256:206c1c31d54312af4006de2bf5e4dbc86c044b9686f789fdcd6d11f8358a2cc5

Observation 705f5863-bebe-4c38-8383-8273c10a40e6 · outbound

This paper cites Navid: Video-based vlm plans the next step for vision-and-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Navid: Video-based vlm plans the next step for vision-and-language navigation

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.803239Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:10.943451Z digest=sha256:c4a38d147e693fff0a2f5833113a7c9e6048b3d7c863228199cfde4b4d653bf6

Observation bcaf25e4-d524-4bf8-a3f5-77a3e0cbd0ec · outbound

This paper cites Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.947005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.947005Z digest=sha256:ca204f9ffd2909c02e72b1043f0d969a9d357c7ddc6aafd81aa82c08be342ee8

Observation d61b36e6-545f-431c-a197-7e3e499c7063 · outbound

This paper cites Navila: Legged robot vision-language-action model for navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Navila: Legged robot vision-language-action model for navigation

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.792553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:10.952731Z digest=sha256:531390963bc5d355fb0edd3e275b11716a019438510ee048c6d372a5d691be6a

Observation b3b93662-d1aa-4d52-8dc3-4e5398686caa · outbound

This paper cites Video-LLaVA: Learning United Visual Representation by Alignment Before Projection.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Video-LLaVA: Learning United Visual Representation by Alignment Before Projection

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.956883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.956883Z digest=sha256:f589941fdea1cf619e5d53224134c49fe582f81e50f15186309aaa6b42f1093f

Observation 0f5cd850-a1ea-407f-85f6-db18870e19c9 · outbound

This paper cites Vila: On pre-training for visual language models.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vila: On pre-training for visual language models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.961049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.961049Z digest=sha256:8553afbb503abbf90b52177a5035c8d003c45fa6c82aaa178415395c778c00ad

Observation 996261e8-7526-41ee-a2bd-20522179c51d · outbound

This paper cites Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.964786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.964786Z digest=sha256:af2141528c2e1cfb088732ad6a1dee276b8906dd9e0cb627fefdd8596bed3d23

Observation da6b1330-cdc2-43e2-8445-7722539e026e · outbound

This paper cites Learning transferable visual models from natural language supervision.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Learning transferable visual models from natural language supervision

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.968497Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.968497Z digest=sha256:4e356ba273148ed4d556b0670261fdac91d2a6a3c5e4dd067f234b0929de21e9

Observation 9e8723f9-ff7d-4355-be5c-e9272afdcde4 · outbound

This paper cites Fast Segment Anything.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Fast Segment Anything

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.972360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.972360Z digest=sha256:62920a4bd9df8ac15209675840422bb3d6b4a08866175e736bb562d02a9bb91d

Observation 3efa4660-06ae-47dd-9c5c-2562faa81aa3 · outbound

This paper cites Embodied- sam: Online segment any 3d thing in real time.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Embodied- sam: Online segment any 3d thing in real time

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.761723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:10.976611Z digest=sha256:d3553347c831f4ef40974bde90553fb186605fceaaedf3e6b30cdc4ae0b03c1a

Observation b51ff56e-42fa-4640-a62e-899912c30b18 · outbound

This paper cites g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-08-15T20:59:11.320907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:10.980663Z digest=sha256:0b9020986431ea8b6cef53920372db5b931f261cc7296a2af9a28b9592cf5d21

Observation 8a0a6a91-d385-4944-8dd5-5be7d7a306d6 · outbound

This paper cites Vln bert: A recurrent vision-and-language bert for navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vln bert: A recurrent vision-and-language bert for navigation

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.750903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:10.984771Z digest=sha256:c5722162af7bb1c3ea1531bfa35cc2f11f7f55a5faf24d66c648a9c45c339011

Observation d746555c-a006-4a4d-9404-4d5878ab8a2f · outbound

This paper cites History aware multimodal transformer for vision-and-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation History aware multimodal transformer for vision-and-language navigation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.988386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.988386Z digest=sha256:874bad6f4c09ed42d83fb4039b0b396886e0ec0eb18d406990fe78f9184ea4c5

Observation 131334fe-8c88-4760-9047-80e969dac600 · outbound

This paper cites Think global, act local: Dual-scale graph transformer for vision-and-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Think global, act local: Dual-scale graph transformer for vision-and-language navigation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.992525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.992525Z digest=sha256:9cfacb1a5ffb43fdbc78a95998e8b281a96d18aaa2a63da05e9357820cd38eef

Observation 3bdf7c7a-c675-42f4-b41c-a9caadf81c4c · outbound

This paper cites Vision- and-language navigation via causal learning.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Vision- and-language navigation via causal learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:10.995663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:10.995663Z digest=sha256:2e88a58ee0bef5255173549370c5f67e2a1203588bf33d8f6aea80481be6712e

Observation eb7cb573-bf4a-4532-9ac4-ba7134ed269c · outbound

This paper cites Hop+: History- enhanced and order-aware pre-training for vision-and-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Hop+: History- enhanced and order-aware pre-training for vision-and-language navigation

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.720871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:10.998621Z digest=sha256:0fc047ff9b3c36d9eff7d85521f57e1efb0450968ad5a3fd111a6cc1e7837c9f

Observation 2620a608-4819-4edf-b17a-1b0256c8985e · outbound

This paper cites Bird’s-eye-view scene graph for vision- language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Bird’s-eye-view scene graph for vision- language navigation

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.709765Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.001793Z digest=sha256:1c24c1f53a9913a84016130195e1af08d6e2d8080d03c4f2bfb4fee5a63ee5d4

Observation fe999097-561a-4e17-811a-ea95375f2453 · outbound

This paper cites Matterport3d: Learning from rgb-d data in indoor environments.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Matterport3d: Learning from rgb-d data in indoor environments

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.004945Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.004945Z digest=sha256:d3d43bd4333b15782482f897ffccfde719f503338a49edf84eb649fae3b91033

Observation ba6d9897-ac8a-498f-827d-5d122622a9d3 · outbound

This paper cites Habitat: A platform for embodied ai research.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Habitat: A platform for embodied ai research

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.008702Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.008702Z digest=sha256:b2ec44fadf7cc3b6bb0bb89a70f0df50bd2e9beeba82b931c8d1471c27f36ada

Observation 3826abaa-d65d-423e-90ed-837387ce4795 · outbound

This paper cites Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.685462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.011706Z digest=sha256:0f67f959598c24b40b2e53574b2d26071ceac62bd04a4efae801be2487668e1b

Observation 0dd1d137-ae3a-48d7-a8fd-b90898c06c12 · outbound

This paper cites Gridmm: Grid memory map for vision-and-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Gridmm: Grid memory map for vision-and-language navigation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.015092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.015092Z digest=sha256:412daa2b6eef8c6ffd283b599a07eabcb544d732d9cd4d486e4d1b5b6e8e5cdc

Observation 32cf35d3-5940-4fe4-8d7c-d0e5f10a224b · outbound

This paper cites Etpnav: Evolving topological planning for vision-language navigation in continuous environments.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Etpnav: Evolving topological planning for vision-language navigation in continuous environments

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.018222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.018222Z digest=sha256:d6b69cffd403aa7df2b14b0c8fb22e7856a2d32a117055bd2146d55d81f16d9b

Observation 9026c242-c737-4e68-bdb4-8cb23b074a4f · outbound

This paper cites Bevbert: Multimodal map pre-training for language-guided navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Bevbert: Multimodal map pre-training for language-guided navigation

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.661909Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.021346Z digest=sha256:1a9cf58ec80d9242d917de91d037bcaa2622ab580e8090439ab09a3299465e18

Observation 6d3d0a0b-aaeb-4744-9d4f-1dbf17bd71f3 · outbound

This paper cites Sim-to-real transfer via 3d feature fields for vision-and-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Sim-to-real transfer via 3d feature fields for vision-and-language navigation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.650854Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.024387Z digest=sha256:55ccc71f80ef6611d6f3d2488385430d38c513394dfa2ec58fb90d8037aaee09

Observation 3b312087-5dd7-42f7-ae1f-96e991bd4927 · outbound

This paper cites Open-nav: Exploring zero-shot vision-and-language navigation in continuous environment with open-source llms.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Open-nav: Exploring zero-shot vision-and-language navigation in continuous environment with open-source llms

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.640342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.028544Z digest=sha256:b8b027bd64865d3a4a16193e094be641bfdba1389a4a22fbbacc20b629053b05

Observation 0cfb4c6b-3c7b-40f8-8066-1e7ab584f861 · outbound

This paper cites NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.033358Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.033358Z digest=sha256:f30d75835638a328d48e5f0cc6be48c84140a45cc79f4417359ec9def3ad49fa

Observation bf22fda2-2145-4d70-ab77-38def4453fd7 · outbound

This paper cites an unresolved cited work.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:59:11.629551Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.037712Z digest=sha256:539f5712e1f537856698e197190c1d4beda063a6fa06f06fa321dba9d2befbe3

Observation 9f6a8151-3867-41fe-81e5-0f6fdbd0d5d9 · outbound

This paper cites an unresolved cited work.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Unresolved cited work

Reference 31

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:59:11.617339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.041499Z digest=sha256:8dec6e6ccaf959a5172e89382a9ff6681a54b35aefe957f29ea89be8e13eab06

Observation 725ba98b-b1d8-4018-aa3a-29813f2fba55 · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.045479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.045479Z digest=sha256:5cf8ec608e5a22d21c5a5f6457fd61dfdaf6743ac8984062c96c44b1f866026f

Observation 42c64cff-a0f4-41e9-a8e7-87ab19b0a4f7 · outbound

This paper cites Improved baselines with visual instruction tuning.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Improved baselines with visual instruction tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.049094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.049094Z digest=sha256:d15b717f66925adac6c0ea6b98dae2f7a070172e968ed270ad4c384f7fbd1d72

Observation a916a59d-7d46-48e3-aac3-24f8236b1d8c · outbound

This paper cites Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.053125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.053125Z digest=sha256:82e6231dd393d92fd1ee778382274ea3169ec4caeaee85bca7e0a9ce99353d27

Observation b171e546-d8cd-4076-8a8f-7972e223fc3f · outbound

This paper cites Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.056801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.056801Z digest=sha256:07bd83eec29c7067d5f99465ea52caedec4e3cf8632ca858ab191896b3155cb4

Observation 8eecf82a-69cd-4065-92be-1720cb442572 · outbound

This paper cites An embodied generalist agent in 3d world.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation An embodied generalist agent in 3d world

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.583760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.061079Z digest=sha256:6306754d05274668f6695ee6ad55676edd848fa4b79c2cd0d076a502a7db0509

Observation 64c95c6e-091b-4714-81cf-6abfc2239f41 · outbound

This paper cites Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.064457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.064457Z digest=sha256:286c5e4d386a076bb871ec5853b1b200ad9666649351f52852b500c3d80c331b

Observation c782b4a2-c2ee-4cfe-b079-3788ba651885 · outbound

This paper cites 3d-llm: Injecting the 3d world into large language models.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation 3d-llm: Injecting the 3d world into large language models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.068061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.068061Z digest=sha256:bb423fabdd5c5af3c5aae039cd5f42b1ada1f8224456b829748c14d2c7788f24

Observation 950c6378-f069-49eb-9012-56ffe44cb7b6 · outbound

This paper cites Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.071380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.071380Z digest=sha256:c8d2cf119ff09e235624da59d061572c75f571e6352d822c3002eab9a59f9260

Observation 346d152d-5f34-45c0-a6a0-ab946f40cebc · outbound

This paper cites LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.074859Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.074859Z digest=sha256:6d76d4e56ca4ac2c769b66258ee34d3198055bdf68925244890bda29b343e637

Observation 14734b56-16dd-4f6c-a957-0ba37e13f1e0 · outbound

This paper cites Lookahead exploration with neural radiance representation for continuous vision-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Lookahead exploration with neural radiance representation for continuous vision-language navigation

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.560550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.078810Z digest=sha256:5eeb2db0975f826e16ef0ed13a9ff3a5700a0b352cb155020462d5a4575af709

Observation 474084a7-5bbd-4641-92f0-e2fe4e7770e0 · outbound

This paper cites Learning Generalizable Feature Fields for Mobile Manipulation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Learning Generalizable Feature Fields for Mobile Manipulation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.081771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.081771Z digest=sha256:5bcf15faab2d78700c51cd6ba736cd480ccfebc50e97741ed197e499e1f09c7f

Observation ecc44f67-62e1-4f06-9120-7508788c4a01 · outbound

This paper cites Scannet: Richly-annotated 3d reconstructions of indoor scenes.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Scannet: Richly-annotated 3d reconstructions of indoor scenes

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.085792Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.085792Z digest=sha256:e4284e5e140cf114eb8525c07b915b22071becffc6ed7d52dc278de45af8a2af

Observation 35e81402-52cf-4eca-a141-d8ad255f3ee7 · outbound

This paper cites Habitat- matterport 3d semantics dataset.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Habitat- matterport 3d semantics dataset

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.089780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.089780Z digest=sha256:6669a44640110602c2176eb0490b33b069c8a52295a6c14a8add89d375ef1b93

Observation 1c8ec00f-2ea0-492b-9143-af31ef56b098 · outbound

This paper cites Rio: 3d object instance re-localization in changing indoor environments.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Rio: 3d object instance re-localization in changing indoor environments

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.532040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.093803Z digest=sha256:bbb5122de09b091bd0085c5405019a8de7ff3bda50dd86ac738a0c0e9c9ae4fb

Observation c4f3ca20-cb4a-47ad-843d-610c1d23d289 · outbound

This paper cites Sceneverse: Scaling 3d vision-language learning for grounded scene understanding.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Sceneverse: Scaling 3d vision-language learning for grounded scene understanding

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.517526Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.098172Z digest=sha256:d5a660394ff0c7358418e46d5131db719742ffddb8ac95c2f8f09879f8336ae0

Observation 5d428d5f-01d3-4f7f-b810-584d1861ed4b · outbound

This paper cites Feature Splatting: Language-Driven Physics-Based Scene Synthesis and Editing.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Feature Splatting: Language-Driven Physics-Based Scene Synthesis and Editing

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.102040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.102040Z digest=sha256:f3e40e608ae1185a59cf657bc1ef57ab9493ac60d7e783f2cfcc59e2706a350e

Observation 80f4a096-6e24-4429-aae3-3da3c5fb0227 · outbound

This paper cites Xtuner: A toolkit for efficiently fine-tuning llm.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Xtuner: A toolkit for efficiently fine-tuning llm

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.106040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.106040Z digest=sha256:74bd810ef2ee20b578f64fe403b7f6529359618212a987c4054a5f1650f5280a

Observation c1f25e16-a2e5-4f69-a7bd-1be5f863865c · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.110249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.110249Z digest=sha256:d4f507547d206d2774f97867b1b223a597ed9ecacacf6f0d5848f1cd19d30adc

Observation ee9c700a-27dd-4ec4-bc40-bd90809ce39b · outbound

This paper cites Cross-modal map learning for vision and language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Cross-modal map learning for vision and language navigation

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.490076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.116507Z digest=sha256:784950c03ba1caa93460d730eddd7cd45aa88cd064c900e1a40c18cc2a3dbc09

Observation 0745b914-d419-47a4-8055-e89f749e0b04 · outbound

This paper cites Weakly-supervised multi-granularity map learning for vision-and-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Weakly-supervised multi-granularity map learning for vision-and-language navigation

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.471819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.122152Z digest=sha256:acc2d9a26ce14b39e17eee7d1a15ea89c9999326b2fbd69242db6397a2980af8

Observation 480992bc-787d-44d2-90d6-9fe4a143bf06 · outbound

This paper cites Instructnav: Zero-shot system for generic instruction navigation in unexplored environment.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Instructnav: Zero-shot system for generic instruction navigation in unexplored environment

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.456951Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.126143Z digest=sha256:9e2b039525ef98638124de6ff807a82fce320cc5b36ae258bb16dc1180368d7c

Observation eeb33017-9d81-4ecc-ac59-29b2f28d52c1 · outbound

This paper cites Affordances-oriented planning using foundation models for continuous vision-language nav- igation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Affordances-oriented planning using foundation models for continuous vision-language nav- igation

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.444755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.129374Z digest=sha256:53be627b53a748fab0c3c0e566edde43d76380ecb8859bf21994ef6c00e0ca0f

Observation 8a683655-5628-45f2-840f-6cbd29249200 · outbound

This paper cites Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.132492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.132492Z digest=sha256:ba3638865de06b4e2033e486c4ed5b188ef488784f805cddad738bc01ead2f3d

Observation 0e832c77-1435-4575-82fc-4d87149dd052 · outbound

This paper cites Structured3d: A large photo-realistic dataset for structured 3d modeling.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Structured3d: A large photo-realistic dataset for structured 3d modeling

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.425999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.135977Z digest=sha256:1cff53ac5e1eb6e12ea1746398ed131bcc208119b885e3e8bd42cd7acd8a8ca2

Observation d0d8957f-b1f3-40df-8ac2-c8058f3bad83 · outbound

This paper cites Scaling data generation in vision-and-language navigation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Scaling data generation in vision-and-language navigation

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.412170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.142816Z digest=sha256:a6bae6c0343ec86f59a892b1778dea5796098b284b1961d3331e6840d6e60ea8

Observation 5bd952d9-d33d-4e06-a66b-e976435b16bf · outbound

This paper cites A reduction of imitation learning and structured prediction to no-regret online learning.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation A reduction of imitation learning and structured prediction to no-regret online learning

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.148767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.148767Z digest=sha256:36901b7839afc79d0b613491aaba509926bc1a4062d683477fcbdf65e82ad211

Observation 1ecbbded-bccb-4ae6-a056-5c7da6d6e675 · outbound

This paper cites Adafactor: Adaptive learning rates with sublinear memory cost.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Adafactor: Adaptive learning rates with sublinear memory cost

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.157244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.157244Z digest=sha256:c8cd16ea7eb86a96f48ab3b61fc7a8adbf286429d7835e00bfd36b14dea92c8e

Observation 1f72137b-27b2-4585-9596-37037a535bad · outbound

This paper cites Training Deep Nets with Sublinear Memory Cost.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Training Deep Nets with Sublinear Memory Cost

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:11.160541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:11.160541Z digest=sha256:498113abed916a06502a15749256c68bbbb5287ffa3ed8fed05fd770c1a73e12

Observation 3d4c7a5b-a3b9-4828-a977-cf88c588ed25 · outbound

This paper cites Dynamem: Online dynamic spatio-semantic memory for open world mobile manipulation.

Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation Dynamem: Online dynamic spatio-semantic memory for open world mobile manipulation

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:11.384825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-15T20:59:11.164370Z digest=sha256:9bac5e36560f5ed2f373638685c4c6dfab6d17005c2c8478fb633f04cc6add4e

Pith citing papers

Observation 10920aae-b0b6-40f6-bfb5-c4bd0db6c11c · inbound

Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation cites this paper.

Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-17T21:05:15.944979Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-17T21:02:38.013115Z digest=sha256:cf2304621b4f3738879ac4ba6a50abcbb0a204a26250e1a7272a77423ce372ab

Observation a7609af3-49f1-4cfe-b0ae-76e5d5b2bd0e · inbound

What Limits Vision-and-Language Navigation ? cites this paper.

What Limits Vision-and-Language Navigation ? Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-14T18:02:32.616304Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-14T17:59:58.891151Z digest=sha256:a932244f10e56743fa6aaccbd8a3dde98cf491c1f6a397f8a2fedfbb8d5c3021

Observation 0e70a95a-c0ab-45f8-ba18-94a5f067105f · inbound

GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation cites this paper.

GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-22T06:46:10.563944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-22T06:45:35.920991Z digest=sha256:9ee7bd4c9d1065fc00ce58b45ef7cd3c7e70a5d46499415810c7b991a56ab7e8

Observation 60fad76a-54e2-40b7-abc8-9a427e75a6d3 · inbound

Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation cites this paper.

Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-06-29T22:34:01.357198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-29T22:33:32.671550Z digest=sha256:11223b30da029ead73564dfac253f6f58814165c267553051737e509b3eb55f6

Observation a7332381-e0b8-49e3-94e3-26f339981b26 · inbound

NoPA: Non-Parametric Online 3D Scene Graph Generation cites this paper.

NoPA: Non-Parametric Online 3D Scene Graph Generation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-07-02T14:37:03.076919Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-07-02T14:36:02.425820Z digest=sha256:10aa6fbab4767d898ea95945921738ea0af042dafa6a92960458daec1f0d378b

Observation 6068e15d-7e0d-4aa9-ae6b-46132f95e96f · inbound

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation cites this paper.

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-01T12:04:39.821353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T12:04:39.821353Z digest=sha256:c9f0c52c3cc56ebf90e87fe88462b6d50783a65fc87679dcdee288fd3145b5fd