Pith. sign in

Paper Citation Record · LEDGER

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation

As of 15 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2505.16663.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.16663 v1

Coverage vector

measured 86 of 86 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:02:57.418588Z

measured 87 of 87 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-08T08:43:54.882467Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T20:31:12.651566Z

Reference resolution

86 of 86 outbound references displayed

  • verified exact0
  • verified fuzzy27
  • unresolved58
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5459cc4b-f01f-431d-811e-70fa256f774c · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.185288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.185288Z digest=sha256:2694e05b2cdcebc4953d4e32ed32cd9f562938f3100a298ae33d2fe73cd8606f

Observation 6c700b45-057a-4f36-b138-e8092009fdce · outbound

This paper cites BEVBert: Multimodal Map Pre-training for Language-guided Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation BEVBert: Multimodal Map Pre-training for Language-guided Navigation

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.260957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.260957Z digest=sha256:45f6c36ee3a39fa0326edbe47a7d7fd3055a979672d01a0555c9066cfc4457ac

Observation 12a93b6a-2de0-4a3b-acf1-c122a90bddb8 · outbound

This paper cites On Evaluation of Embodied Navigation Agents.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation On Evaluation of Embodied Navigation Agents

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.314758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.314758Z digest=sha256:803daff9de8d7a0ffa8ff78e94f121e59a67101c87eb5be2b79b880675eb7050

Observation 0c0f15c6-d55d-4869-ab98-77d9bdbd8d80 · outbound

This paper cites Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.344432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.344432Z digest=sha256:b066395a535d6a786aeba6b074559045f9851a9b4f87ed0d0667fa6f9d764414

Observation 1c087e12-cdb5-48df-bb8d-3038b7c04819 · outbound

This paper cites Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.419818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.419818Z digest=sha256:e33bdb29e3e8f0cb8acdbe2388959f5a16f8e96cc8b3d7847da5d3b2a9048945

Observation 269d6139-cfc6-4f78-92ba-cf68da220b74 · outbound

This paper cites Scanqa: 3d question answering for spatial scene understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scanqa: 3d question answering for spatial scene understanding

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.497140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.497140Z digest=sha256:eed9f5c531bfbe596608e761953aee8719338ad472c4dace870530c0e95e15f1

Observation 35418d20-2502-485e-a488-1c4afad4e2b0 · outbound

This paper cites Curriculum learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Curriculum learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.571795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.571795Z digest=sha256:070d5b41411af9499c1f605fb816e25811601a3ab8ab77f9d679d22b289f265c

Observation 803644f5-5be0-438a-80f2-527e9f4bd7e2 · outbound

This paper cites Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.621725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.621725Z digest=sha256:b95777d00de6001b45c12a8f2f055a9469c575bdf4e9bd12684b0366bc6cd2e4

Observation 2b8ba055-c9ed-4467-9bd8-23b8b5020ee4 · outbound

This paper cites Matterport3D: Learning from RGB-D Data in Indoor Environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Matterport3D: Learning from RGB-D Data in Indoor Environments

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.671815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.671815Z digest=sha256:430fcf5d9410c6b12da75a9a08bb2cc7153a551e5c60a108f8aef55cefe209c5

Observation fca35d50-3a88-4a5c-97ec-fc333d96aade · outbound

This paper cites Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.739127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.739127Z digest=sha256:5e0a42ad691e7e4082149bf7738f7a1ec577de0dd09b148f46f62bb35171e845

Observation 21515a60-5e7f-4b5e-a449-37f90ce34a6b · outbound

This paper cites Spatialvlm: Endowing vision-language models with spatial reasoning capabilities.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Spatialvlm: Endowing vision-language models with spatial reasoning capabilities

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.818855Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.818855Z digest=sha256:cb47a510af5c86f1c0cdb07a4a75950bfb3b13b7388ae3367019fc5f95dd0e01

Observation 2b0cfe7a-0f67-4cca-bc1d-f10d121e586e · outbound

This paper cites Scanrefer: 3d object localization in rgb-d scans using natural language.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scanrefer: 3d object localization in rgb-d scans using natural language

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.889051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.889051Z digest=sha256:6777f0d66801a854cb7c348853d44bd68f5508ca1feb69292628ead7a102aa82

Observation 6f2a2215-a244-4ee0-a580-1a532f346492 · outbound

This paper cites MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:51.924774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:51.924774Z digest=sha256:4d8b5812c062c80df25a9e3e81ec2775a33a29a50f6c6e8b60041d7c52ab823f

Observation f7c8a17c-4d9a-43c2-adf4-dc0f4a8ade47 · outbound

This paper cites History aware multimodal transformer for vision-and-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation History aware multimodal transformer for vision-and-language navigation

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.991389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:52.010081Z digest=sha256:c4377b34f55b5909bcb835151cb72323b6137cca4b0d17ac0e3d52410376c2c8

Observation b9f94454-ca63-4994-813e-df88e8cea3a0 · outbound

This paper cites Think global, act local: Dual-scale graph transformer for vision-and-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Think global, act local: Dual-scale graph transformer for vision-and-language navigation

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.844366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:52.123638Z digest=sha256:ec1867f818512f9aba3a16deba806066fabf567686a697a00d05271d4f974223

Observation 1357fe32-c10f-44be-bd3b-b8bce7efd881 · outbound

This paper cites Microsoft COCO Captions: Data Collection and Evaluation Server.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Microsoft COCO Captions: Data Collection and Evaluation Server

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.215801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.215801Z digest=sha256:1518046b2a57dc34ceec6197dd5b6de3188d1ebd582bad0462bfad51ec0c0517

Observation c1477e4b-6647-4c5e-a97a-220f3527a3d4 · outbound

This paper cites Scan2cap: Context-aware dense captioning in rgb-d scans.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scan2cap: Context-aware dense captioning in rgb-d scans

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.544182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:52.260377Z digest=sha256:112e1cefee3936f0325257e59c7efe08d370d1af5142c887f4ee5b050995c0e6

Observation 293d8a3a-991d-4e9b-addf-4ada9f1f93d3 · outbound

This paper cites Gonzalez, Ion Stoica, and Eric P.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Gonzalez, Ion Stoica, and Eric P

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.408734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.408734Z digest=sha256:db25f5801d2f73f5ccbea112c17727b3fa4dc40652e67bcd7ce7ba24dcb9d236

Observation 2a60419e-8b42-47bf-b579-7db8a7d0aba5 · outbound

This paper cites Objaverse: A universe of annotated 3d objects.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Objaverse: A universe of annotated 3d objects

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:03.197958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:52.506412Z digest=sha256:6fb9aae9ab143438b28ed36685904487084722576de146e968e0c8bb5f6e123e

Observation 34b713a6-811b-4cee-9c1b-c4b1df398b0a · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Imagenet: A large-scale hierarchical image database

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.588652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.588652Z digest=sha256:fa9f713945efffe29ffad16edbe3abdd709f26156e1a8e6f8a88c611476c7b5e

Observation 01a671c2-f7c8-4748-8754-eabc42c1e184 · outbound

This paper cites Eva: Exploring the limits of masked visual representation learning at scale.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Eva: Exploring the limits of masked visual representation learning at scale

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.635057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.635057Z digest=sha256:e3bc739d5f8811090987e467489ecbb892e172a91985bd67355b3c2001e13bfd

Observation 8f8c0a50-ba21-4e3a-bbcb-6f25178918bf · outbound

This paper cites 3d-front: 3d furnished rooms with layouts and semantics.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation 3d-front: 3d furnished rooms with layouts and semantics

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.930641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:52.741654Z digest=sha256:7e61c025d6bdb10cb021302fb42a7e145f40f43909c78e67c7b6e426a2707ec3

Observation c3e6fa09-42b1-48d6-a78b-9321040f646b · outbound

This paper cites Adaptive zone-aware hierarchical planner for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Adaptive zone-aware hierarchical planner for vision-language navigation

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.636933Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:52.829184Z digest=sha256:d903cc62541925e528961ff685b619ab9da6e436c488658967a696f6e332cdd1

Observation 8a37d701-4536-4bbc-95f5-269a18e675c3 · outbound

This paper cites RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:52.927863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:52.927863Z digest=sha256:103a3d105203edfef7fce7d300e81851c8ad3e6d8dd5afdea46983259b2a18e5

Observation 04d85396-d76d-4cc5-b220-5ce55cc2b4be · outbound

This paper cites Multimodal fusion and vision-language models: A survey for robot vision.arXiv preprint arXiv:2504.02477, 2025.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Multimodal fusion and vision-language models: A survey for robot vision.arXiv preprint arXiv:2504.02477, 2025

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.009496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.009496Z digest=sha256:f4ccc5f8fcd2aeaa422da46c0c6f79280ebb54b857a7121a1274e98b04883c13

Observation 7bb2342d-17dc-43eb-af21-240b2d6ea61a · outbound

This paper cites Towards learning a generic agent for vision-and-language navigation via pre-training.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Towards learning a generic agent for vision-and-language navigation via pre-training

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.429755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:53.108941Z digest=sha256:d39f33cf3e60ec2599fd245d8a766b92ef61ba434e3469bf6f35673f4b31dce6

Observation 945ffac9-c13b-4e9f-a43a-5590ceba39b7 · outbound

This paper cites A recurrent vision- and-language bert for navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation A recurrent vision- and-language bert for navigation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.242691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:53.203928Z digest=sha256:87f79704842d8478a4b482e9fe595f0080369e479b7887fd511fa4da2a1f03cb

Observation ebe4c6f3-69ba-438e-ab30-7be0acdd0fa5 · outbound

This paper cites 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.285663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.285663Z digest=sha256:e9169bec653a973e79d356ebace063f40a1319197b6e558665f2bcb0dd7a5f09

Observation a22bf88d-733b-4dec-b1a1-caf9e420c007 · outbound

This paper cites An Embodied Generalist Agent in 3D World.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation An Embodied Generalist Agent in 3D World

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.415115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.415115Z digest=sha256:fba03de02e4c8acb2750a351f1a5be1b6fc6605415300cd694f68c0c0797840d

Observation a393671c-a2b7-4a59-a3e5-ecbc5f59fc4a · outbound

This paper cites Clip2point: Transfer clip to point cloud classification with image-depth pre-training.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Clip2point: Transfer clip to point cloud classification with image-depth pre-training

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:02.084162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:53.501102Z digest=sha256:dfc46b86349ad138e9623fcae2397fd55f137eabfbb67ffdc954e642e98d02f6

Observation fcb7fd77-45ec-4480-a47d-e56f92ab226f · outbound

This paper cites Autonomous multi-view navigation via deep reinforcement learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Autonomous multi-view navigation via deep reinforcement learning

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.867346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:53.567247Z digest=sha256:e2cd4bab8af7356522e5306648b895dd0cab487197831b71674882755abf26c4

Observation 43932677-81df-4f63-805e-e20b81389fa8 · outbound

This paper cites Meta-explore: Ex- ploratory hierarchical vision-and-language navigation using scene object spectrum grounding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Meta-explore: Ex- ploratory hierarchical vision-and-language navigation using scene object spectrum grounding

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.688902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:53.685550Z digest=sha256:eaaef140fab89c5da777604b242eb1d8e88c57069ff67bfca063a9a128768541

Observation af25ac1b-7f06-467f-806b-2c9379fe1297 · outbound

This paper cites Sceneverse: Scaling 3d vision-language learning for grounded scene understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Sceneverse: Scaling 3d vision-language learning for grounded scene understanding

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.758535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.758535Z digest=sha256:69e3e0415f77f571db0a3f62dc04a58e17df4d31cd24ec844766ea22855d839a

Observation bdcf0f27-bce6-4e8f-a9f5-070a8529295c · outbound

This paper cites Sceneverse: Scaling 3d vision-language learning for grounded scene understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Sceneverse: Scaling 3d vision-language learning for grounded scene understanding

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.505440Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:53.831877Z digest=sha256:2c70c0d74f52978dc66212e2a06dd3b450193364dd89f3b081d923bab1292f43

Observation a954ca17-1345-4920-bd16-b85d97a4781f · outbound

This paper cites Scaling up visual and vision-language representation learning with noisy text supervision.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scaling up visual and vision-language representation learning with noisy text supervision

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:53.937478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:53.937478Z digest=sha256:18505ddedde2a9492bdf8d70870b4b156d702b33e7e8275b6e67f8c265879162

Observation e0e30d26-ca0d-46fe-9392-3190ab0fa939 · outbound

This paper cites Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.043114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.043114Z digest=sha256:f308b4383498868ef902e949943d2f218c80da7b7b252f44432e47451d048f0c

Observation d20e5b75-bab7-4ef4-9a68-037ff399b8a2 · outbound

This paper cites Segment anything.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Segment anything

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.120341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.120341Z digest=sha256:446792bf4d21095ba2bcb2c6e81bb4723c6625a61cf21011c9d48fd06e85996a

Observation 4bc65567-79f4-4e10-94cc-e9eb979b0e76 · outbound

This paper cites AI2-THOR: An Interactive 3D Environment for Visual AI.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation AI2-THOR: An Interactive 3D Environment for Visual AI

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.284021Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:54.184933Z digest=sha256:1345cfbfb68a065e2e147b6b5d0bd3d8bd8f9f4e5aea83e4d7e62922e03385e2

Observation 78900ee0-bd7e-4085-9648-01d4a981d002 · outbound

This paper cites Room-across-room: Multi- lingual vision-and-language navigation with dense spatiotemporal grounding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Room-across-room: Multi- lingual vision-and-language navigation with dense spatiotemporal grounding

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:01.072714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:54.298479Z digest=sha256:99b8b6300ce911fd372f6d1377dd2fe74f6bb337c2548b34d3c34f39514543ed

Observation 7eb2eab1-cb88-453f-842c-e7bec29be4ea · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation LLaVA-OneVision: Easy Visual Task Transfer

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.343393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.343393Z digest=sha256:4b534a70e231508163f65acb797de3bf5d95729b88b40bb31c629697661e5084

Observation bb9ee419-1261-45a5-b399-c5dfc8e61bb8 · outbound

This paper cites Improving vision-and-language navigation by generating future-view image semantics.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Improving vision-and-language navigation by generating future-view image semantics

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:00.734874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:54.392246Z digest=sha256:cfce0170af260dcc814b5c0aad0660f55a20a7d3065a754fa99ec642daa3e232

Observation dffb12bc-4341-45b1-9b24-967f6df9bf54 · outbound

This paper cites Robust Navigation with Language Pretraining and Stochastic Sampling.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Robust Navigation with Language Pretraining and Stochastic Sampling

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.518793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.518793Z digest=sha256:0f290eb99bde3a71b9d78a93b737f4405c8358c468d0039ee6f7ec72ebd0a660

Observation 513df580-b561-427d-95e7-6f93dc7e7ac1 · outbound

This paper cites Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal trans- formers.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal trans- formers

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.606364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.606364Z digest=sha256:f229bcbec0eacc8311d76160add59acf81a59699449b6057f9577c6f7673bbb9

Observation b5be0337-f724-48f5-88e7-cc05dbf5631a · outbound

This paper cites NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.730369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.730369Z digest=sha256:d5a496802df9a97fa4f6f5326f95e4b7256cb5d6467434cb1e639942f54dd267

Observation eea42581-97ad-4948-bbf0-ed86b64c3015 · outbound

This paper cites Multi-modal situated reasoning in 3d scenes.Advances in Neural Information Processing Systems, 37:140903–140936, 2024.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Multi-modal situated reasoning in 3d scenes.Advances in Neural Information Processing Systems, 37:140903–140936, 2024

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:00.507302Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:54.843610Z digest=sha256:1640b0db8ce1fa3b22c303dd1206673752c7710eaf5994842eaac92bfa0c2c57

Observation 6b4cd09e-bffe-469e-bfa5-600ef92525bf · outbound

This paper cites Visual instruction tuning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Visual instruction tuning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:54.959535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:54.959535Z digest=sha256:c4daf73997ff8fefe1e8d7f4054662f1ee349b7d5a8cfcacfd25a3ff24ab289e

Observation 8811b094-3f3b-4112-9130-55fdf1125a18 · outbound

This paper cites OpenShape: Scaling Up 3D Shape Representation Towards Open-World Understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation OpenShape: Scaling Up 3D Shape Representation Towards Open-World Understanding

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.038554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.038554Z digest=sha256:7fdf329e623a11a5fad518552220c0a6ec74bce0c32e9b380d531ed453b198c9

Observation 3b30f639-bbbb-4e5b-988e-95098dab123c · outbound

This paper cites V olumetric environment representation for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation V olumetric environment representation for vision-language navigation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.084452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.084452Z digest=sha256:d3d3b64247d30dca161bbd64a61f69fdb005f8b78f516072adebbadf41fd833c

Observation 9d876afb-d19d-47d0-8fee-60ffbdbfc0b0 · outbound

This paper cites Bird’s-eye-view scene graph for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Bird’s-eye-view scene graph for vision-language navigation

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.166727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.166727Z digest=sha256:aca7a42efa72e7fba1a69431b31ea0870294aa03ec6b274f18072a9355b76655

Observation 9e538cdb-bffd-470c-9f79-f7afbafbb1fe · outbound

This paper cites Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.250115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.250115Z digest=sha256:c72bdd246ce183bad950b169d1d0e25c731a98fc3a4584b59ba16b1adc57fad6

Observation 39a03453-711b-451a-9ffe-65d72760c4bf · outbound

This paper cites Scalable 3D Captioning with Pretrained Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Scalable 3D Captioning with Pretrained Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.319386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.319386Z digest=sha256:92667cc386c59eb33d360a3075d31860c95dd4e2862088b5f043bcccaade6408

Observation 3037b647-cbac-4793-bddc-87e095cc4d53 · outbound

This paper cites SQA3D: Situated Question Answering in 3D Scenes.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation SQA3D: Situated Question Answering in 3D Scenes

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.344695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.344695Z digest=sha256:0a33a7fa47da027501b3d0fd139feb8db071922b01bb54c0aaa0af25d952222f

Observation a34b8f07-52a7-4db5-91ca-7ef4906dd1ca · outbound

This paper cites Reverie: Remote embodied visual referring expression in real indoor environments.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Reverie: Remote embodied visual referring expression in real indoor environments

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:03:00.243568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:55.378789Z digest=sha256:71c4306535dc29fe4aa6f3409619503bf70103424d44116d47368f8e03712fb9

Observation 51a4544e-e0be-467d-9cd5-b42f849b1292 · outbound

This paper cites Hop: history-and-order aware pre-training for vision-and-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Hop: history-and-order aware pre-training for vision-and-language navigation

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.950328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:55.423524Z digest=sha256:aeeb1e5d83309ff581e8cf26dd055ba8c073d6600725c2305d5f3e7690d863c7

Observation 958ec0a8-02da-4144-99e3-c054ce7e8077 · outbound

This paper cites Vln-petl: Parameter-efficient transfer learning for vision-and- language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vln-petl: Parameter-efficient transfer learning for vision-and- language navigation

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.759122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:55.482511Z digest=sha256:44627d70a45846a32f43e08a349329db8615e788e692e0a44623b2374a961f7e

Observation 47a8587d-5d42-479a-a22c-05576ebd4d3e · outbound

This paper cites Learning transferable visual models from natural language supervision.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Learning transferable visual models from natural language supervision

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.550229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.550229Z digest=sha256:2078f1343ec037ee810f1163254b11053ea379d4743e972e6122df6a99df7ebc

Observation bd7a9f9c-1ecf-4663-ae8a-5e18124ef717 · outbound

This paper cites Learning transferable visual models from natural language supervision.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Learning transferable visual models from natural language supervision

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.622544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.622544Z digest=sha256:99eb28894dc0532ea593113982ce9a77d7bff37083e4995079b6a31a6a62f5ed

Observation 302d6f8d-62f5-45df-91b4-7d7f05f7f5e7 · outbound

This paper cites Habitat: A platform for embodied ai research.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Habitat: A platform for embodied ai research

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.670785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.670785Z digest=sha256:742ae16cbc12a960e9f1005a8e8008a644d5e88e78e0099e6697dbec4d3595e1

Observation b3ee603e-a914-4208-9194-6aeaa7e779f5 · outbound

This paper cites Semantic scene completion from a single depth image.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Semantic scene completion from a single depth image

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.765185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.765185Z digest=sha256:61850501b06d639c9a2814c2084ff63bfe43e4f44018759ee89abeec4059b670

Observation 66e45730-928f-43b4-b4fd-a3a493cb5495 · outbound

This paper cites Learning to navigate unseen environments: Back translation with environmental dropout.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Learning to navigate unseen environments: Back translation with environmental dropout

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.516923Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:55.839671Z digest=sha256:4a87babe4b635f97fcd61059e7067e585405475b9394b2ccca4659a191d80441

Observation 076ef3af-9947-4f6e-b23d-fc4488f3a57b · outbound

This paper cites Vision-and-dialog navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and-dialog navigation

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.914360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.914360Z digest=sha256:91d689b258d20c6f23154493c3f3ed72332c7867963100b9a34a8e1b627ccfb6

Observation d045a787-7259-4359-afa1-8b656c83d47e · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation LLaMA: Open and Efficient Foundation Language Models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.941109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.941109Z digest=sha256:165576ed67267c2203b9fe3eac2e593ee604225fdf8bd55d5054d089d0246957

Observation aa6e9eed-72ef-419c-a719-81667f724bcd · outbound

This paper cites AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:55.975100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:55.975100Z digest=sha256:d312c131d11f8efd56db6097d5ff305f316dcfeab4df5e7328139f122f4d0992

Observation afd67ae2-3246-4ddc-8d81-79f2a81fb221 · outbound

This paper cites Vision-and- language navigation via causal learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Vision-and- language navigation via causal learning

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.429379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:56.046968Z digest=sha256:5b3ae3cd933b0c287a03f1ef69243e15656588f0593347dde3b756aea61abfcf

Observation 26942c5b-6d93-49d4-af6d-3aa246475cad · outbound

This paper cites Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.285204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:56.103033Z digest=sha256:d64da96d78014e3b4915d9c403b591bc052298d2edbf8bbfc565985b58705a5f

Observation 976f3e18-4513-4f5e-8e84-88fb1b95bcdc · outbound

This paper cites Lavie: High-quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 133(5):3059–3078, 2025.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Lavie: High-quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, 133(5):3059–3078, 2025

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.158555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.158555Z digest=sha256:3fe0c571e2708cf2a1c6260e6f429383abaa348401c7080d682d6b4e2bdb21ea

Observation 27644782-d99f-41e0-a703-7a8c054e9aad · outbound

This paper cites Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.212288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.212288Z digest=sha256:73dfb500ca988f2fde5671367c842474afab406dc26cd844db0667da57751b59

Observation 2e025e17-6005-4031-aaf7-5bfc60d352e3 · outbound

This paper cites Florence-2: Advancing a unified representation for a variety of vision tasks.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Florence-2: Advancing a unified representation for a variety of vision tasks

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.251215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.251215Z digest=sha256:287554de0d674eab2569838440c21de268057ad715d622ee80cb6c76f2c5f1ee

Observation 1477c5e8-bb0c-4272-badf-9fd57709601c · outbound

This paper cites Pointllm: Empower- ing large language models to understand point clouds.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Pointllm: Empower- ing large language models to understand point clouds

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:59.086795Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:56.310794Z digest=sha256:aa6c887de92da658c7fb66f82816c8783b602f918c519d5467025a2046e1cca4

Observation 422e44f8-b0a7-4e5e-99c4-8d8709d1186e · outbound

This paper cites ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.370114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.370114Z digest=sha256:5c3d2eae62cafc01e961e293a8f5b8c562c13c703f94bb5a6fe4cf51aee34905

Observation 106edb86-96d0-450b-83fc-9fbad3d7fc30 · outbound

This paper cites Qwen2.5 Technical Report.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Qwen2.5 Technical Report

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.429483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.429483Z digest=sha256:02510ad11f417ae391b5f80802c4678079c65333a86111f7d8a32e6e4c3468b7

Observation 902165a0-6a26-4d05-ae92-bfeb755b600c · outbound

This paper cites 3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation 3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.480933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.480933Z digest=sha256:333df7801830e418444daa31e1967b36044e76fe49613eaaacf1fb2c431f45da

Observation eea5d638-352e-4d7a-8c91-2a6825f9a949 · outbound

This paper cites Point-bert: Pre-training 3d point cloud transformers with masked point modeling.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Point-bert: Pre-training 3d point cloud transformers with masked point modeling

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.911781Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:56.514641Z digest=sha256:5630e80bf7acb061764a9459d73a1f8e4b21281f438a9fbcfdf5d9f7b926b84f

Observation 131b30e5-3f36-454d-af67-ee9aac0ad72e · outbound

This paper cites Mlink: Linking black-box models from multiple domains for collaborative inference.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(10):12085–12097, 2023.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Mlink: Linking black-box models from multiple domains for collaborative inference.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(10):12085–12097, 2023

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.727189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:56.548869Z digest=sha256:882c457b043fb8bbd18b135deba2c90b1ef9bf60e5b61dfa857e4e7dd5694ec1

Observation f6907c81-9cf6-4ae2-881f-95d685a14dfc · outbound

This paper cites Building Cooperative Embodied Agents Modularly with Large Language Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Building Cooperative Embodied Agents Modularly with Large Language Models

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.636374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.636374Z digest=sha256:58b0dade0ce59b7aebf3512f407cb8b34f1556778c12e5ee09919a863cda62f2

Observation 678618de-b9a8-4866-abe3-7a1395ba1550 · outbound

This paper cites Agent journey beyond rgb: Unveiling hybrid semantic-spatial environmental representations for vision-and-language navigation.arXiv preprint arXiv:2412.06465, 2024.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Agent journey beyond rgb: Unveiling hybrid semantic-spatial environmental representations for vision-and-language navigation.arXiv preprint arXiv:2412.06465, 2024

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.710272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.710272Z digest=sha256:168d6f21c3b759983e2a954b2fe8d112ab93e7913f11f926e6a59116c872af48

Observation bf6a3967-dc8c-4814-90ad-81b871184152 · outbound

This paper cites Meta-Transformer: A Unified Framework for Multimodal Learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Meta-Transformer: A Unified Framework for Multimodal Learning

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.782916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.782916Z digest=sha256:4363dc9432b085eeb1945196b7b3743cd541698274ca7cc7f5aa69d41d4620d6

Observation 5cadbb87-d677-46db-b1a3-8baf2fd7fd94 · outbound

This paper cites Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.837386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.837386Z digest=sha256:356920e2cc82307554539e56ec003e3f2a55b0969bfeeb1acc89bf9f4a030ab3

Observation 17b84147-d9cf-4f34-80d0-cad22a36a9f8 · outbound

This paper cites Towards Learning a Generalist Model for Embodied Navigation.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Towards Learning a Generalist Model for Embodied Navigation

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:56.931400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:56.931400Z digest=sha256:0b1b7c32eab409c97f89d807290146028e51967c84a4e5c4a5eba34db43ea062

Observation 0f462e98-b543-4ac2-a80d-5ded14db671b · outbound

This paper cites Navgpt-2: Unleashing navigational reasoning capability for large vision-language models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Navgpt-2: Unleashing navigational reasoning capability for large vision-language models

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.010269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.010269Z digest=sha256:c2d06969c1bf508c47da89947cfcc811dd425aae7a61894c1dc5ba3bfd4ceb93

Observation 3c0940b1-eda1-4b47-a4c7-ed158560e9fa · outbound

This paper cites SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.087390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.087390Z digest=sha256:cdb6d5805f7e7d236f03ef0fe717c41db75dd7f5f718d217cc2db15f6f46f7dc

Observation e2404d4a-54b4-47ff-aaef-83b712f96928 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.129651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.129651Z digest=sha256:0b796022ba780c1fede6c71d956a7d1c6406ddb15687d2ea4e935114ea16b5ea

Observation 46cea761-e513-4aba-9b82-c784db7a1807 · outbound

This paper cites Soon: Scenario oriented object navigation with graph-based exploration.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Soon: Scenario oriented object navigation with graph-based exploration

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T15:02:57.204785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:02:57.204785Z digest=sha256:f7f4cdb1e6388199c664e20cd1d6c86e8d3473bd84f27e26579590354693203e

Observation 78805592-6493-44e1-a65a-4e3a85ed4905 · outbound

This paper cites Pointclip v2: Prompting clip and gpt for powerful 3d open-world learning.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation Pointclip v2: Prompting clip and gpt for powerful 3d open-world learning

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.547607Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:57.278766Z digest=sha256:d18f8e062478ad9aa15babe7f936bcbc0cf679c38b7fb5ad4714705ca84e6991

Observation b5278fdf-86ba-41b1-946f-243abdc0dc2a · outbound

This paper cites How would you interpret this3D point cloud?.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation How would you interpret this3D point cloud?

Reference 85

Resolution
malformed identifier
raw_fallback, observed 2026-08-07T15:02:58.380329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:57.359393Z digest=sha256:90acadd8e4c18a3c5b89cc4e1dac2e1482cc0e9587f86d687bc2865ac295ba17

Observation 4a9188a2-cffd-42bb-8cfb-ea7d60013eeb · outbound

This paper cites We express our deep respect for the contributions of the developers and researchers who have made these models and datasets available.

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation We express our deep respect for the contributions of the developers and researchers who have made these models and datasets available

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:02:58.266308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T15:02:57.418588Z digest=sha256:1c472470e47890b59ef9f97d922fd7196ec40ab5b0a063d64d91f6781daa34cb

Pith citing papers

Observation c130f979-6912-4589-845e-75488568ee75 · inbound

Cross-Modal Navigation with Multi-Agent Reinforcement Learning cites this paper.

Cross-Modal Navigation with Multi-Agent Reinforcement Learning CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:31:12.658956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-08T08:43:54.882467Z digest=sha256:df12e149b6fa83a8bbbdaaa9224bbcf412d922511fd6cc6dc98ae3ecb6b1d3d1