{"as_of":"2026-08-23T20:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fedd96721661f73900e16520590381124765102097985bd5072d0d5bb24c79d6","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:12:12.349149Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:34:35.053699Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T23:02:52.667737Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"cited_work":{"arxiv_id":"2506.08566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08566","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2506.08566","venue":null,"work_id":"cd04e37c-e6f4-42ff-bdf3-9608096a10af","year":null},"citing_paper":{"arxiv_id":"2508.09547","last_updated":"2026-04-29T01:36:59Z","snapshot_observed_at":"2026-08-11T15:57:30.241116Z","submitted_at":"2025-08-13T07:05:17Z","title":"GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T23:02:14.913189Z"},"links":{"cited_paper":"/paper/2506.08566","citing_paper":"/paper/2508.09547"},"observation_digest":"sha256:289bbe11a23deb2bc54b39b234598bad5c15aef548bc3860b62b22fd2f9bb8bb","observation_id":"134c4ef6-5447-4a21-bc5c-649dbd55a063","resolution":{"observed_at":"2026-05-18T23:02:52.670999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08566","snapshot_observed_at":"2026-08-14T04:34:35.053699Z","title":"arXiv preprint arXiv:2506.08566 (2025) 2, 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08596","last_updated":"2026-08-09T09:21:47Z","snapshot_observed_at":"2026-08-18T08:47:30.146792Z","submitted_at":"2026-08-09T09:21:47Z","title":"Goal-oriented Navigation Instruction Generation with Tour Video Priors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:34:35.053699Z"},"links":{"cited_paper":"/paper/2506.08566","citing_paper":"/paper/2608.08596"},"observation_digest":"sha256:783f63dfc6ecd86f4e9fbc96378cffcffea1a09168097d8c37268b0ba5d9a7aa","observation_id":"bbd2b0e3-7b33-4aa2-bc60-009a975a2a50","resolution":{"observed_at":"2026-08-14T04:34:35.053699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08566/citation-record","integrity":"/paper/2506.08566/integrity","json":"/paper/2506.08566/citation-record.json","paper":"/paper/2506.08566"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.021740Z","title":"Spatio- temporal dynamics and semantic attribute enriched visual encoding forvideocaptioning,in:CVPR,pp.12487–12496","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.021740Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:23df2f925a7c6f01d280d7d1ca2e117874ce5a008d43f5a5900fa05da9911714","observation_id":"4b4c694c-d47f-4296-a2a7-f1778dedafb3","resolution":{"observed_at":"2026-08-07T05:12:12.021740Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.027146Z","title":"Bottom-up and top-down attention for image captioningandvisualquestionanswering,in:CVPR,pp.6077–6086","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.027146Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:8f01a75c1bcd4cae369096a6edac8e79001d3ec1b781214e0d32dd090f1e9ba6","observation_id":"96807f12-72d1-4b10-ae32-2c537c85d637","resolution":{"observed_at":"2026-08-07T05:12:12.027146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.032305Z","title":"Vision- and-language navigation: Interpreting visually-grounded navigation instructions in real environments, in: CVPR, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.032305Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:6f374baf56fcb34456773126ef95d21752f11b841bd8a3fa0de97fa08c8e3149","observation_id":"eacef57d-aabb-412c-a4c9-80b3bdc53d23","resolution":{"observed_at":"2026-08-07T05:12:12.032305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5403.12254","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.067979Z","title":"NLTK: the natural language toolkit, in: Calzolari, N., Cardie, C., Isabelle, P","venue":null,"work_id":"0b6af80c-729c-4c6f-b9a2-666f8f5b242d","year":2006},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.036976Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:a05821099314ba71c30d05173f1d37d41d55654d7d4c9e666acff0da729c30eb","observation_id":"a2ccec0e-972c-4408-81c0-c0f9a75152c0","resolution":{"observed_at":"2026-08-07T05:12:14.075459Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.649797Z","title":"Matterport3d: LearningfromRGB-Ddatainindoorenvironments,in:3DV,pp.667–","venue":null,"work_id":"d7377aa4-d038-4a93-bd68-ca35573e11ab","year":2017},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.041272Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:ef9559d35499e4c87caae2714af68d0fca8e8fac387665be079d4edcd35f0da6","observation_id":"34cf6f45-2840-4dc4-8083-16501565f751","resolution":{"observed_at":"2026-08-07T05:12:14.654668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.050547Z","title":"TOUCH- DOWN: natural language navigation and spatial reasoning in visual street environments, in: CVPR, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.050547Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:9988ebb1abdb7342fd2dcfcafc057d4e7ada387c6ddaf5c3c592630da364a74c","observation_id":"9ac936c7-125b-458d-b108-78302e980c76","resolution":{"observed_at":"2026-08-07T05:12:12.050547Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.635708Z","title":"Historyawaremul- timodaltransformerforvision-and-languagenavigation,in:NeurIPS, pp","venue":null,"work_id":"09f7c4af-2fd1-4f09-8d8e-91836c658264","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.055232Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:1cf8f5467ae5970bc8a6491f82fffc405662141b2c6db2f1e8619349c4e4abc8","observation_id":"4c521f32-b680-4250-a58c-cdfd0af18af6","resolution":{"observed_at":"2026-08-07T05:12:14.641035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.059807Z","title":"Learning from unlabeled 3d environments for vision-and-language navigation,in:ECCV,pp.638–655","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.059807Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:4cd5d8e0c708dda5b5995f3d5ccab4e06e8545ce1606d975cb23c686ea3b5e2f","observation_id":"72778319-bebe-4dcc-9303-e3e108bda61f","resolution":{"observed_at":"2026-08-07T05:12:12.059807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.622796Z","title":"Unifying vision-and- language tasks via text generation, in: ICML, pp","venue":null,"work_id":"d37f697c-afc8-41cb-ab76-6a4ae08e9ac5","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.068175Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:bbdb170a0f7922519a096f346340b0b6b1b920efe6da4298a7594c16c284b946","observation_id":"4800851c-3b88-4622-9bab-b5fd9a8a98b2","resolution":{"observed_at":"2026-08-07T05:12:14.627226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.072754Z","title":"Auxiliary fine-grained alignment constraints for vision-and-language navigation, in: ICME, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.072754Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:d124911e863c01f0e734439e09a4707216bce8b3608f0d4c279389f57789d8c5","observation_id":"c0100153-0501-4fb7-a125-7fce788e1b16","resolution":{"observed_at":"2026-08-07T05:12:12.072754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.608830Z","title":"Meteor universal: Language specifictranslationevaluationforanytargetlanguage,in:Proceedings of the Ninth Workshop on Statistical Machine Translation, pp","venue":null,"work_id":"7c36eda5-3107-4b80-916b-42ec7e735cad","year":2014},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.081842Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:eb8b9b867d4d3f497cbd3b37d24a13ea962c1c0fbc5bd970e3e9235fd3857315","observation_id":"88915f0b-fdae-43db-8e09-6efb5b734a8c","resolution":{"observed_at":"2026-08-07T05:12:14.613994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/34.982903","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Visionformobilerobotnavigation: A survey","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"df9bc9bf-90fd-4aee-b1b2-6277220d6798","year":2002},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.090129Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:c1f824924abf3cb146eb3b79c8e4733f9d9c55e7cef4e1232621956233b8f066","observation_id":"e6f20fcc-cd24-44e8-b6f8-e65156778454","resolution":{"observed_at":"2026-08-07T05:12:12.517455Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.094146Z","title":"Aerial vision-and-dialog navigation, in: Findings of the Association forComputationalLinguistics,pp.3043–3061.doi:10.18653/V1/2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.094146Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:80a8e247a3cd0f22e978e05efbda91e5ae46dcf569564ddaaa76b736786eb8e5","observation_id":"ea206fc4-b2f1-43d0-9691-7a816cbfdb65","resolution":{"observed_at":"2026-08-07T05:12:12.094146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.13646","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Journal of Artificial Intelligence Research","work_id":"4028499f-8a41-470b-8d2b-5af4e0353ec7","year":2022},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.098369Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:e48cf71ea7f49fed55b191074b5b5434c7e77dad7a93918f6b193d00a85b02e3","observation_id":"8da7b90f-f272-4703-9169-ab8ce3500280","resolution":{"observed_at":"2026-08-07T05:12:12.495451Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.595367Z","title":"Speaker-follower models for vision-and-language navigation, in: NeurIPS, pp","venue":null,"work_id":"33e3eea2-0ebb-4817-b765-c02a3e973f23","year":2018},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.102791Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:498638809c99d4af180a5fd0e94d2be1007c5b06bf45489d799952ed78f35d80","observation_id":"3689e419-a13b-4ab2-b2af-a6f0384b1ffc","resolution":{"observed_at":"2026-08-07T05:12:14.599570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.111576Z","title":"Vision- and-language navigation: A survey of tasks, methods, and future directions, in: ACL, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.111576Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:1933286b5bf938778dfe5ffa5926d83152c0f23326826d0114d452dd2676b8d2","observation_id":"025a00c6-43d4-4456-aa90-5ecf5772357c","resolution":{"observed_at":"2026-08-07T05:12:12.111576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.582144Z","title":"Landmark-rxr: Solving vision-and-language naviga- tion with fine-grained alignment supervision, in: NeurIPS, pp","venue":null,"work_id":"c92e3ae3-6617-4d0b-982c-4edc75af9270","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.124012Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:1712d72a9d3eba36bc12dc3405526f3ce843593d6a0a871eb92108640191372b","observation_id":"752621a0-ee27-464f-9529-1c43697b88c4","resolution":{"observed_at":"2026-08-07T05:12:14.586568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.568223Z","title":"Lan- guage and visual entity relationship graph for agent navigation, in: NeurIPS","venue":null,"work_id":"8d54c996-f165-45b3-8810-eedfc0593eef","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.128097Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:b7af6328980f385c587ae63990a0f25cb0b10a79c64c9a92e4013aab72fec8d8","observation_id":"8d989065-f2ba-40ba-97dd-c59da456644d","resolution":{"observed_at":"2026-08-07T05:12:14.572587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.271","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Sub-instruction aware vision-and-language navigation, in: EMNLP, pp","venue":null,"work_id":"e3c09daa-1e97-4109-a8d3-a97a53fc12a2","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.132307Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:40d3c6f17cbfa194b0b2e5646839a1d1bc80adf6d27a08561bbc3394d1460c24","observation_id":"966cfa01-4b5d-4b6f-98cb-97e5af460351","resolution":{"observed_at":"2026-08-07T05:12:12.473819Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.136388Z","title":"VLNBERT: Arecurrentvision-and-languageBERTfornavigation,in:CVPR,pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.136388Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:6b5ce6379c763e937601e8174c377f94e1c0b4db7e042359fba29157938faf6c","observation_id":"5ea3fefe-2247-452c-847e-f97c09506236","resolution":{"observed_at":"2026-08-07T05:12:12.136388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.140285Z","title":"Transferable representation learning in vision-and- language navigation, in: ICCV, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.140285Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:7179c17453de1f846df760ca5f565ea028a7008d14a2bbbeef1f31f9e248ecfb","observation_id":"76cec562-f291-462e-a3fd-11258133fb05","resolution":{"observed_at":"2026-08-07T05:12:12.140285Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.149291Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.149291Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:fec911b5297a64e5945d7d67275f007ce4b7361ba064527b8f313072172835c4","observation_id":"d90a169e-7aca-4fc8-a8c3-7a16064af85c","resolution":{"observed_at":"2026-08-07T05:12:12.149291Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.554744Z","title":"Simple and effective synthesisofindoor3dscenes,in:AAAI,pp.1169–1178","venue":null,"work_id":"545533b0-250d-4e35-82f1-dc784f897e70","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.153917Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:da34f563941963276c1e108b3f9373f59a8dc9ad7bc8dcc0dabd5784dc57a8bf","observation_id":"aaae132a-7902-4e99-9330-79976e2d8237","resolution":{"observed_at":"2026-08-07T05:12:14.559165Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.01488","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:13.254382Z","title":"Waypoint models for instruction-guided navigation in continuous environments, in: ICCV, pp","venue":null,"work_id":"e47285b2-3cc0-469b-947f-ed6f24880725","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.161951Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:08b58417f9de6b2524ec1b1a95740d0545cccbc5200c90f17cf41d9b93cf3729","observation_id":"6057cf87-c913-48cb-8dda-9a4383e98b0a","resolution":{"observed_at":"2026-08-07T05:12:13.262137Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.540921Z","title":"Room- across-room:Multilingualvision-and-languagenavigationwithdense spatiotemporalgrounding,in:EMNLP,pp.4392–4412.doi:10.18653/ v1/2020.emnlp-main.356","venue":null,"work_id":"9c49c960-108c-4c1d-ae4e-db873f500c2e","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.167048Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:f4b65d59667c342d07d059502ed33f34a716d5c3c9e82273c3258c883c21bb8e","observation_id":"f1893db0-14cf-41a9-a385-1fb30c8d9fcc","resolution":{"observed_at":"2026-08-07T05:12:14.545422Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i07.6795","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Unicoder- vl: A universal encoder for vision and language by cross-modal pre- training, in: AAAI, pp","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"cab8205c-d11a-47a3-89dd-6749ef57b809","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.171799Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:65d892cee505639aca34fce374f95da8693ce64205ba71ac81b2029a159ec6eb","observation_id":"7cbc4aa2-365c-4f2b-842e-70b1e23089ef","resolution":{"observed_at":"2026-08-07T05:12:12.451747Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.527533Z","title":"Panogen: Text-conditioned panoramic envi- ronment generation for vision-and-language navigation, in: NeurIPS","venue":null,"work_id":"c8c89ccc-4e00-491d-972f-2463902882f1","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.175858Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:c9acbdfedecbdf0f2dcc8004273ed36dc57b343910007f33fc02292493d5eb53","observation_id":"8be528bc-5df8-494e-98d0-835d505db6f9","resolution":{"observed_at":"2026-08-07T05:12:14.532183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.184569Z","title":"KERM: knowledge enhanced reasoning for vision-and-language navigation, in: CVPR, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.184569Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:f3fe171d0a33465db2c4be7cf0f9733801b24b7bd41af2c41db52ac4c9a2508f","observation_id":"dac5984a-7651-4248-a27b-e5b54a09d0e3","resolution":{"observed_at":"2026-08-07T05:12:12.184569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.513894Z","title":"ROUGE: A package for automatic evaluation of summaries,in:TextSummarizationBranchesOut,Barcelona,Spain","venue":null,"work_id":"afc03a13-cc60-4719-bb87-b02c71d95592","year":2004},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.188385Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:ae9407ff28d2a2fb5867fab7972ee16491b8d9cf5a1fc6589d409a57fe51cfa8","observation_id":"214a6609-ca0c-460b-8f6d-37c8d98f1a0e","resolution":{"observed_at":"2026-08-07T05:12:14.518389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.192628Z","title":"Learning vision-and-language navigation from youtube videos, in: CVPR, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.192628Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:b14f91da83f1bae07f764a56de03143703a4737edb376fa937eea790f184d99f","observation_id":"f485b723-0a93-459b-837d-0e5adc672e0f","resolution":{"observed_at":"2026-08-07T05:12:12.192628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.501242Z","title":"Self-monitoring navigation agent via auxiliary progress estimation, in: ICLR","venue":null,"work_id":"511d6430-bf66-452d-b57f-8ec21388c3e2","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.200454Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:5591eb10d6c7e8155ce3b0d484d7457b0ea7fea1a0a276e030c9331cf67b76e5","observation_id":"8794a4ed-015e-4f2b-a699-0e8aee49458f","resolution":{"observed_at":"2026-08-07T05:12:14.505709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00689","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:13.173394Z","title":"Theregretful agent: Heuristic-aided navigation through progress estimation, in: CVPR, pp","venue":null,"work_id":"81743424-9e07-4426-851d-8cd36225b48d","year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.204524Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:654000bd7df398e6c42845ecf14c097bbba7f1d87c04aec70d675586d1da1893","observation_id":"65b1f3e3-261b-4320-9e2d-0ed0cfd45906","resolution":{"observed_at":"2026-08-07T05:12:13.181081Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.487807Z","title":"Improving vision-and-language navigation with image-text pairs from the web, in: ECCV, pp","venue":null,"work_id":"f2f6b696-5008-4077-9a72-50a9ee4d46fd","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.208375Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:f753c43ef53c0ef47b4c3c3dbb1db20484bb9384ae639676a4afa2bbac52f7d2","observation_id":"0187b010-9da3-4203-82d9-cbc16ca6e155","resolution":{"observed_at":"2026-08-07T05:12:14.492370Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.474006Z","title":"SOAT: A scene- and object-aware transformer for vision-and-language navigation, in: NeurIPS, pp","venue":null,"work_id":"79ca4330-fcde-4b38-b906-48e4c165e344","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.212340Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:1b97e29f84c5ec666f20f628b1a6cc249a769e8461e46bda65548372a646f3b2","observation_id":"d50d4463-a269-43cd-9579-b13975f35f18","resolution":{"observed_at":"2026-08-07T05:12:14.478509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.220240Z","title":"Bridging the visual semantic gapinVLNviasemanticallyricherinstructions,in:ECCV,pp.54–69","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.220240Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:b30c971dac4264bfdff7a2a47563759854b2e46923d9d94eb35f408046f840b6","observation_id":"9396e758-f39a-412f-bd9a-ccae3a5eaafa","resolution":{"observed_at":"2026-08-07T05:12:12.220240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.446299Z","title":"Teach: Task-driven embodied agents that chat, in: AAAI, pp","venue":null,"work_id":"4ab69444-7ffd-4455-8018-369a53361a1f","year":2022},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.224781Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:906d36a8343f56beb0875834b01ab5346467b77eaaa5b9d3ae0457ab0b2cb44e","observation_id":"b2052fa8-2f1e-4b64-8f95-d40c067ac602","resolution":{"observed_at":"2026-08-07T05:12:14.450898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.235094Z","title":"Bleu: a method for automatic evaluation of machine translation, in: Proceedings of the 40th Annual Meeting of the Association for Computational Lin- guistics, pp","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.235094Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:c9f1b43897c78d624be36feb7e92898bbecc540122577083a91c1df90c6ae4e4","observation_id":"88509fdc-81c0-4ebc-bac5-551fa243ac51","resolution":{"observed_at":"2026-08-07T05:12:12.235094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.432173Z","title":"The road to know-where: An object-and-room informed sequential BERT for indoor vision-language navigation, in: ICCV, pp","venue":null,"work_id":"28817cba-241b-41a7-8443-3826b9e6e934","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.239091Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:5ee83eabeb2af7df7997f2cdb7c8ab72e93d2a32835254f9df745f63b53deb78","observation_id":"661964f5-77b7-4b2e-9318-550233c04d4a","resolution":{"observed_at":"2026-08-07T05:12:14.436917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-58607-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Object- and-actionawaremodelforvisuallanguagenavigation,in:ECCV,pp","venue":"Lecture notes in computer science","work_id":"a23fc7fb-76cd-432c-837f-fd0d20e29fc9","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.247499Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:0ab9f6377bab71bd34b2fb0dd186d9456fee0d9b6bc59e31399637c94f5b3631","observation_id":"23b9ec66-062c-4738-82ce-742964fb1c6c","resolution":{"observed_at":"2026-08-07T05:12:12.419946Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.256573Z","title":"HOP+: history-enhanced and order-aware pre-training for vision- and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.256573Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:b3b3a36f6ae1771b153a3d55060a6a2cb7c7147b9659a9b4ece83d150d21e70d","observation_id":"2c28b650-edb2-45fc-bfd5-f82a69f624fe","resolution":{"observed_at":"2026-08-07T05:12:12.256573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.416381Z","title":"Learningtransferablevisualmodelsfromnatural language supervision, in: ICML, pp","venue":null,"work_id":"11b3df2f-daa0-4458-9abe-71424d177940","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.260608Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:b7e9dd9e4db3bb3561209de34fb8306903548ec4aaef0004a64d2c12849f3095","observation_id":"615a9ec6-fb64-4bf0-b055-d42276909213","resolution":{"observed_at":"2026-08-07T05:12:14.422608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.402543Z","title":"Towards long-horizon vision-language navigation: Platform, benchmark and method, in: CVPR","venue":null,"work_id":"2eab033c-1229-4e09-ac02-47cca2680b5b","year":2025},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.268752Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:c03b3ffefe89911326d0cbd2b6fecf41a6592217d43a869d0789a12f961034fe","observation_id":"0fea42e3-ee92-4f61-9f2a-ff3cf639a98c","resolution":{"observed_at":"2026-08-07T05:12:14.407526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.388438Z","title":"Contrastive search is what you need for neuraltextgeneration","venue":null,"work_id":"e595fa91-47f1-4d25-8634-f9181966356e","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.272856Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:a05377f5989ef83b8f949073c180a1d95427b54ce8ed18dcd0d91b82d8108f55","observation_id":"bb77a352-9934-4565-ae53-20ebda4ace23","resolution":{"observed_at":"2026-08-07T05:12:14.393190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1268","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Learning to navigate unseen envi- ronments:Backtranslationwithenvironmentaldropout,in:NAACL- HLT, pp","venue":null,"work_id":"f430e3fa-1191-4a86-8cad-f5177277dc09","year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.277578Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:7fce0af8d2246ce4b3797ef720e9d705305104d7ee23ec34a49b68b3d79857a8","observation_id":"aecb1bbf-1e92-4d93-933c-7851a130c470","resolution":{"observed_at":"2026-08-07T05:12:12.405485Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.374326Z","title":"Vision-and-dialog navigation, in: CoRL, pp","venue":null,"work_id":"d3754280-4cd5-44e5-a825-2a6c53cb9db5","year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.281829Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:62e0845c43fa869358d8fb2046a11133a7f992acd9297144ba141cbabeedd644","observation_id":"813c2439-0122-4ab6-935c-edc2581e9a80","resolution":{"observed_at":"2026-08-07T05:12:14.378885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.285974Z","title":"Cider: Consensus- based image description evaluation, in: CVPR, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.285974Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:c51233331ce7a08e143842d09d3c9bd430a7f8f2a4caf7fe92adccef0ec0f86f","observation_id":"fa53d099-7623-4a10-9e7a-de62d4e3d867","resolution":{"observed_at":"2026-08-07T05:12:12.285974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.290006Z","title":"Show and tell: A neural image caption generator, in: CVPR, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.290006Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:6967248bc2a28b25d77318ed5b306dabc674d9a7f9793cc9bd1112da73917596","observation_id":"04a3101a-bf63-467a-b49b-d5e2dec4bf35","resolution":{"observed_at":"2026-08-07T05:12:12.290006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.358664Z","title":"Soft expert reward learning for vision-and-language navigation, in: ECCV, pp","venue":null,"work_id":"70c2718b-ddeb-44a1-b2a9-1d650855dea5","year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.298071Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:45112633edb93dcab39f89242670b08ccac8c4b8a0b1bc860aca79bcb6782288","observation_id":"3ab685b3-0fb2-443e-b9da-57a4ddd0134d","resolution":{"observed_at":"2026-08-07T05:12:14.363551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.343337Z","title":"GIT: A generative image-to-text transformer for vision and language","venue":null,"work_id":"3286c898-540f-4a68-8238-fc60c76a1821","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.303260Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:e1a65ef32cb451f71e8cd2feeb763c142484376eb627b2cdfb5d1cab9622e8b6","observation_id":"225f25e8-056b-4056-9d25-f6a7a05c2bf7","resolution":{"observed_at":"2026-08-07T05:12:14.347964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.315853Z","title":null,"venue":null,"work_id":"f0d278a7-b27c-4c0f-ae17-262f23b5e639","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.311490Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:0dd15cdfe2c9d7de02558de1c347041baf5ba0ba95860bf1730e4e471b02041b","observation_id":"341561be-031f-4fea-af60-01fe927b83a4","resolution":{"observed_at":"2026-08-07T05:12:14.320063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.301784Z","title":"OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning frame- work, in: ICML, pp","venue":null,"work_id":"66b27334-8981-4c30-a360-96b27657583b","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.319606Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:3342bef1e72a821eecdaae6824758d175a489277f5116a3e0a89e63ddcb9b3e4","observation_id":"63c57a3a-3ba8-4d14-8b8f-16d07ccc25f9","resolution":{"observed_at":"2026-08-07T05:12:14.306372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.323819Z","title":"Less is more: Generating grounded navigation instructions from landmarks, in: CVPR, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.323819Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:fa666438879d1f439bf936479b501e58953a3f6154dcca938fe80931e18d84c0","observation_id":"0609499b-c5eb-4540-b01f-9e7fb8b15770","resolution":{"observed_at":"2026-08-07T05:12:12.323819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00679","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.747815Z","title":"Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation, in: CVPR, pp","venue":null,"work_id":"e191d063-7890-4696-af27-49f988aa6881","year":2019},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.327661Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:3150347fc8ecc3295be61320fc6e97cd433109fab4e5618dabbe50a16ee87878","observation_id":"9edd9f04-e220-4576-822d-f24e52c0f593","resolution":{"observed_at":"2026-08-07T05:12:12.756522Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.01826","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.670491Z","title":"LANA: A language- capablenavigatorforinstructionfollowingandgeneration,in:CVPR, IEEE","venue":null,"work_id":"df8a492f-3b72-42ea-8048-4d7ac5bf5c3b","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.331590Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:881f1534289dd7e01de1aca466305ebed86ccaa360faad244dd14503976a7a54","observation_id":"34bea04b-a9f1-4154-b860-46b8db0f2882","resolution":{"observed_at":"2026-08-07T05:12:12.677546Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.287221Z","title":"Show, attend and tell: Neural image :Preprint submitted to Elsevier Page 14 of 15 caption generation with visual attention, in: ICML, pp","venue":null,"work_id":"9710f336-868b-4b6d-a173-ae7eb22f2921","year":2015},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.336239Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:bf36b87c3ba5bf3cb61922e76a86658f50c7dde04f34d19a92f72f1d82205409","observation_id":"3ac4d94b-438e-41ff-acfd-bbfae8db2b06","resolution":{"observed_at":"2026-08-07T05:12:14.292112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.340247Z","title":"Unified vision-language pre-training for image captioning and VQA, in: AAAI, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.340247Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:487cd23005bdb6d1081430b7360997a43a79a84b5b8fc8b79bfe4c36a6c03a3a","observation_id":"d4d4cf0d-a8ac-4376-9cf1-1a02599e6059","resolution":{"observed_at":"2026-08-07T05:12:12.340247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.345285Z","title":"Vision-language navigation with self-supervised auxiliary reasoning tasks, in: CVPR, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.345285Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:6f3bce8470af5cf25c96f181224bcb1b48b3e27c937a24b01c3712ba7925d8f7","observation_id":"6babf70e-4066-4e21-8f4c-c977d6cd47cd","resolution":{"observed_at":"2026-08-07T05:12:12.345285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.349149Z","title":"Babywalk:Goingfartherinvision-and-languagenavigationbytaking babysteps,in:ACL,pp.2539–2556","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.349149Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:859e3248c236ef00e02e3b829a7a8ca45a36f4d8a7416e5dc8b1511ae92079e7","observation_id":"ca6b9874-9a29-4ed5-86d9-409884f01816","resolution":{"observed_at":"2026-08-07T05:12:12.349149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.085959Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":380,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.085959Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:15b0294ca3188f6a84891e3caa594a66150c4905641fba3c8e8a936f03a155d5","observation_id":"026645a0-97a9-4a3b-9725-f08d96dcf612","resolution":{"observed_at":"2026-08-07T05:12:12.085959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.045804Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":676,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.045804Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:1fbe5c4e291ab540f70c968104ba464bec06b3c23ca51b159b24eb9d4f2c2a1f","observation_id":"b910639c-c43c-4e4b-b389-5cbba8e5a53d","resolution":{"observed_at":"2026-08-07T05:12:12.045804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.243135Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":1644,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.243135Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:ae87b1bd5f82aeda0ba2ab9e0f5dfca5d5e23c1c8071a3cbdc6dfd8b9e6c1eac","observation_id":"cf621fab-ba65-4bc6-a139-d8eb16438d01","resolution":{"observed_at":"2026-08-07T05:12:12.243135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.329586Z","title":null,"venue":null,"work_id":"521f9925-7dc1-4d55-af94-7a05d93cc5e3","year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.307332Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:aa4d792e1f42ff85214def12d7b1db81f8765409a8d09feab26b388892f37607","observation_id":"538109e6-4675-4359-a24c-0044a6b7a330","resolution":{"observed_at":"2026-08-07T05:12:14.333845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.10748","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.823834Z","title":null,"venue":null,"work_id":"6b491218-ac93-458b-8042-c6657ab6e313","year":2023},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.315636Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:225f7626cfffb0961d458807f751309128b814278563772128a5b3462207ca6d","observation_id":"160a8a3a-27e1-40c4-bc54-ab34e3c7420b","resolution":{"observed_at":"2026-08-07T05:12:12.830343Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:12.229720Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.229720Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:1a613ca531e165181ddf5b27a2071cd9351baa3275be8438f26031bf61c22702","observation_id":"56374228-da84-4be0-885b-62f890fe8cef","resolution":{"observed_at":"2026-08-07T05:12:12.229720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:12:14.460333Z","title":null,"venue":null,"work_id":"76971512-d147-4e65-baca-95d661561ac9","year":2021},"citing_paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations","version":1},"reference_index":7367,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:12.216264Z"},"links":{"citing_paper":"/paper/2506.08566"},"observation_digest":"sha256:f006226bb081fda8cabc60e46c12c6bab77dcb7fedc68d7e1a10e34c2604a295","observation_id":"8fd95b62-9716-4c42-8769-55257bce25fb","resolution":{"observed_at":"2026-08-07T05:12:14.465023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08566","last_updated":"2025-06-10T08:36:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T15:09:54.897942Z","submitted_at":"2025-06-10T08:36:51Z","title":"Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":7,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":25,"verified_exact":10,"verified_fuzzy":21},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 2 inbound Pith citation observations for arXiv:2506.08566."}