{"as_of":"2026-08-10T13:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e1cea9d3f5189bf51ca2a8c463969807de064756e6cc680ef36001614ecab17","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:26:43.437116Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10894/citation-record","integrity":"/paper/2507.10894/integrity","json":"/paper/2507.10894/citation-record.json","paper":"/paper/2507.10894"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.490571Z","title":"A survey of embodied ai: From simulators to research tasks,","venue":null,"work_id":"3d2ceada-6318-447b-907a-8dc9eccc44b5","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.385842Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:c8dbbd13f8dc7e1a5ad47294d57bf48991241803480757aebfd012e30c7a9b4d","observation_id":"067f3fef-cfd5-4b9b-914a-1a43d89c144b","resolution":{"observed_at":"2026-08-06T17:26:44.494005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.481709Z","title":"Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation,","venue":null,"work_id":"39189dd4-67ac-4044-998f-62ffbfbb6063","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.447109Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:725716c4dda0e78ee3deec4ab30591e6f685d994a359aa7b51f25714dd6fa3e8","observation_id":"a740e2b8-e30e-4bd1-8417-2c33ac260644","resolution":{"observed_at":"2026-08-06T17:26:44.485004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-06T16:04:56.349386Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-06T17:26:37.507750Z","title":"Aligning cyber space with physical world: A comprehen- sive survey on embodied ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.507750Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:68ddeaa4b48d2cad7be0aca4730798160a572e624f9c251e30178c53c04f1b9a","observation_id":"c84f1d60-1240-4862-8b95-285523181373","resolution":{"observed_at":"2026-08-06T17:26:37.507750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.472809Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,","venue":null,"work_id":"b410f80d-5fc2-4f95-a9f5-5299423c90e4","year":2018},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.597645Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:447039fbfa1cc34bb94159b4244b30e2f660d11f89c21688a993659900e96dc9","observation_id":"d95ca566-acea-41bd-a67c-56d81f7d35c0","resolution":{"observed_at":"2026-08-06T17:26:44.476143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.462616Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding,","venue":null,"work_id":"25fd02c0-b8c6-48c6-bab7-8abacccc94e4","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.642304Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:1d05706954ba485edd992aa9db74d4f1aee24e7e0df48fc0a7c8b11625cea07c","observation_id":"08615390-332c-426b-a2cc-25b031ee047f","resolution":{"observed_at":"2026-08-06T17:26:44.466733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.453002Z","title":"Talk2nav: Long-range vision-and-language navigation with dual attention and spatial memory,","venue":null,"work_id":"7a39c35d-dccc-4122-add0-fd4a446e6d37","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.732340Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:250b3f2ad3de3f9fbeb32016ac756cefbedc877c55f579159808e8faee4bddd7","observation_id":"320f098a-a661-45fd-9ce5-b5d5716e3908","resolution":{"observed_at":"2026-08-06T17:26:44.457258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.444106Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments,","venue":null,"work_id":"7d00b8d9-d491-4b46-be47-b8ac2c4428e1","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.821615Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:135054a87e96acdb782eea43313f3e7119f49187372e23661408a636f22443ed","observation_id":"3fd76607-44a9-47e8-b314-11137f882b18","resolution":{"observed_at":"2026-08-06T17:26:44.447485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.434825Z","title":"Speaker-follower models for vision-and-language nav- igation,","venue":null,"work_id":"096044d6-4dc9-464e-ae11-8985e1134fd5","year":2018},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.926692Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:f21c78ab6f507b85c6e60a806fc3882e82a22758e1503f74eca963fc6bc52710","observation_id":"79b91aaf-2067-483d-9252-0e4951e56f13","resolution":{"observed_at":"2026-08-06T17:26:44.438579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.425652Z","title":"Learning to navigate unseen environments: Back trans- lation with environmental dropout,","venue":null,"work_id":"2c10bb04-1ee9-4d10-9336-a1cd734025e4","year":2019},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.019873Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:404190849cc9fc9fc30e1efeb2e3b7d0cb4c3f83362a327553be747db00b82c3","observation_id":"e7b3cd13-b28a-4c39-ac02-363b48101623","resolution":{"observed_at":"2026-08-06T17:26:44.428820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.416195Z","title":"Visual landmark selection for generating grounded and interpretable navigation instructions,","venue":null,"work_id":"8caef496-e40f-49c4-9db4-0f115d410dec","year":2019},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.083529Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:d866cb4b767cfb439d9fe896128627945237694ffa9ed760e3544e72afbdd108","observation_id":"2f3b20a6-0499-4de2-ae3e-cef0c369a98f","resolution":{"observed_at":"2026-08-06T17:26:44.420060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.407058Z","title":"Crossmap transformer: A crossmodal masked path transformer using double back-translation for vision-and-language navigation,","venue":null,"work_id":"8d0ae607-1cd0-40c6-8998-a8b64fa55611","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.155998Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:1f7ed06fb813fadf85a446d51e238c5c4c021c847471449ab00c4e673f09bdec","observation_id":"86a5f0cd-6322-460f-b3e6-7fc111e24d61","resolution":{"observed_at":"2026-08-06T17:26:44.410397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.398157Z","title":"Improved speaker and navigator for vision-and-language navigation,","venue":null,"work_id":"966f4d72-2d1e-42b2-87bb-4be902ad80ee","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.239153Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:da344818210ea6b2ebe6171b96c0f0902a7c68585ecb80636903edc4e779ba41","observation_id":"f84da2ac-b995-4950-8876-1ebac4b38a3f","resolution":{"observed_at":"2026-08-06T17:26:44.401744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.389431Z","title":"Res-sts: Referring expression speaker via self-training with scorer for goal-oriented vision-language navigation,","venue":null,"work_id":"df5e0e65-d69d-4181-a595-4794e323f7ec","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.295300Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:f0ddfb970856550b38cbad708bdf291714dc457bfbce7ebbf4f635ab64fecf7c","observation_id":"0c5fa32d-cc31-4fe4-a8e0-f6298bde3b1b","resolution":{"observed_at":"2026-08-06T17:26:44.392673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.378203Z","title":"Touchdown: Natural language navigation and spatial reasoning in visual street environments,","venue":null,"work_id":"88f4478a-08c4-4467-8c20-7761bfabd745","year":2019},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.367875Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:c19203679ff5310d379a951ee4ca6f7da36edebb00e571c990573e8e00b6af67","observation_id":"a0c9bbcc-6905-443c-a24a-1dcc90d9ed0e","resolution":{"observed_at":"2026-08-06T17:26:44.381772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.369434Z","title":"Vision-language navigation with self-supervised auxil- iary reasoning tasks,","venue":null,"work_id":"bfa67fb0-dae8-4d55-97a0-198f2094ebf5","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.452079Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:cc3beb7d85ca6756dca2f6cd49d3e26fa9bd2088867e3d14e0d9b004d9b1e54b","observation_id":"6a7ef5d2-e715-423b-8567-3ba1fa884db6","resolution":{"observed_at":"2026-08-06T17:26:44.372815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.360189Z","title":"Towards navigation by reasoning over spatial config- urations,","venue":null,"work_id":"b0e6817d-69f7-4b6e-9050-150823078cd4","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.554838Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:158890b005d4567012f929adf30346ed1cd7b57076760494be24fe6e90456d9c","observation_id":"1eb139da-2ee3-49ec-85ea-c8e94ab8b33b","resolution":{"observed_at":"2026-08-06T17:26:44.363650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.351182Z","title":"Language-guided navigation via cross-modal ground- ing and alternate adversarial learning,","venue":null,"work_id":"7a77e6fa-07e6-4cd6-874b-79491d5f78a8","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.609153Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:e0e6c61572b4e112e052d4d168edea734b23515f1f4ba573dab33b9ab403bf8c","observation_id":"34f7b84e-9f1c-4bf3-ac1d-e560385cd547","resolution":{"observed_at":"2026-08-06T17:26:44.354831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.341152Z","title":"A dual semantic-aware recurrent global-adaptive net- work for vision-and-language navigation,","venue":null,"work_id":"cbd995ca-4405-4e53-a4c5-f042c94ca803","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.716252Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:3d4c405c6eab597dc08b1b434f14cb12fa54373c21ecf87fd957db0a17c71076","observation_id":"21b5f186-52d0-4f3a-990a-1bcc4428e6e2","resolution":{"observed_at":"2026-08-06T17:26:44.345561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.332686Z","title":"Vision-and-language navigation via causal learning,","venue":null,"work_id":"82d5a81b-3add-45d0-9472-68f080fc6e0d","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.796758Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:afcb616db3830cde2f3e4a413e1f526038bcef8f0a6efdda9b527d77f2e6cb9f","observation_id":"007a28bd-c66b-4057-9f25-ab84b9db3c2a","resolution":{"observed_at":"2026-08-06T17:26:44.335692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.323262Z","title":"Waypoint models for instruction-guided navigation in continuous environments,","venue":null,"work_id":"d672a237-27e5-423d-b258-99b28f3ea1bc","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.871862Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:0e894ddd1372df5d4bbef4e0fa749c34707e9316047d05c758c8b678320229a1","observation_id":"bcacd41b-15ed-4c7e-8901-c55c2688cf0f","resolution":{"observed_at":"2026-08-06T17:26:44.327313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.314360Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation,","venue":null,"work_id":"f7a2caf4-f0f2-4711-87bf-c212d9dbed21","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.964356Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:7afeec1793a488be99359c10c75c78e0e6c6110500113f232a075dec68a00540","observation_id":"eec50d35-4578-4d91-bbad-ed303647c806","resolution":{"observed_at":"2026-08-06T17:26:44.317948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.305376Z","title":"Instruction-aligned hierarchical waypoint planner for vision-and-language navigation in continuous environments,","venue":null,"work_id":"744385e3-415b-4d31-b7c3-adb3e1d094b2","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.031354Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:b3d53cbdc705665e75d5c0c1dbc561f7a3fa32c6dc0630b2e78dcf36e3dacfa4","observation_id":"fcf4d2f5-53ea-4e97-923c-2184a576ffa8","resolution":{"observed_at":"2026-08-06T17:26:44.308510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.296280Z","title":"Improving vision-and-language navigation with image-text pairs from the web,","venue":null,"work_id":"1a3c3b79-662d-4bbe-9664-4bdcfd967744","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.088275Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:0285653cb84474f1a7da2e0e25320373a38d0c6e59a39f48e3fe502dfa36f4c6","observation_id":"8ddd9a38-05e6-472b-add2-8ea5728405b9","resolution":{"observed_at":"2026-08-06T17:26:44.299440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.287313Z","title":"Vln bert: A recurrent vision-and-language bert for navigation,","venue":null,"work_id":"29128941-7f56-4e8a-89ee-0fd026cde8b5","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.181868Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:e1f54bcd51ec7b22b563a483f10a94d8e60817e2da47916d013b878b488f639c","observation_id":"b6dd2d05-fc7a-4002-85c8-3741ea750657","resolution":{"observed_at":"2026-08-06T17:26:44.290467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.278676Z","title":"Think global, act local: Dual-scale graph transformer for vision-and-language navigation,","venue":null,"work_id":"bb6c4da6-a227-4534-8c0e-d72400668c81","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.255109Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:da60e87d1b92b9d7eb9faca1de913f047e1a0ef9df949bd7a239cd0ccc2ec4da","observation_id":"8f05ce81-8683-43c7-bc49-de2b6baf70ba","resolution":{"observed_at":"2026-08-06T17:26:44.281913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.269729Z","title":"Multimodal evolutionary encoder for continuous vision- language navigation,","venue":null,"work_id":"3011f94b-1759-4ec7-ab99-fdb68bd9347e","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.371677Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:399af8edc7a111f29a68c4968e0e70a818ab95b3921e6b0de087ee7e312565a3","observation_id":"fcbc33e1-5ace-47b3-81b0-fc401782c2ed","resolution":{"observed_at":"2026-08-06T17:26:44.273145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.261366Z","title":"Lana: A language-capable navigator for instruction following and generation,","venue":null,"work_id":"a8f55735-f938-4f14-8514-091ce99ae0d0","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.423682Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:658997800d9e4fe4417f762f4d0b35e93bdaac03988c6736d07e3a5fa4fd8d75","observation_id":"7884320a-c9f4-469a-9b2e-152643a064d4","resolution":{"observed_at":"2026-08-06T17:26:44.264496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.252147Z","title":"Pasts: Progress-aware spatio-temporal transformer speaker for vision-and-language navigation,","venue":null,"work_id":"535a3af9-f867-4ac6-97f7-98a8407012b4","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.509361Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:e55d90c402c8712aa7b87a7b30f93161bb8ca08a1a55a809bae07dd2592d58ce","observation_id":"630df405-98ab-4d04-88f1-866f562a9a4d","resolution":{"observed_at":"2026-08-06T17:26:44.255999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.242032Z","title":"Envedit: Environment editing for vision-and-language navigation,","venue":null,"work_id":"ee55d167-3598-4bf9-b4aa-e4a5afc54b2c","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.600011Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:01c78a2726f618d05cb68d0646e19c4b97b089fa49c5a739d338237a0658930c","observation_id":"8a48d74d-8bc1-4388-ad64-42f79fd1f07b","resolution":{"observed_at":"2026-08-06T17:26:44.245998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.233264Z","title":"Less is more: Generating grounded navigation instruc- tions from landmarks,","venue":null,"work_id":"6a4fcb2d-114f-4b41-8da8-f5d029572c2d","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.657739Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:9aba2dd7512fc605905389b78c7744146c5ce72a85b6251aca899255026f6b3d","observation_id":"eb44402d-c6aa-4704-8cc9-b4d15dea0189","resolution":{"observed_at":"2026-08-06T17:26:44.236709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.223318Z","title":"Learning vision-and-language navigation from youtube videos,","venue":null,"work_id":"dd9be11c-99b9-4ecb-ab5d-a7c2f1516f30","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.749105Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:7795ed602adb36baa2522555f386d9466f270cbb28d554e28aed3134d336877d","observation_id":"81ba1bbc-87b9-4838-a7af-147d1a0540c9","resolution":{"observed_at":"2026-08-06T17:26:44.226926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.214741Z","title":"Video captioning: A comparative review of where we are and which could be the route,","venue":null,"work_id":"d9213d31-13a2-4726-a9b5-7b199a78ac85","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.825425Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:dabad72a10d29730ccded13fe8c4991fbe34de80a734df80d0d65e54c8bd17ff","observation_id":"61f4f532-c790-4ee5-9f6a-486991bddce8","resolution":{"observed_at":"2026-08-06T17:26:44.217843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.206347Z","title":"A review of deep learning for video captioning,","venue":null,"work_id":"cb9a464a-3269-438d-866e-ca7f03004ff0","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.922378Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:1956de33ed3b847e9c0f43fbb63e0ccecaf787385f79f298caa275794f2d4e2b","observation_id":"22ef3e08-ccdf-4734-8ce8-8e62679309e9","resolution":{"observed_at":"2026-08-06T17:26:44.209487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.196855Z","title":"A survey of video datasets for grounded event understanding,","venue":null,"work_id":"8d3157ff-c3f7-4045-89e1-bd3202d7f9aa","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.001084Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:7acbe236bc6239549fe19a23503932122c8b5fd6845de5844a775d1e76903b19","observation_id":"d2458f56-b1f6-4903-8b55-56e5a6224c4d","resolution":{"observed_at":"2026-08-06T17:26:44.201062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.188484Z","title":"Dual-stream recurrent neural network for video caption- ing,","venue":null,"work_id":"2efada35-8ea7-4bf8-a1cf-a3855373f304","year":2019},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.140493Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:3c553c377ddcb39ac50fa71168e7c5a302a4dde4d88b61375b893f37563af5e1","observation_id":"77cd7376-8182-465e-9944-167429902d73","resolution":{"observed_at":"2026-08-06T17:26:44.191684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.179487Z","title":"Video captioning using global-local representation,","venue":null,"work_id":"d74265ef-cda1-441c-bcd9-160b54e87ddd","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.207516Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:a810c82afc0a979dfc7c2b0035369a4db75a17e1a53c7e8c33b80fcbda793459","observation_id":"8d03ee06-26ed-4750-b4cc-300ca7c23b15","resolution":{"observed_at":"2026-08-06T17:26:44.182805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.169877Z","title":"Evcap: Element-aware video captioning,","venue":null,"work_id":"2c8ecab1-45b8-44fe-ae6a-fb4c7c6b472e","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.274303Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:3f063812a6aba52e8ec8693c8ab41bb0e1074cd317eb18ebf452c86d39e41175","observation_id":"0458ea46-934a-4639-8938-dc4f54258e01","resolution":{"observed_at":"2026-08-06T17:26:44.173422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-06T17:26:40.342191Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.342191Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:e2af6ec53d5ba7fd629af79339ef175436774deebe4d40989b47cfa595981bd1","observation_id":"b26fa6d3-8e11-4c3e-9537-a920ae3bceae","resolution":{"observed_at":"2026-08-06T17:26:40.342191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:26:40.424787Z","title":"Qwen2-vl: Enhancing vision-language model’s percep- tion of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.424787Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:c6759a79787ae19d553e245240c219cce8f58760e03c4299be617c62b06c8ae3","observation_id":"6aae20aa-65e1-4b81-8d3c-1412558d63f6","resolution":{"observed_at":"2026-08-06T17:26:40.424787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.160084Z","title":"Msr-vtt: A large video description dataset for bridging video and language,","venue":null,"work_id":"af74c483-748b-4676-8e7a-68a78eec21d4","year":2016},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.514568Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:b1296cadb718254683951418a55849d2a1f7ae6ed9e2e40e0c4ce661d1d2f3aa","observation_id":"5a0f4ef5-bca5-4426-8e87-71b62743ce9c","resolution":{"observed_at":"2026-08-06T17:26:44.164482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.149957Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":"ea43b3a0-b30d-4c9b-972a-17ff2ebcadca","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.611316Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:b8f908e0e7559e1aa3f1d52dc1864874bd6a430a8af00464591748ed5a99ae94","observation_id":"0098bd94-98bd-4d4f-b0c4-c85abfd7fd19","resolution":{"observed_at":"2026-08-06T17:26:44.154235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.141218Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments,","venue":null,"work_id":"d6b6128d-776a-4174-959c-01ea91953ac3","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.722428Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:f67506c23985024b760774ff74bcd24aa7feca6e428c13b384ad2f06bea7770b","observation_id":"91305db8-ed73-4a43-ae18-476114721c4e","resolution":{"observed_at":"2026-08-06T17:26:44.144410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.132783Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"d63d55f7-2bcf-4873-8707-0b37b804cb5f","year":2016},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.776309Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:fb3ef2f0a2b1781ed86fb9a0b4f18654ddedb4be9cb2bf874cf43be2c1d2f82c","observation_id":"990bc053-7431-47a2-ba82-b380648b8fa7","resolution":{"observed_at":"2026-08-06T17:26:44.136022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.122667Z","title":"Object recognition from local scale-invariant features,","venue":null,"work_id":"acc4ebbb-21e6-4a1e-af96-5ff6cac1099e","year":1999},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.864850Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:dd9c07e79fbb5116a1fb720a15c5d83506892adecb0697f4530f6c5ba2bef973","observation_id":"1fffbdb2-5fb0-4ea9-802f-e52533dc242c","resolution":{"observed_at":"2026-08-06T17:26:44.127067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.112175Z","title":"Fast approximate nearest neighbors with au- tomatic algorithm configuration,","venue":null,"work_id":"f3f6fa6c-441e-4a87-bc0b-803c2b909df2","year":2009},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.960158Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:1b1e734c495505fbe1fd74c1cb00e178aa1e40bc82966f45959db5b1f5fe9e34","observation_id":"2debacc8-7b06-45ae-b108-0611d651b798","resolution":{"observed_at":"2026-08-06T17:26:44.115716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.102420Z","title":"Revisiting weakly supervised pre-training of visual perception models,","venue":null,"work_id":"baa76caa-90fa-406f-90e9-ff2acf932d99","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.044904Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:0bc484b0be012c5aa5228fd212b8aa8b129b717dd9787396df16716751a29b1a","observation_id":"d8d7c4b6-bd4f-43ac-a3c4-e7d6a716bff1","resolution":{"observed_at":"2026-08-06T17:26:44.105728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.091812Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"da4d22f9-91e5-427f-a199-0511e25d922b","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.136000Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:38a43ab34dd1685a4461fcd1049ac6cf7ddeacd98d8aec6c2df196e807191e91","observation_id":"23f5e418-644f-47af-af40-1efbbb7e09b8","resolution":{"observed_at":"2026-08-06T17:26:44.096238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.082816Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":"b1c5a375-8b23-4731-b992-bbe0c0862724","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.246340Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:cfcb4d388912d571366169f069a3b406b1a8a2893a43e62a6a956b1786419b6c","observation_id":"c4b53ea2-908e-4d6e-ac65-f4e5e6974249","resolution":{"observed_at":"2026-08-06T17:26:44.085885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.073703Z","title":"Visual instruction tuning,","venue":null,"work_id":"dd8df61d-4fc4-4da8-892d-f37c7e1fa5f5","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.321346Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:4525448307f3706b9799d5552150d41b0e1fa81da10ff8b0fdcc7aed4f84a94d","observation_id":"14a3a940-618e-426e-b011-b094ce65ca34","resolution":{"observed_at":"2026-08-06T17:26:44.077443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.064190Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"19b7ddca-4884-47e3-a584-6e87f5a6504b","year":2002},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.381224Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:7ae8599f07ad1609835571dfb5f181b15a783ed5cbe0f494f6a202244e2713d6","observation_id":"27eb50c0-19e7-4ef8-b2cd-281d96d8e02f","resolution":{"observed_at":"2026-08-06T17:26:44.067482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.054376Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"a782977b-46db-46a1-b32c-aafde91a5b10","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.520663Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:f911c14553bf20591a2ba8728a2a25c2c8201a7f94dc127725fa247e580ea35f","observation_id":"7e4715a2-04d0-41fb-abd4-b97a82fd66a9","resolution":{"observed_at":"2026-08-06T17:26:44.057996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:41.645320Z","title":"Cutting the gordian knot: The moving-average type–token ratio (mattr),","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.645320Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:90461f3622abcd3e47f1e4364b9859d9726451091be038212b571ae996ab04b3","observation_id":"fcc4dadf-e352-4213-a471-636f6c12b421","resolution":{"observed_at":"2026-08-06T17:26:41.645320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:41.755589Z","title":"Locally typical sampling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.755589Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:07049336a433b9aca69bce9f20b2170140cd98696776f2f6c1a32edfcbc0f087","observation_id":"9d0a2613-97d5-4adc-93a8-0ae22ebcc604","resolution":{"observed_at":"2026-08-06T17:26:41.755589Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.043993Z","title":"Texygen: A benchmarking platform for text generation models,","venue":null,"work_id":"b6fe64ef-aff5-4f84-8af8-5af0cf72f056","year":2018},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.876239Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:07ae91103804f3ade01b7dc4cdd81c6ad910a94b029bdfbf5811d40b551fa7cc","observation_id":"f0e708ec-b3a9-45e2-ae65-c66232e35414","resolution":{"observed_at":"2026-08-06T17:26:44.048817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:42.017758Z","title":"Standardizing the measurement of text diversity: A tool and a comparative analysis of scores,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.017758Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:db146b1288dd33ccbdf39ba22c89d81b7fcd5072803fa1700feb50cb58bea52d","observation_id":"15627557-607d-42bc-9114-4b9486b1ce47","resolution":{"observed_at":"2026-08-06T17:26:42.017758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T17:26:42.152760Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.152760Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:043d0cf05b21b3299945012578ac7b14bcbf75dbe6df3098f56225701978985d","observation_id":"8c2ba964-e269-4872-b6ac-2d45b22fb411","resolution":{"observed_at":"2026-08-06T17:26:42.152760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.034924Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":"5e317f3e-976b-468c-8ffe-f14ae6b9a551","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.420639Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:44d466f5eb191bf69aba25798c9e616fb3bdefe8246e16dcc9ed603d545e6a85","observation_id":"a6530019-9259-4309-80ff-38276acef15a","resolution":{"observed_at":"2026-08-06T17:26:44.038618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.025732Z","title":"Places: A 10 million image database for scene recognition,","venue":null,"work_id":"f8effe45-6705-44ed-b253-6f1ab2936ff2","year":2018},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.589056Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:1c99a54be3dd14f05333ae3705b3fecf27abfa41d74dab33227b1098397ad849","observation_id":"897009f2-c011-48d7-b139-16b23f4927cb","resolution":{"observed_at":"2026-08-06T17:26:44.029351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.016985Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":"a7025137-ab17-482b-a627-5a40292add70","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.755630Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:04f378b76e24ac6d2e4f896d4970d74187b41c91aa6ab4cad2d140ed7fcb8fea","observation_id":"8f2f6ac3-43d4-4d5c-adb6-cb66239809e6","resolution":{"observed_at":"2026-08-06T17:26:44.020039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T17:26:42.870226Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.870226Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:5704848bd46010bcb4acb18dbe439e5f02feb77913bcb717fe5c19ffcd813a30","observation_id":"c6cccb69-2e66-428c-a754-1c8b3e39b82d","resolution":{"observed_at":"2026-08-06T17:26:42.870226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.007590Z","title":"GPT-4o mini: advancing cost-efficient in- telligence","venue":null,"work_id":"fc434797-1f5b-4650-9d92-1abbdb1def69","year":null},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.873716Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:3e71e8f5b535763f3ae6e280078294796fba2ba267769a973dcecd6c664af7bc","observation_id":"4452d2f4-3dbb-4912-beb9-97b5addd3fc4","resolution":{"observed_at":"2026-08-06T17:26:44.011684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T17:26:42.877278Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.877278Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:fe45b8f6dc986b6177ad267bf945e4f31afa7751c164066148089cc5a5719957","observation_id":"4ab11380-5c49-4707-aab2-06129999fad6","resolution":{"observed_at":"2026-08-06T17:26:42.877278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T17:26:42.892226Z","title":"Gemma 2: Improving open language models at a practical size,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.892226Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:22c276f038d33ed72d245564ff4c6b5fbbafe06fda12a97aec75ae0476e31a4d","observation_id":"a8c8dc48-1b17-4bd8-b79c-91866c6a70e0","resolution":{"observed_at":"2026-08-06T17:26:42.892226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T17:26:42.996218Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.996218Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:671ffdbabc97d8a25eba44c98141c3a8eba5e45b0c682cac9bd237df55206a52","observation_id":"b0bdb53a-ba0f-41b8-9619-687c91c69ae3","resolution":{"observed_at":"2026-08-06T17:26:42.996218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.092511Z","title":"Openclip,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.092511Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:bedf02c150573ac623ceea0cb3dee9ee8cd6a02f4fdb619db344a493d8aa4195","observation_id":"b7bdd802-c3b5-401a-92a6-815bd1315e18","resolution":{"observed_at":"2026-08-06T17:26:43.092511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.191390Z","title":"Torchmetrics - measuring reproducibility in pytorch,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.191390Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:541c875231d07d7b686d99c9529888ce3129a86d2bc88a714aa40fa8edebda1e","observation_id":"fee5a68b-2a12-4e76-b3fd-6f2feac95f21","resolution":{"observed_at":"2026-08-06T17:26:43.191390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.998281Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":"994c3a8c-b712-4683-8e3d-b91fd55e9e9b","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.275308Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:8ecd93dc3ed5beca9f1674f60d0f274ff5fbaa64a1fdf40bb35f51b404a0ae97","observation_id":"e7acea5c-bc75-4730-9fc6-307e4ca84cfd","resolution":{"observed_at":"2026-08-06T17:26:44.001587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.988510Z","title":"Llava-next: A strong zero-shot video understanding model,","venue":null,"work_id":"4a99a8cf-d618-4d62-8f05-6b2cb6b95abc","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.314145Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:d6653929f50360090c3a298093b86c9b840fbe8b09a0054bb736394f788fff35","observation_id":"f81e374e-5483-48e2-a264-9e627404a796","resolution":{"observed_at":"2026-08-06T17:26:43.992269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.979199Z","title":"Habitat-matterport 3d dataset (HM3d): 1000 large-scale 3d environments for embodied AI,","venue":null,"work_id":"fde3f349-e959-4f78-97d1-78363f6b18e3","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.350446Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:6909b9746a4160f45544ac7ae8df1ccc0611d241b82424cd17cd954c8f9cd7f0","observation_id":"b1854ce4-7a63-4ad5-92b7-736cd657a4f0","resolution":{"observed_at":"2026-08-06T17:26:43.982841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.968623Z","title":"Scenenet rgb-d: Can 5m synthetic images beat generic imagenet pre-training on indoor segmentation?","venue":null,"work_id":"0b707c55-4435-43dd-8e8c-61fc6f39a469","year":2017},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.380318Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:57ea52a75ed01bdb56557857f922f33a075fd62a2785410eb3ca5e4460c484ea","observation_id":"657da7f3-f228-4c2a-9e96-5dd84ce52051","resolution":{"observed_at":"2026-08-06T17:26:43.973049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10943","last_updated":"2024-07-15T17:40:46Z","snapshot_observed_at":"2026-07-06T18:46:39.497352Z","submitted_at":"2024-07-15T17:40:46Z","title":"GRUtopia: Dream General Robots in a City at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10943","snapshot_observed_at":"2026-08-06T17:26:43.401732Z","title":"Grutopia: Dream general robots in a city at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.401732Z"},"links":{"cited_paper":"/paper/2407.10943","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:269fbb8f06bbb211ccd4bdd59ce7f0f4d8d04dc32bc348e77578c6a2eadb7975","observation_id":"50046585-1b74-4c97-a40c-c8877d309220","resolution":{"observed_at":"2026-08-06T17:26:43.401732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.879280Z","title":"Sun3d: A database of big spaces reconstructed using sfm and object labels,","venue":null,"work_id":"dc84c5ab-60e8-44d1-8901-0d953034e9c2","year":2013},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.407659Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:5520f023d40bffefc69f363da8a2186c095dc2b686aee3add0190f938e0b417a","observation_id":"0a01de21-e13d-40f3-9ec3-33838189d519","resolution":{"observed_at":"2026-08-06T17:26:43.927862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.825719Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes,","venue":null,"work_id":"bc5883bb-71b7-480b-9dda-498642ae3bb7","year":2017},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.413279Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:884c54a39e0b28d23369f401f4cc17befb939ff976b93acd6b6fa0572d513446","observation_id":"505e524b-fc7c-4f03-a10f-e591e1571320","resolution":{"observed_at":"2026-08-06T17:26:43.849072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.786046Z","title":"A benchmark for the evaluation of rgb-d slam systems,","venue":null,"work_id":"d0c9ef31-2ce8-460f-bf10-2d8af1aba078","year":2012},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.419507Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:ac709c71f01bcf633c4d45b23fd0274c393a9b1f478d7e01fe23034c9183997a","observation_id":"a268142b-4b52-423d-a890-b6594a577936","resolution":{"observed_at":"2026-08-06T17:26:43.798243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.718375Z","title":"Learning to navigate the energy landscape,","venue":null,"work_id":"5d9166e7-8d8f-43d7-a9b0-d6c74a2de6c2","year":2016},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.425274Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:ef683b302bc0634368d919aec9872846c1071eedbf55973b49a5ab78ef46e3cc","observation_id":"6467cdaf-05aa-47e0-a458-28270e1a30ac","resolution":{"observed_at":"2026-08-06T17:26:43.748638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.00463","last_updated":"2019-08-29T04:17:49Z","snapshot_observed_at":"2026-08-03T12:37:47.747612Z","submitted_at":"2019-08-01T15:39:54Z","title":"DIODE: A Dense Indoor and Outdoor DEpth Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.00463","snapshot_observed_at":"2026-08-06T17:26:43.431393Z","title":"DIODE: A Dense Indoor and Outdoor DEpth Dataset,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.431393Z"},"links":{"cited_paper":"/paper/1908.00463","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:def1b83b302b1e15dbdeadf026b5ddf391b6ee44d6bc26a98d2097b9b51e2397","observation_id":"224e5921-e4fc-47e8-811d-6c2248a5c419","resolution":{"observed_at":"2026-08-06T17:26:43.431393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.664954Z","title":"Vision meets robotics: The kitti dataset,","venue":null,"work_id":"9cd13e78-1c4e-4874-ac9d-4b1ae49a4b35","year":2013},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.437116Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:ca2030c4003beb7293696c185e8e1690640db31a19b0d8bc65a46d87132d587c","observation_id":"3672e4eb-aa87-4be4-964d-ee67f5298424","resolution":{"observed_at":"2026-08-06T17:26:43.696891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T04:57:37.773121Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":62},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2507.10894."}