{"as_of":"2026-08-14T01:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e41e93016901b857e143b0c0e679bac571160a7e2f89b1a1f53fd695ed00bfd2","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:42.191931Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:01:24.042462Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:00:08.776707Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-06T19:01:24.042462Z","title":"TrackVLA: Embodied visual tracking in the wild,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06747","last_updated":"2025-07-09T11:02:46Z","snapshot_observed_at":"2026-08-09T11:30:50.030286Z","submitted_at":"2025-07-09T11:02:46Z","title":"LOVON: Legged Open-Vocabulary Object Navigator","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:01:24.042462Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2507.06747"},"observation_digest":"sha256:fe305837bd21ef54a86b796ece9a139980f701375332cc74a2be6c76f24803f5","observation_id":"f5a7e884-968a-4762-9def-5cc190bb4ba6","resolution":{"observed_at":"2026-08-06T19:01:24.042462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T19:23:58.769472Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2512.21714"},"observation_digest":"sha256:7aee95288e07e7bd18be92ebe9ccfddd04bc1765b9a778f5f1b7d685e6c696c0","observation_id":"c4d21945-511f-4a20-b3b7-02526a9de368","resolution":{"observed_at":"2026-05-16T19:28:20.893136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-02T17:15:42.447861Z","title":"arXiv preprint arXiv:2505.23189 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-13T18:59:08.475922Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T17:15:42.447861Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:758ab0287bfc37dd953404b2b8d6e75556921c3df10894b6c8fca1ff8f5457c0","observation_id":"93820870-7b18-496e-a6ff-32562bdb12e1","resolution":{"observed_at":"2026-08-02T17:15:42.447861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-04T05:43:11.874741Z","title":"arXiv preprint arXiv:2505.23189 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-13T18:59:08.475922Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T05:43:11.874741Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:a2b03bbe83f629f46a5fd3da559edbb59c0361125bfe7e3f6ea4d8323ece596a","observation_id":"49f47abe-c77e-4b8b-a110-c8f9d7de9118","resolution":{"observed_at":"2026-08-04T05:43:11.874741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:0e19f805d5397b6b69ce000d44f806e91c73d23c0c3e94f2a93c9ca9b5f8723d","observation_id":"b4231c94-65a0-441e-9768-077b28e74bdf","resolution":{"observed_at":"2026-05-10T14:10:29.583446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2604.20347","last_updated":"2026-04-22T08:49:59Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:49:59Z","title":"A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T00:30:41.056486Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2604.20347"},"observation_digest":"sha256:eb3d8fb0e8990cf54a28a479b250ce214c5a259a3c6cfb81947b13aae8d83b1b","observation_id":"0f638935-696c-4643-9de1-e0b440644714","resolution":{"observed_at":"2026-05-11T13:46:05.822446Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2604.21453","last_updated":"2026-04-23T09:11:50Z","snapshot_observed_at":"2026-08-13T18:02:23.049876Z","submitted_at":"2026-04-23T09:11:50Z","title":"Instance-level Visual Active Tracking with Occlusion-Aware Planning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T21:59:52.919529Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2604.21453"},"observation_digest":"sha256:5a6fa9abee8a13a3f549dd54e761bd8951dcb36dd6e58d142065bd62d481620b","observation_id":"7a690784-0eed-4ee3-9c37-e882ca42bd36","resolution":{"observed_at":"2026-05-11T14:21:06.765783Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2604.24086","last_updated":"2026-04-27T06:20:15Z","snapshot_observed_at":"2026-08-03T03:51:20.015005Z","submitted_at":"2026-04-27T06:20:15Z","title":"AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T03:18:03.855477Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2604.24086"},"observation_digest":"sha256:2c14f2cb5c975732c7cbb59280e535565c83dd32c994850c96c625a2d9d898bb","observation_id":"6b9ff224-0505-41b8-8885-1608585885f5","resolution":{"observed_at":"2026-05-11T22:11:13.698728Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2605.09005","last_updated":"2026-05-09T15:44:19Z","snapshot_observed_at":"2026-08-10T22:11:07.561680Z","submitted_at":"2026-05-09T15:44:19Z","title":"Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T02:29:34.973993Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2605.09005"},"observation_digest":"sha256:abbf6226bf0940c1be1b0beda452f8f937ac1205a116d98fc498ca5c6a312279","observation_id":"b24b29a8-cbe5-48f2-9093-f1162583b5bc","resolution":{"observed_at":"2026-05-12T07:36:36.447114Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2605.09441","last_updated":"2026-05-10T09:34:05Z","snapshot_observed_at":"2026-08-11T07:41:04.520067Z","submitted_at":"2026-05-10T09:34:05Z","title":"Beyond Isolation: A Unified Benchmark for General-Purpose Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:53.557357Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2605.09441"},"observation_digest":"sha256:1d3ff7dbd88dcb7685a636209060dc728747fb7f1beb6f53eb8fa7d8d368e20f","observation_id":"b2bcdea1-b1eb-42bf-b2a4-0ddf44369665","resolution":{"observed_at":"2026-05-12T06:06:27.484646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2606.01848","last_updated":"2026-06-01T07:59:54Z","snapshot_observed_at":"2026-08-10T13:53:46.477765Z","submitted_at":"2026-06-01T07:59:54Z","title":"RescueBench: Can Embodied Agents Save Lives in the Wild ?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:09:47.385928Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2606.01848"},"observation_digest":"sha256:f206f5caf54cee142c860d8254c3faca0937414831d7d6597073fc24ac00fcb5","observation_id":"8b98d5ae-acfe-4943-aa94-6e98224540a2","resolution":{"observed_at":"2026-07-01T22:36:17.889175Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2606.03682","last_updated":"2026-06-02T14:05:47Z","snapshot_observed_at":"2026-07-06T23:43:55.632508Z","submitted_at":"2026-06-02T14:05:47Z","title":"GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T09:51:00.563422Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2606.03682"},"observation_digest":"sha256:beedd60183e88d9ac129b7f9e7f986571c36c50cc56d5a87502486a8c39d1618","observation_id":"b8d4fec2-7f50-4e59-8008-70af2ecaaf02","resolution":{"observed_at":"2026-07-02T03:36:30.088455Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2606.18634","last_updated":"2026-06-17T03:04:11Z","snapshot_observed_at":"2026-08-12T03:37:04.465436Z","submitted_at":"2026-06-17T03:04:11Z","title":"EffiNav: Fusing Depth and Vision-Language for Efficient Object Goal Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T21:04:00.821473Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2606.18634"},"observation_digest":"sha256:99aa0065971c7fc8d19d015069159956b41c2fd8290b59d232233f6064ac9089","observation_id":"87180a65-f12d-4091-b43a-6604e00c386e","resolution":{"observed_at":"2026-07-04T00:39:17.014079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2606.25880","last_updated":"2026-06-24T14:25:05Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:25:05Z","title":"USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T20:48:49.071281Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2606.25880"},"observation_digest":"sha256:bdbefdc1cf289b434f708d3c714eb7ec27150315ca5702dab087b3c144cb529a","observation_id":"f47d7f4d-b0e5-42b6-9abb-5a6ff24a7de3","resolution":{"observed_at":"2026-07-04T20:00:08.778367Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-14T12:10:21.115628Z","title":"Trackvla: Embodied visual tracking in the wild.arXiv preprint arXiv:2505.23189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T12:10:21.115628Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:4bf913798fade955edc9de542acd378886a48e4cdd24855b78afe114547e447b","observation_id":"3b4bac15-7f67-41b3-b05e-91caccd77ae1","resolution":{"observed_at":"2026-07-14T12:10:21.115628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-02T07:19:42.675991Z","title":"Trackvla: Embodied visual tracking in the wild.arXiv preprint arXiv:2505.23189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.675991Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:06ac4cd9997f1df2570c241103d4b770a8eb715ddafd2d66bf49c3b9b325d752","observation_id":"d2a5e682-9c0f-4b86-b398-958e6ccf2a58","resolution":{"observed_at":"2026-08-02T07:19:42.675991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-02T04:42:02.888481Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13621","last_updated":"2026-07-15T09:09:25Z","snapshot_observed_at":"2026-08-07T13:53:22.458398Z","submitted_at":"2026-07-15T09:09:25Z","title":"UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T04:42:02.888481Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2607.13621"},"observation_digest":"sha256:4b9138f2215bbda8032739b89ca9e4634bb8d9c98b7447d4a5cfd5623a2e716d","observation_id":"22f440c8-e916-41a7-acef-ced7cfedc286","resolution":{"observed_at":"2026-08-02T04:42:02.888481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23189/citation-record","integrity":"/paper/2505.23189/integrity","json":"/paper/2505.23189/citation-record.json","paper":"/paper/2505.23189"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:49.986190Z","title":"Maalouf, N","venue":null,"work_id":"cba71977-d162-4c2d-93d3-d8c876cf73a3","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.058701Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:5de1e8e936bda0274f8223d880d112c1e1a307ac2f56f44fbaa8df65d79ca543","observation_id":"67481953-c0ab-4705-90d2-e3b441f68d32","resolution":{"observed_at":"2026-08-07T12:58:50.061813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:49.765716Z","title":"Zhang, K","venue":null,"work_id":"46812efe-ab12-4630-a69a-acef1ede1d1c","year":2018},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.131238Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:e079cd7d33a99794d96c68480880a2e07ae5dc4f00486ee721b609e4276753fa","observation_id":"bce6bae7-59f1-4d3e-97cb-5d3b2d56bfa3","resolution":{"observed_at":"2026-08-07T12:58:49.899080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:49.497164Z","title":"Zhong, P","venue":null,"work_id":"345ed391-d068-42e5-891a-eca519d8d7d6","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.235735Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:8fe3029e54c75a110f2dfe44e8951b725b2dd134b385040d1c191335d6d421b8","observation_id":"167e268a-18d3-4122-afa2-632eb32f016f","resolution":{"observed_at":"2026-08-07T12:58:49.626602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:49.248517Z","title":"Zhong, P","venue":null,"work_id":"52019373-e3b3-41b9-9076-a9901f036097","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.356608Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:cc8c3cbe3a1070f5df301fca2b5797fb3b7eac0b5182ddc8807ff57c7effb93f","observation_id":"c119d1d2-7fcf-4909-babc-5697ae04b213","resolution":{"observed_at":"2026-08-07T12:58:49.354620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.996054Z","title":"Zhong, X","venue":null,"work_id":"d1014d7b-3954-4888-bd37-1a7dc785821e","year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.427961Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:ab11e30e2f4cc4587fa4b9297f30314148039574dd8f604e0573528852c514d6","observation_id":"c0e1e35d-d048-4024-8de7-60c63a0d9297","resolution":{"observed_at":"2026-08-07T12:58:49.099697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.718231Z","title":"Zhong, K","venue":null,"work_id":"c4b97cf8-9a1d-4da5-ae0d-a7ee615b9d7d","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.532878Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:b82f9e7dc05f3dee8359d03c951c8a24c8215615238b7d8f45a86b3f5bc7e229","observation_id":"c5d54fcf-28db-44df-9eec-2555f756f697","resolution":{"observed_at":"2026-08-07T12:58:48.846902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.493602Z","title":null,"venue":null,"work_id":"7fac3892-b8ec-4857-ac11-8f238e02d62d","year":2022},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.659436Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:b5b8828b425072d51fa8579e01c507b06add9c7c664a351f1a25478078702a56","observation_id":"70bdd799-bade-4a62-bc72-6b0189b2f2ca","resolution":{"observed_at":"2026-08-07T12:58:48.605280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:35.774363Z","title":"Mavrogiannis, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.774363Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:483692ca527b8be548407bd3437b2c8d2372e60837ec2d4948ebc3393d3163c0","observation_id":"f8f0b71a-439f-4a7f-89d3-2a8eaf70af1a","resolution":{"observed_at":"2026-08-07T12:58:35.774363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13724","last_updated":"2023-10-19T17:29:17Z","snapshot_observed_at":"2026-08-13T05:45:12.083288Z","submitted_at":"2023-10-19T17:29:17Z","title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13724","snapshot_observed_at":"2026-08-07T12:58:35.889780Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.889780Z"},"links":{"cited_paper":"/paper/2310.13724","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:41860d6248695705f6a01659353c21e88b7d74eb0f832270d67028fc0511f74c","observation_id":"2dd1e57f-afa4-46bb-ac73-d868f99d3119","resolution":{"observed_at":"2026-08-07T12:58:35.889780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.268644Z","title":null,"venue":null,"work_id":"20095eec-51ac-40f4-a063-9cf550e729d3","year":2020},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.000986Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:cc93f770c430e2967c1705178987cd9a519c91013bab6407c0cbcf0fc0879ec8","observation_id":"a4db9c36-f856-4adb-9be4-a5f155b9f8a6","resolution":{"observed_at":"2026-08-07T12:58:48.350545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:36.146071Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.146071Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:8e3c997cc5842f35fd980a527a3651835ee9138faa5d38418104a90434e8de7d","observation_id":"45b2709a-60f8-4d37-a393-d6844d5530d5","resolution":{"observed_at":"2026-08-07T12:58:36.146071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T12:58:36.223357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.223357Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:5081f94054bb3b546da1357e970f0e2dcab0af80eb9c41a77a20fb0d15a1befd","observation_id":"814f903b-9094-45e3-bbd1-f4fd3ed4ab28","resolution":{"observed_at":"2026-08-07T12:58:36.223357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T12:58:36.327498Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.327498Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:999df9fc17d8019725f047d73d1d711ec09d0d55f590cb9d37642e4682cf6131","observation_id":"e5a63d46-9c64-4d15-8181-7664728f4f3f","resolution":{"observed_at":"2026-08-07T12:58:36.327498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-07T12:58:36.395247Z","title":"Zhang, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.395247Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:d5d142cba8177458d8183ed6fe09ed405a152a3045ef3de9e55a7c237ea7f0d6","observation_id":"00f011fa-18c9-4161-a456-8490f1071e24","resolution":{"observed_at":"2026-08-07T12:58:36.395247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.094849Z","title":null,"venue":null,"work_id":"84f47f7a-9751-4123-ad39-7cf77d4ed497","year":2018},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.461897Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:ccfb7bab5d30363c75e322a4b436b27088ddd9e27bb28c6ec7426e2067a432e0","observation_id":"2033133c-7dfe-4cdc-a7b0-d597a2ce5187","resolution":{"observed_at":"2026-08-07T12:58:48.147958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.959038Z","title":null,"venue":null,"work_id":"6f1ac0b4-200b-480a-9b91-b7754da7d96a","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.536447Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:e9f75cb94f2a46574029b7b066029b7f24c5b750a0ab8376e9afe258ce53178e","observation_id":"76ec1028-595e-49aa-bcfd-a68e61ed2ea5","resolution":{"observed_at":"2026-08-07T12:58:48.016695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.761757Z","title":null,"venue":null,"work_id":"8a448043-0eee-46fa-8f99-7de2369f5a72","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.629184Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a3fe2aa450a06ea24a7b119c88af3035c51f32209c5ec1929c7a39c459a0403f","observation_id":"b20a0d8c-f145-4326-bda7-06a9cbd5b1af","resolution":{"observed_at":"2026-08-07T12:58:47.847534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.555152Z","title":null,"venue":null,"work_id":"fa1dae56-7817-45a2-bab3-36514ae61588","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.817160Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:f0fe370348522113a38e854f6ce4747a284249ccf0414980b31018549730721c","observation_id":"93a09a66-45c8-45f8-9e5e-46eac056ca90","resolution":{"observed_at":"2026-08-07T12:58:47.635265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.424721Z","title":null,"venue":null,"work_id":"b1da42b0-4e1c-4168-b072-8e40250749c5","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.883788Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:374b2352a91a904e7242af3071f69f9ddda065c5f2b81aba86e3e6f3bbdae45c","observation_id":"94df9ac8-0547-4929-9a07-6d5b50d37340","resolution":{"observed_at":"2026-08-07T12:58:47.476954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.292903Z","title":null,"venue":null,"work_id":"d29cab7b-142e-41d7-8ba4-354bb79ba339","year":2017},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.021221Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:ba006baa2f5aec3df294178e547628fd1960ce55016c5f31a659397d5bc1a451","observation_id":"7b9327f9-d24f-49cc-8b45-4e077d8e6fc3","resolution":{"observed_at":"2026-08-07T12:58:47.357975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.099458Z","title":null,"venue":null,"work_id":"44b8ccf1-1389-4bfe-88dc-2656e7d34d22","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.097522Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:1be3ed7c6035ff46ae51730e505349adb13054264a3c8f184e420b030ac3c6f3","observation_id":"94bc2483-7021-4e4e-808b-5e0031e1aa55","resolution":{"observed_at":"2026-08-07T12:58:47.157662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02188","last_updated":"2025-07-11T07:24:03Z","snapshot_observed_at":"2026-08-10T06:32:46.133388Z","submitted_at":"2025-03-04T01:50:50Z","title":"RPF-Search: Field-based Search for Robot Person Following in Unknown Dynamic Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02188","snapshot_observed_at":"2026-08-07T12:58:37.240873Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.240873Z"},"links":{"cited_paper":"/paper/2503.02188","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:bd2cf3581d3e734b7a6cd8712f7b80dd392c8d74eda2d5fa657e957d2980cdc2","observation_id":"f9251d7e-0879-4db2-928d-aaba4782bc68","resolution":{"observed_at":"2026-08-07T12:58:37.240873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:37.352623Z","title":"Francis, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.352623Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:401b5d888513ebc609ae20e7e2efca77f19209a4ee7a49fe3774fb3f6ce07446","observation_id":"a94a2cb8-6546-449e-9f47-6083fc7b0fae","resolution":{"observed_at":"2026-08-07T12:58:37.352623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.965712Z","title":null,"venue":null,"work_id":"b95ae108-38fa-484e-acf9-4dd455d507d3","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.461397Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:f4f21e1b7f31a675071d22bb1a929fc378762c9789c1d9c3042dd212042f8fdd","observation_id":"e0bf8ac8-f1af-4e2a-abd3-c8c432ae9996","resolution":{"observed_at":"2026-08-07T12:58:47.025330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.846117Z","title":null,"venue":null,"work_id":"fc6fc405-c5bc-405e-93ac-df7316701f9f","year":2021},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.555731Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:4cc5c9402473507a9ea356458bf7c590986837055a6c3185375496ec31d0357f","observation_id":"98e6817b-5959-48f0-98ae-d6462869ff77","resolution":{"observed_at":"2026-08-07T12:58:46.889131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20083","last_updated":"2024-06-28T17:51:10Z","snapshot_observed_at":"2026-08-12T23:32:43.637289Z","submitted_at":"2024-06-28T17:51:10Z","title":"PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20083","snapshot_observed_at":"2026-08-07T12:58:37.641043Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.641043Z"},"links":{"cited_paper":"/paper/2406.20083","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:cf1b369ac606d0cfa8a37cd036f137ea226a99332457102b629524626de385d2","observation_id":"973b0c07-589c-45e7-b8c3-0ebac85911ba","resolution":{"observed_at":"2026-08-07T12:58:37.641043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.738393Z","title":"Zhong, P","venue":null,"work_id":"090ce992-6971-4ec6-a5dd-774541d1a448","year":2021},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.703557Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:4b5584cdb9b6f2f4474a7d13b1d391fa35d7af76eeb23a8e62243e9b975c3ac2","observation_id":"0d041274-f3c7-473b-892a-c2c666441e32","resolution":{"observed_at":"2026-08-07T12:58:46.791681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.615486Z","title":"Bajcsy, A","venue":null,"work_id":"e054a9e0-208a-4fb4-9c03-832d4e6c53c6","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.791581Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:b5e734d045a9b797bccdefd1c45a918a641ba39b2b5c5b5a63abc870aa287a05","observation_id":"3be7ec5f-286d-4b2b-a1d1-7e99f30633c4","resolution":{"observed_at":"2026-08-07T12:58:46.687855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11327","last_updated":"2025-02-25T10:43:21Z","snapshot_observed_at":"2026-08-13T00:28:16.696270Z","submitted_at":"2024-04-17T12:39:48Z","title":"Following the Human Thread in Social Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11327","snapshot_observed_at":"2026-08-07T12:58:37.879218Z","title":"Scofano, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.879218Z"},"links":{"cited_paper":"/paper/2404.11327","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:b0c6eabbb8b06e2b915ed5384017763927208893a0b632546a6a2e65ed60f2b2","observation_id":"46c87dae-cf6b-4496-87e6-45fcc7596da8","resolution":{"observed_at":"2026-08-07T12:58:37.879218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08244","last_updated":"2022-12-16T02:23:50Z","snapshot_observed_at":"2026-08-13T13:20:23.114161Z","submitted_at":"2022-12-16T02:23:50Z","title":"Offline Reinforcement Learning for Visual Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08244","snapshot_observed_at":"2026-08-07T12:58:38.012651Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.012651Z"},"links":{"cited_paper":"/paper/2212.08244","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:f7619c85a39c8d18d1507534ed9ac63e8ee58da84a1555e021ffa51fb41d5f4b","observation_id":"7f970009-1128-4408-9501-906b06231edd","resolution":{"observed_at":"2026-08-07T12:58:38.012651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07035","last_updated":"2024-12-29T23:16:37Z","snapshot_observed_at":"2026-08-12T23:25:39.126520Z","submitted_at":"2024-07-09T16:53:36Z","title":"Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07035","snapshot_observed_at":"2026-08-07T12:58:38.102288Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.102288Z"},"links":{"cited_paper":"/paper/2407.07035","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:197220a0226b153b4c60c538f148ce7c701d1cad00fe9ff638a50d218aba6eb6","observation_id":"f52b4969-3e3e-4dc2-80b4-3007facd5bee","resolution":{"observed_at":"2026-08-07T12:58:38.102288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.419447Z","title":null,"venue":null,"work_id":"4690ef91-155f-451b-8f57-e6cda7dedcca","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.181091Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:c0d4b0c8b6a4c42a486c885738ea8ae593a8238632aecf6fe8b96d26e293d244","observation_id":"70b38732-60a4-468e-9e1f-eb61ca4d77cc","resolution":{"observed_at":"2026-08-07T12:58:46.500788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:38.344919Z","title":"Sridhar, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.344919Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:4f3596026c1c2c3d881e6cfa2f57a336d64b7ca6a726a918f36935c10d31528e","observation_id":"b5404f59-c1c3-45be-aa1a-e93d5c4e3a8f","resolution":{"observed_at":"2026-08-07T12:58:38.344919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-08-12T23:47:55.777672Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-08-07T12:58:38.413065Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.413065Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:996e0771dddda024dc16d40c38f89e5ae285580af9fb905884d68e5a6213fd0c","observation_id":"00b0659e-6271-4403-99f3-5ecae9128e10","resolution":{"observed_at":"2026-08-07T12:58:38.413065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:38.517526Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.517526Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:511de0f05a98f11a308640e4029dfc9e69925afcaa4393c817e4df86a242cbc6","observation_id":"43a840bc-129a-4654-9665-11307f1fba6c","resolution":{"observed_at":"2026-08-07T12:58:38.517526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.227276Z","title":"Zhang, K","venue":null,"work_id":"07aa02c6-b538-4928-b847-3658118978d3","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.614594Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:637fd29231597dec8a01645fdc682f86471dc921ffd4f341ae4a9bc05d712a19","observation_id":"059052d0-e70f-469e-95aa-0d2ec8de704d","resolution":{"observed_at":"2026-08-07T12:58:46.319117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.029262Z","title":null,"venue":null,"work_id":"2da0cd13-07d9-4527-9b77-5024158b6f4b","year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.677358Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:952be3b82c12748f86d98f988732cbabc321ea801878dbf001921bfea11233d5","observation_id":"ef43213a-6963-45f5-83ca-bc9cf6fc1450","resolution":{"observed_at":"2026-08-07T12:58:46.118126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10670","last_updated":"2024-03-25T02:52:43Z","snapshot_observed_at":"2026-08-13T04:17:35.550194Z","submitted_at":"2024-02-16T13:21:33Z","title":"OpenFMNav: Towards Open-Set Zero-Shot Object Navigation via Vision-Language Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10670","snapshot_observed_at":"2026-08-07T12:58:38.760960Z","title":"Kuang, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.760960Z"},"links":{"cited_paper":"/paper/2402.10670","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:13ae127264c0ed559a4f15584bd3e05aede1e6bdcc6cbf9f46123688345135a0","observation_id":"0bde81c7-3733-44d4-bb2f-627c86405e6c","resolution":{"observed_at":"2026-08-07T12:58:38.760960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.844343Z","title":null,"venue":null,"work_id":"c87787aa-7268-4b10-8353-6f6436762e94","year":2020},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.803361Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:ed8f5ec57e1edd306e47709833c9affa62e10a9d7674af4c8f15a3d48af159ff","observation_id":"68ba1362-42aa-44d0-a812-70013e0e1549","resolution":{"observed_at":"2026-08-07T12:58:45.934456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.707583Z","title":"Zhang, L","venue":null,"work_id":"2bbea73b-5d1b-41d9-a21c-9c191410ce22","year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.869797Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:cb4931f89cf505a06b8e5508a1135cba0a19f8d972bfbc5d89afeabddeaa811e","observation_id":"128cc425-3022-4d5d-82ae-1c8957a5bcd1","resolution":{"observed_at":"2026-08-07T12:58:45.783363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10439","last_updated":"2025-08-28T04:36:42Z","snapshot_observed_at":"2026-08-11T18:00:15.920941Z","submitted_at":"2024-12-11T09:50:35Z","title":"CogNav: Cognitive Process Modeling for Object Goal Navigation with LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10439","snapshot_observed_at":"2026-08-07T12:58:38.925304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.925304Z"},"links":{"cited_paper":"/paper/2412.10439","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a96fbed7420e0217bbfe835d5a3ad3493513d70a865fb57ee4b42645a381e037","observation_id":"ca8eb7ab-87a8-489a-9434-e4c0774b1bb2","resolution":{"observed_at":"2026-08-07T12:58:38.925304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.504313Z","title":null,"venue":null,"work_id":"4660a5f4-449f-4daf-8641-23c2ad0db056","year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.019452Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:7f9c62084b474dcac21f8fd1dbf7fb77f31ba4ba3c5e6cdb299061bb2e65c084","observation_id":"8db9370e-1b6d-4ca8-a5e0-96a1b41d9d54","resolution":{"observed_at":"2026-08-07T12:58:45.627534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.301572Z","title":"Majumdar, A","venue":null,"work_id":"2ff9a272-7834-4dac-9fcc-7e27968e0944","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.072734Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:ddb6983b64cb4cddaaae9d22bf4560861c13eff36e08519fe65f4c4f9b73687c","observation_id":"35170037-d108-43d5-b610-ad000c2694b9","resolution":{"observed_at":"2026-08-07T12:58:45.378228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:58:39.143715Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.143715Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:b6e27645ef0a46f7e27a161537acd2264a1097c15abf710b80e792b83859b6d9","observation_id":"d7466e2c-98a5-4d64-bdb4-24e401133135","resolution":{"observed_at":"2026-08-07T12:58:39.143715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-07T12:58:39.212127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.212127Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:803c51a9ff0a92d356241947b871a8a478712065bcd5052a2facb244224e08dd","observation_id":"3f0a2539-0a59-47c3-b529-864aca2d780b","resolution":{"observed_at":"2026-08-07T12:58:39.212127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-07T12:58:39.273900Z","title":"Steiner, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.273900Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:cc9c83bd3d1b4b03968fc65d4b15fbb56f74399ad33ece05a89371c7cb734db6","observation_id":"61c62a60-7bad-498e-93ea-26cb7a25b2c1","resolution":{"observed_at":"2026-08-07T12:58:39.273900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.170677Z","title":"Chiang, Z","venue":null,"work_id":"5456fb3f-af37-4700-a817-436277c769fe","year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.346763Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:7d6a6a9845c2a85295ff7b4e83e9951ea79e38c3be7967fc130cf77a56d9a249","observation_id":"eefd5949-13c3-46c2-9ecb-f248b364e746","resolution":{"observed_at":"2026-08-07T12:58:45.239849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T12:58:39.423884Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.423884Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a8ac454092ec84ea5825763087fbf80681dd3b56ce5f63997d56286fa152dbac","observation_id":"987a77e5-4c63-45fd-8676-92a00c4d6878","resolution":{"observed_at":"2026-08-07T12:58:39.423884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-07T12:58:39.473566Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.473566Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:eae8a17ef97dc989e8401fddb6e488e9df75101d37eda9c57b65359fd02ba0cf","observation_id":"c7f81765-a013-4f17-9a96-3927133eb0ac","resolution":{"observed_at":"2026-08-07T12:58:39.473566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T12:58:39.575909Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.575909Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:8ef81ab3b338349d39f23d0445f896745f2c1c49fe655aa71df2aae96bf9037a","observation_id":"ef87750d-900c-4777-8110-ae6ee805554c","resolution":{"observed_at":"2026-08-07T12:58:39.575909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T12:58:39.658118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.658118Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:5b968d05331bd813b3a75a577facb613f019baf603c2173fe9d1f51c4f305fd3","observation_id":"23f80d29-2aab-489f-b190-533f5898ba74","resolution":{"observed_at":"2026-08-07T12:58:39.658118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-07T12:58:39.726418Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.726418Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:041e34a64f0ed5b018463d5fd386cdb1087ae589e22b079f1d92978193f507f4","observation_id":"6dba593b-bed5-4fcb-a08c-6711ab797c4f","resolution":{"observed_at":"2026-08-07T12:58:39.726418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:39.807440Z","title":"Zhong, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.807440Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:f8210edde2028b5f9bd4b0a9fc31c69a94bbc825db286f0a75eb889c8af6b512","observation_id":"3d13b2f2-ffc5-417a-a106-5565a93f9ecb","resolution":{"observed_at":"2026-08-07T12:58:39.807440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:39.872635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.872635Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a3299bd96021d9c4f270f187b7de233b8332011eaba357e8436235e81743b348","observation_id":"cb4e414b-ccf3-43fe-bc12-a987a96199c0","resolution":{"observed_at":"2026-08-07T12:58:39.872635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:58:39.930337Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.930337Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:3f71fdfeece20594c35a69118fa9264baa97dd3005cb83aea4990ae3440922cf","observation_id":"2eef2a0e-9ef3-4ab0-ba8c-0c7f41be2c87","resolution":{"observed_at":"2026-08-07T12:58:39.930337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-13T05:15:07.522678Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T12:58:40.004022Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.004022Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a9c1a0aa8cc6ebd75e14d93eefa74a5a5b7f004bdea45a98a778a2b81478bd7c","observation_id":"c4fe22d9-0890-46e7-b489-e5439882b89b","resolution":{"observed_at":"2026-08-07T12:58:40.004022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T12:58:40.054250Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.054250Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:e886a431b98fca42b4bff070f012ce655cde23e624ff0a6c2b32c3e8cfc5eaa7","observation_id":"ac34de30-2665-4837-8271-6b3539649af7","resolution":{"observed_at":"2026-08-07T12:58:40.054250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:40.121508Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.121508Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:49c2de09104a9dc0b6989435f1159ba7884e386872f7fe7cb322229d5635d824","observation_id":"2dd17f25-dd67-4453-8790-fadbd5295fb1","resolution":{"observed_at":"2026-08-07T12:58:40.121508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:58:40.203234Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.203234Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:91b38faf26f9f247b2257f7c14174b240d62c4c2427d66a6a87455b117304ffe","observation_id":"450dd411-5237-4bb9-8279-482a9f1e9259","resolution":{"observed_at":"2026-08-07T12:58:40.203234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15139","last_updated":"2025-04-10T08:48:37Z","snapshot_observed_at":"2026-08-13T08:28:52.051863Z","submitted_at":"2024-11-22T18:59:47Z","title":"DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15139","snapshot_observed_at":"2026-08-07T12:58:40.270249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.270249Z"},"links":{"cited_paper":"/paper/2411.15139","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:6e16f93d3dd3347d16567cf273335e520fd12d84a18b6aa9dae6d29ace17ee1f","observation_id":"3d526d48-951c-4487-81cc-ee78e9232f46","resolution":{"observed_at":"2026-08-07T12:58:40.270249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:40.324143Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.324143Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a2b5555ff7f5e03a0ff2cb6946b7bfcec9db15f068a10499be6e9ff49f6756f9","observation_id":"9d40dce9-d2fa-4bbb-9a5e-c246e7b95ef8","resolution":{"observed_at":"2026-08-07T12:58:40.324143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.005697Z","title":"Arthur and S","venue":null,"work_id":"f5b8a527-58e0-4f50-a1a1-82beff3d28f1","year":2006},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.410581Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:ed53b40ab52da700a742c079b983a67921cba0d122affca2af4cdbbbc3d9bf64","observation_id":"af296696-0ec6-479b-9eda-c54bf51d50dc","resolution":{"observed_at":"2026-08-07T12:58:45.063738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:40.497523Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.497523Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:3b0dbed323c6de85c2f9861ce06b17774b5e322a6f40211ae2cd591ebfcccc2e","observation_id":"85e36d22-beb4-45f9-8498-3d9f200aef05","resolution":{"observed_at":"2026-08-07T12:58:40.497523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T12:58:40.581911Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.581911Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:f6acef04c807913d2b325a921d08b01dc0a037e75bd9028586fb43fe161d0490","observation_id":"cf139da7-68ba-49dd-8ed3-833707332c80","resolution":{"observed_at":"2026-08-07T12:58:40.581911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.775759Z","title":null,"venue":null,"work_id":"4ba73835-74f0-42c5-a10c-13c338d23bcf","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.710904Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:3babcd1e63099fcf9bf67d57dd62e6ea4323fd7ee71b7fae797e2e350737d609","observation_id":"b22a0d28-0fe7-46c3-9acc-7a2c2d27dc4e","resolution":{"observed_at":"2026-08-07T12:58:44.894076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:58:40.830606Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.830606Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:54a90c88c015892f6183e277ca8f2028258d2593de44355c5f4d12395a158de2","observation_id":"97c1ce9a-0c23-4bb7-8ba8-633845b975bd","resolution":{"observed_at":"2026-08-07T12:58:40.830606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.533261Z","title":null,"venue":null,"work_id":"58f4dba6-afad-4d79-b8c8-03f08b1fb045","year":1996},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.961887Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:1b2acc5c4524e1ec18bf12e850910a0d0fded9b1592d00f1c09d3579d5a8fdc1","observation_id":"68a8a07a-746c-43a3-98d0-d60e62ba774e","resolution":{"observed_at":"2026-08-07T12:58:44.668102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.377582Z","title":"Van Den Berg, S","venue":null,"work_id":"448038a4-f060-4296-b45c-9e012afaea34","year":2011},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.044804Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:d8e73dcf3ce569c25f7650474021942ff83e9a9642421e019cb06c5101455e65","observation_id":"82b1bb3b-8cf9-4cd6-941f-2e0174b9bcad","resolution":{"observed_at":"2026-08-07T12:58:44.445025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.205113Z","title":null,"venue":null,"work_id":"b90c924c-963e-4972-a234-dcc4da4efdd6","year":2021},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.086656Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:3b624c62d63ca84504fe29504c2ff53b02d070a448c88a8a52dec531cfae3207","observation_id":"67eaf00b-20c5-4ba1-a2ba-b3fad4da9c94","resolution":{"observed_at":"2026-08-07T12:58:44.302312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.008073Z","title":"Chang, A","venue":null,"work_id":"4f2c7e4e-a7df-48bb-860a-961449a25071","year":2017},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.214814Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:cb390d1ad7e308078d57bab4e737a6c2c7181d22c64da7630ae95e73edab0c8b","observation_id":"3de6fbdb-c3b3-4a54-9a0d-329283adae80","resolution":{"observed_at":"2026-08-07T12:58:44.127299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.862037Z","title":"Gupta, S","venue":null,"work_id":"7ee77ee5-e526-4734-8d89-92d7ed980d24","year":2016},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.355498Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:34c9a4c6afae98bbde17d9aad72869360047452c36c6a2e42d6814900ba4495f","observation_id":"7cff437e-7533-4b66-90d9-d198656493e5","resolution":{"observed_at":"2026-08-07T12:58:43.945533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.679329Z","title":null,"venue":null,"work_id":"908b405e-27e7-43b9-9df0-a3f1c1eda813","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.423043Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:902ff79ba211a99328e42ecf19b3c40967183362bca7d61b1b1c57a88de7c773","observation_id":"94c65041-bf1c-4d84-8643-a1e34c1c11da","resolution":{"observed_at":"2026-08-07T12:58:43.785527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T12:58:41.502809Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.502809Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:5ede77f1192e3665ce4229298c7857a2b55b65b2f0e36f827956ced383fe623f","observation_id":"6bafc13e-1494-4da1-ba53-7a34198f855c","resolution":{"observed_at":"2026-08-07T12:58:41.502809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.464211Z","title":"Introducing 4o image generation","venue":null,"work_id":"a5dbccf5-11e2-4f92-a370-d9af71090f14","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.566176Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:5880ddd3f36a7fb8ec91bdb11477da3dd8c1228ca73617bdae8d0206dc3af45b","observation_id":"acdf7f22-24f3-4123-9275-65a081a6be1d","resolution":{"observed_at":"2026-08-07T12:58:43.564083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08507","last_updated":"2025-05-12T02:14:50Z","snapshot_observed_at":"2026-08-07T17:12:44.716807Z","submitted_at":"2025-03-11T14:57:14Z","title":"Referring to Any Person","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08507","snapshot_observed_at":"2026-08-07T12:58:41.700139Z","title":"Jiang, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.700139Z"},"links":{"cited_paper":"/paper/2503.08507","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:402dce99e87b93e923f5d6f2728d7d4d48ca78c6d4c39c8cdf28ca806abd61a1","observation_id":"bb24df26-8897-467f-9d56-b6617fd084c8","resolution":{"observed_at":"2026-08-07T12:58:41.700139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-13T04:52:37.935795Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-07T12:58:41.794743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.794743Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:9e7bb872fae9de3e94c8ceb08a7f64dce7b9e8bc8015e9abbc292a2da2e4e617","observation_id":"c5744de0-5db0-4b55-8d63-9d2eaea7ad2f","resolution":{"observed_at":"2026-08-07T12:58:41.794743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.267342Z","title":"Misra, A","venue":null,"work_id":"06d7d4ec-3f18-4173-9c29-c8322d15822a","year":2016},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.853680Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:f5b87b024f6b51e5d3da030737226d586c5c464f8acd158f91bc4b2aa6ecdc53","observation_id":"367ddb80-e21e-4b16-9b27-ec44d60e240a","resolution":{"observed_at":"2026-08-07T12:58:43.358602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.087411Z","title":"Zheng, S","venue":null,"work_id":"132aa3e7-1de8-45da-bd0e-999232cb0405","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.993958Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:5a6db872cad7f53b664b930048373d8802c2f2c53d4ec406cd145d34a561cc29","observation_id":"f9766b48-3adb-464c-8d25-642669e61123","resolution":{"observed_at":"2026-08-07T12:58:43.151631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:42.934944Z","title":null,"venue":null,"work_id":"c53d4a00-bd06-4a27-8156-a156d341dd9f","year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:42.108019Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:504df6b08b966a328998129d9a0695b84ffebae878600acf8d247e6ac99250a6","observation_id":"026bfeb0-5807-4aa1-bf08-80c1d41d71fd","resolution":{"observed_at":"2026-08-07T12:58:43.011733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:42.712475Z","title":"Follow the first person you see","venue":null,"work_id":"c0bab5be-2207-4848-a465-1741304f2c1e","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:42.191931Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:997cd0bb272a332e2a8ad7ef0e333f1c496aac6e58e26fb2c790bb06d46cc251","observation_id":"825d91eb-cafc-429c-84de-4c51c9489f29","resolution":{"observed_at":"2026-08-07T12:58:42.802533Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 17 inbound Pith citation observations for arXiv:2505.23189."}