{"as_of":"2026-08-10T16:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c831d3acac7d7191d34b2cb34929abc6a7cf60e77b05eb67bbc559e6b5c63906","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:51:46.426406Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20718/citation-record","integrity":"/paper/2505.20718/integrity","json":"/paper/2505.20718/citation-record.json","paper":"/paper/2505.20718"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:51:43.474536Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.Arxiv Preprint Arxiv:2308.12966, 1(2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.474536Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:e885da5c3df047c2b7f332167dff810e6e7d16a0c4cb6539ec0b92f8a85ecc11","observation_id":"54c4669a-2f11-403f-baaa-d4c2a298f02a","resolution":{"observed_at":"2026-08-07T13:51:43.474536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:43.540009Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.540009Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:9484a3ea24aed78a4e7152d7cb228a000258f19cf7595784f8dd7db4e2b3da14","observation_id":"6ef6bfa1-9b6e-4479-8d86-5dd33924f34b","resolution":{"observed_at":"2026-08-07T13:51:43.540009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.925651Z","title":"Tracking anything with decoupled video segmenta- tion","venue":null,"work_id":"7b5a044c-ce19-4f4b-b5b5-74070707f3c1","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.644671Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:1ee94f3234a1d840721336924e359611816104d1a006c92e5fc6271e70021117","observation_id":"31cb6773-2e01-4d29-8031-b6364f4d8287","resolution":{"observed_at":"2026-08-07T13:51:50.969592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.789565Z","title":null,"venue":null,"work_id":"e8b2340e-b228-4214-ab6b-d257314a9ad0","year":2012},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.761418Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:db4a34a5220a42c88b0ffc1cddec5a6141dc27b1bc978130d5c8b29bbf00f660","observation_id":"5b26f5f9-35cb-44d4-9ce4-4137ccf72add","resolution":{"observed_at":"2026-08-07T13:51:50.855505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.647830Z","title":"Proactive multi-camera collaboration for 3d human pose estimation","venue":null,"work_id":"9beab43e-fb91-4cae-8768-7151d7594be3","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:43.901893Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:383c767e1ea4df9d85bdca15151724a0f2591130ade807306fd82baebc1a0813","observation_id":"704b213d-417b-4f9a-bad5-8c4c6730ff8b","resolution":{"observed_at":"2026-08-07T13:51:50.692694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.529958Z","title":"Enhancing continuous control of mobile robots for end-to-end visual active tracking.Robotics and Autonomous Systems, 142:103799, 2021","venue":null,"work_id":"50452c9d-03e7-44c2-954d-73d34d9f1e17","year":2021},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.059949Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:4c9d51f8f6635af7f1eb1f5ef6ec0978346503b0eb94c3ad6aa8a316d94bf70d","observation_id":"b18b71a2-8040-4c01-aef6-96f5211b6d6d","resolution":{"observed_at":"2026-08-07T13:51:50.605703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.367633Z","title":"E-vat: An asymmetric end-to-end approach to visual active exploration and tracking.IEEE Robotics and Automation Letters, 7(2):4259–4266, 2022","venue":null,"work_id":"0228ce6b-093d-4dfb-a5ce-428a6f101915","year":2022},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.177272Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:158e0dafca73877b4bb181457852829fc163b942b60e12b92708e79440308bf2","observation_id":"f6d464b0-ed64-428e-939c-1a569fac0b7d","resolution":{"observed_at":"2026-08-07T13:51:50.455798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.273203Z","title":"D-vat: End-to-end visual active tracking for micro aerial vehicles.IEEE Robotics and Automation Letters, 2024","venue":null,"work_id":"e42a76b1-41aa-4e1f-a894-28959c23d4c7","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.299789Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:51bf28daca59069ab621ad4e29f4020c0007cf8fcbd2eb297649cb271f7f99a0","observation_id":"cbf17c7f-be72-4e1e-949f-5826f5d84ac8","resolution":{"observed_at":"2026-08-07T13:51:50.324369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:44.418085Z","title":"Memory sharing for large language model based agents.Arxiv Preprint Arxiv:2404.09982, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.418085Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:b8789d27054759b5410c533d21bf43e49f3f413113a85ef93ab6bb077bc8e50c","observation_id":"16a841a7-1f69-462c-b24b-69874cc65de2","resolution":{"observed_at":"2026-08-07T13:51:44.418085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:50.070604Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"ffb376f7-6b34-483f-a8b3-2f7a30cdc8d2","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.500183Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:e425dbc28ce7cc0b6626274f3410eeef82916d06f0c162f8ae3a901dadaa537a","observation_id":"93964576-1afd-41f8-b39a-fd8b7be5de22","resolution":{"observed_at":"2026-08-07T13:51:50.182089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09952","last_updated":"2025-07-01T05:21:49Z","snapshot_observed_at":"2026-07-06T12:49:33.217014Z","submitted_at":"2022-03-14T14:11:12Z","title":"Conquering Ghosts: Relation Learning for Information Reliability Representation and End-to-End Robust Navigation","version":4},"cited_work":{"arxiv_id":"2203.09952","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.09952","snapshot_observed_at":"2026-08-07T13:51:46.571152Z","title":"Conquering Ghosts: Relation Learning for Information Reliability Representation and End-to-End Robust Navigation","venue":"cs.AI","work_id":"4e7609c3-9c29-476b-a6d0-54a21a20cf4e","year":2022},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.571948Z"},"links":{"cited_paper":"/paper/2203.09952","citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:5a680858be9260dc399eb5cc952234aceaec71a343e9e82955034f2307cd06bc","observation_id":"6abaf5df-2d3c-4371-b70e-d389b36ce974","resolution":{"observed_at":"2026-08-07T13:51:46.630634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.919074Z","title":"OpenVLA: An open-source vision-language-action model","venue":null,"work_id":"ab2501df-1821-482c-ad69-90145604a4bb","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.643669Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:b4d7f0595f16abd5825beb32f845778b3d75a4d36ea48c446f3ef5a8bbc4d2a9","observation_id":"55664fc4-dc56-47dd-83c1-d2bd62cba002","resolution":{"observed_at":"2026-08-07T13:51:50.001978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.773405Z","title":"A novel performance evaluation methodology for single-target trackers.IEEE Transactions on Pattern Analysis and Machine Intelligence, 38(11):2137–2155, Nov 2016","venue":null,"work_id":"5757c727-a0b9-4a84-85d4-7e7523fbe673","year":2016},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.737506Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:880cc71cf54583d68e4ff038df38a0a89af61504d4dd113619e8e4894df8193b","observation_id":"7f395053-766f-41b7-ad25-7da0c9e89a57","resolution":{"observed_at":"2026-08-07T13:51:49.824518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.647492Z","title":"Person following robot based on real time single object tracking and rgb-d image","venue":null,"work_id":"84c336f2-f56e-41fd-8d26-1800e20db105","year":2022},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.829613Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:f1d0948c7e444d95490e0629f88b6095da5462c27be8ecb0d7e3d416470496ac","observation_id":"97273674-23de-4b91-ae61-801372c2e4ee","resolution":{"observed_at":"2026-08-07T13:51:49.727647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.449695Z","title":"Blip-2: Boot- strapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"14fb4acd-3b3e-4d87-afe4-1bc36f7bfbd0","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:44.927307Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:d93881388407d23f0d85010acac5bbd7a0f0b8e3e5864606876ca9b5af0f4b97","observation_id":"225dd818-5576-43b6-8d35-e74c33fcbff8","resolution":{"observed_at":"2026-08-07T13:51:49.536692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.266437Z","title":"Vi- sual instruction tuning.Advances in Neural Information Processing Systems, 36:34892–34916, 2023","venue":null,"work_id":"4ce8593a-0454-44c6-a1aa-3a7591ef06ec","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.026284Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:833f3736f41cc0f46e2dabc699cd04387b4443fc54f2d67ac251717d559627a9","observation_id":"4417db72-92aa-45cc-8bf4-bc54c8dfe350","resolution":{"observed_at":"2026-08-07T13:51:49.380606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:49.042223Z","title":"End-to-end active object tracking via reinforcement learning","venue":null,"work_id":"cc7e42aa-2338-41c0-b851-8c0fe8bc4e8f","year":2018},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.123410Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:6a0bda26f6a1ef285f7ccb1829c858a4732753b2d14ac4ee0a356fe35aa24370","observation_id":"6f02cfff-2347-4e62-8510-e8c41d2acedc","resolution":{"observed_at":"2026-08-07T13:51:49.120498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.872720Z","title":"Curious george: An attentive semantic robot.Robotics and Autonomous Systems, 56(6):503–511, 2008","venue":null,"work_id":"37d4f842-0ed5-440f-bdae-9815c0f1f3d7","year":2008},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.249150Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:627740a10f1f05e4a575dbeeb4f2ca8b6111976e70989214db5da29450f51835","observation_id":"093d7d60-5442-4e70-97ac-08a00379108d","resolution":{"observed_at":"2026-08-07T13:51:48.945402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.634967Z","title":"The hands-free push-cart: Autonomous following in front by predicting user trajectory around obstacles","venue":null,"work_id":"9aaf2663-a9ff-45a6-8ec7-bbe45fd14325","year":2018},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.348257Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:2ce46292b0902faa8652bd7939e04a3188c505bc324a2459066007cf4d1c6cd9","observation_id":"2ccb200f-9763-4a12-b6f4-52931b22ea36","resolution":{"observed_at":"2026-08-07T13:51:48.787461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.512525Z","title":"Unrealcv: Virtual worlds for computer vision","venue":null,"work_id":"a3e413a2-5d4f-441a-881c-02dced3b6b61","year":2017},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.423214Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:277b075a4a8a678d32bc877ab9d7f583c44f328f6f93173e2d65e23af3d56c3f","observation_id":"fa7968d5-f715-4a43-bfc7-33a0b93f4ed8","resolution":{"observed_at":"2026-08-07T13:51:48.557921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.305311Z","title":"Tracking multiple moving targets with a mobile robot using particle filters and statistical data association","venue":null,"work_id":"1545b81c-e573-46c6-b8ae-d65469927f3b","year":2001},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.501658Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:f1fb5bd19c8d8b7cb4a76cddcc3f73ae5c8df49747dc22948eea64044dc57e60","observation_id":"a0c6ebb1-b3d7-45f0-a4e9-0f8eadb2f2ef","resolution":{"observed_at":"2026-08-07T13:51:48.406896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:48.070117Z","title":"Accurate and real-time 3-d tracking for the following robots by fusing vision and ultrasonar information","venue":null,"work_id":"2b93a0c3-be9e-44ad-8f25-a68f42037e84","year":2018},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.573732Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:c31ba9a99fdf94463af50fe2d0ac9edcd1ce4e1e140080475006e3b9873a9159","observation_id":"f929f2e8-5a5c-43f3-b8ed-543c40b5b99e","resolution":{"observed_at":"2026-08-07T13:51:48.185872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.888454Z","title":"Vlfm: Vision-language frontier maps for zero-shot semantic navigation","venue":null,"work_id":"a426e0c2-919b-4ad2-a371-0efca9b0e3f4","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.633871Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:fdc1dbed0a889764a2f9fb29c7924163229cf9fe5aba53d8db36532449ffb10f","observation_id":"f698e522-b59a-4366-81c7-c3897d833e31","resolution":{"observed_at":"2026-08-07T13:51:47.971967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-07T13:51:45.712882Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation.Arxiv Preprint Arxiv:2402.15852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.712882Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:73ec54133eb1b142ae33ee0f609a5799f46b6c4d6c2cab4d0769dc023ad4f40e","observation_id":"bf9ea878-827c-4e9a-801d-5334361f5f9f","resolution":{"observed_at":"2026-08-07T13:51:45.712882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:45.745565Z","title":"Vision- language models for vision tasks: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.745565Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:997958f5e3861304e0583b790829af6c63e2dca97491b685910fc97001c52bd6","observation_id":"ae97a3f0-c3f1-4b96-9694-406729479488","resolution":{"observed_at":"2026-08-07T13:51:45.745565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.675072Z","title":"Ad-vat+: An asymmetric dueling mechanism for learning and understanding visual active tracking.IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(5):1467–1482, 2019","venue":null,"work_id":"8963b249-2745-48e5-a708-27600b18183f","year":2019},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.848692Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:a03f5cb0ce34ff3ff66c8bcf5e7db730e5f35ae9f94cd2db15926b0b80dcad6f","observation_id":"b8c1f7a8-18fb-4977-97da-77328d528d46","resolution":{"observed_at":"2026-08-07T13:51:47.772963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.491370Z","title":"AD-V AT: An asymmetric dueling mechanism for learning visual active tracking","venue":null,"work_id":"297247ec-314c-4d59-b5a8-9f57a2bdb715","year":2019},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.913847Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:48f9325d1b1770c1380379cc342d83e92168e7469270aada408bb8d0706ea970","observation_id":"03053d95-a475-4b71-9abf-f544c9f0f1a0","resolution":{"observed_at":"2026-08-07T13:51:47.591371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.296222Z","title":"Towards distraction-robust active visual tracking","venue":null,"work_id":"9fcd2fe7-1549-4ba0-b694-2b588d779976","year":2021},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:45.993230Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:123a80226f3a5b422e54f2cd969ae2d37a8d4a3172194f9907c0221a5f2bdc45","observation_id":"e7dcbe83-8bb0-40c4-ad19-73d0dcef778a","resolution":{"observed_at":"2026-08-07T13:51:47.403448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:47.129911Z","title":"Empowering embodied visual tracking with visual foundation models and offline rl","venue":null,"work_id":"685b60ac-a08f-47ac-8bbd-6bee1e29d049","year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:46.111382Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:7cc2a7b32dec38bfab7c5a4f52d4a7dc8cd9a22697ead7e3ee8cdf348b0c72ac","observation_id":"4ecb89fa-7d86-472b-9434-d00fa02bbbab","resolution":{"observed_at":"2026-08-07T13:51:47.194940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20977","last_updated":"2025-08-12T11:56:32Z","snapshot_observed_at":"2026-07-06T20:14:40.579474Z","submitted_at":"2024-12-30T14:31:01Z","title":"UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20977","snapshot_observed_at":"2026-08-07T13:51:46.216740Z","title":"Unrealzoo: Enriching photo-realistic virtual worlds for embodied ai.ArXiv Preprint ArXiv:2412.20977, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:46.216740Z"},"links":{"cited_paper":"/paper/2412.20977","citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:50aba12e7c63a76827c9bee473f88a02748646f72a6a6b5124f7cf87c7d51472","observation_id":"c0649b78-027a-409b-add2-5304a117d34a","resolution":{"observed_at":"2026-08-07T13:51:46.216740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:46.996834Z","title":"On deep recurrent reinforcement learning for active visual tracking of space noncooperative objects.IEEE Robotics and Automation Letters, 8(8):4418–4425, 2023","venue":null,"work_id":"96629366-872f-4061-92cb-a84ad5454599","year":2023},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:46.295861Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:5b4bdb05b02c98b80600f9e926e3c9f7d5daeee2384df5172ce3f167cd5f4aba","observation_id":"7286d023-c9cd-4e30-b802-7eceb1b93786","resolution":{"observed_at":"2026-08-07T13:51:47.054337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:51:46.811427Z","title":"Navgpt-2: Unleashing navigational reasoning capability for large vision-language models","venue":null,"work_id":"96446551-3afe-474b-bdc0-ab6e8a5f28bd","year":2025},"citing_paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:46.426406Z"},"links":{"citing_paper":"/paper/2505.20718"},"observation_digest":"sha256:d4d0de70bfc68b93acf39fab8f6b8a140fa8cf7ae5b140cbd3def2994d82da85","observation_id":"571ac838-6b22-4f3d-9760-004a84501875","resolution":{"observed_at":"2026-08-07T13:51:46.915857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20718","last_updated":"2025-05-28T15:54:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:45:48.034069Z","submitted_at":"2025-05-27T04:53:50Z","title":"VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2505.20718."}