{"as_of":"2026-08-11T03:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ffd9ead2910389a036b8771df7ad8d0e4fe65d3c87a4547ed6d4d5f17cef0469","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:36:47.038964Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.16300/citation-record","integrity":"/paper/2501.16300/integrity","json":"/paper/2501.16300/citation-record.json","paper":"/paper/2501.16300"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.437092Z","title":"Drone-surveillance for search and rescue in natural disaster,","venue":null,"work_id":"ecbc93f8-c227-47bb-8222-fe7f467f0d26","year":2020},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.910806Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:fd8e0d4e3ee3fd33ac0d5004987a9c11ba985b27cb6370b7d48f036b4db22713","observation_id":"57b3e36c-01d4-4c2f-9d4d-964a380f73df","resolution":{"observed_at":"2026-08-10T13:36:47.440534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.426902Z","title":"Uav-based surveillance sys- tem: an anomaly detection approach,","venue":null,"work_id":"2310eb84-fbc8-4a2b-8863-8e3fb7106253","year":2020},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.915031Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:d25cc1325ceaf93cde3a28ef6f5f9074d8fedf8cd272c823a10d671593a49157","observation_id":"a074eb6b-2ec7-4dc7-9876-858f5084837d","resolution":{"observed_at":"2026-08-10T13:36:47.430667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.416548Z","title":"Anomaly detection, localization and classification for railway inspection,","venue":null,"work_id":"800b4bad-0d3f-49c0-b027-7d443694f0ab","year":2021},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.920533Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:2e2e01d0f9cabc9a005383601c65be950e9d7bcc0d13ef3549aae0b907fd44e3","observation_id":"277fe239-e82f-4781-848f-d604ceec5d7b","resolution":{"observed_at":"2026-08-10T13:36:47.420162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.405243Z","title":"Smart Autopilot Drone System for Surface Surveillance and Anomaly Detection via Customizable Deep Neural Network,","venue":null,"work_id":"3013236a-d5e2-4a85-ab94-8c1a80e00866","year":2020},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.925312Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:7bcff7ea2973e6a4cf217c6c5435c79eaaa9c3f4ff7a3fc3dca15f29f846bf1e","observation_id":"562fa8e3-5678-4b6a-8e7b-43c69ad1c712","resolution":{"observed_at":"2026-08-10T13:36:47.409470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.394236Z","title":"An Autonomous Drone Surveil- lance and Tracking Architecture,","venue":null,"work_id":"28d5b71e-d26f-479a-9a60-9a4bf3ab1707","year":2019},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.929565Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:1958a34004b6fa45cfd2c300ddeb9443b0db8dbaa673085ba7d9cf485f9c6d1b","observation_id":"1b39fa36-b1f5-4cb0-85aa-a096ed0140fd","resolution":{"observed_at":"2026-08-10T13:36:47.397416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.384396Z","title":"Revisiting active perception,","venue":null,"work_id":"7b876186-0af8-4677-896e-f9b0c7fed533","year":2018},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.933881Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:dd9822a8835fa054be78f1aaba52af670218f3dce934167339a4f91500a9b78d","observation_id":"53107d5f-79dc-4e74-994b-decde82468ef","resolution":{"observed_at":"2026-08-10T13:36:47.387325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.375278Z","title":"How to select and use tools?: Active perception of target objects using multimodal deep learning,","venue":null,"work_id":"86a450e8-4a2a-435e-9f1b-36cf9b58638e","year":2021},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.937804Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:9daafbb4f8af89fcc5b33d60cf893380e63f4cc8c2d274b2c8368292d72db466","observation_id":"832c2cf6-c865-4a32-b1dd-b4c4d0b76d48","resolution":{"observed_at":"2026-08-10T13:36:47.378276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.364663Z","title":"Enabling high-resolution pose estimation in real time using active perception,","venue":null,"work_id":"6e426500-d46a-4c0d-a206-898e8ac059ec","year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.941320Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:c4e1ac40cd3194747cc4fec65f87ab9dabcb63622f86ceaa643647be32403e22","observation_id":"620c0bf9-d90a-49b4-a1d9-2c7d3969f640","resolution":{"observed_at":"2026-08-10T13:36:47.368823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00468","last_updated":"2016-10-27T03:50:19Z","snapshot_observed_at":"2026-08-06T13:04:32.551262Z","submitted_at":"2015-05-03T20:07:39Z","title":"VQA: Visual Question Answering","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00468","snapshot_observed_at":"2026-08-10T13:36:46.944501Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.944501Z"},"links":{"cited_paper":"/paper/1505.00468","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:60193e60add574201c959b392f1740876b597847cb8882054eb8ec79a242fa88","observation_id":"6a24c768-beac-4a7d-bf61-1f5a1ee340cb","resolution":{"observed_at":"2026-08-10T13:36:46.944501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.354971Z","title":"Mqa: Answering the question via robotic manipulation,","venue":null,"work_id":"71029dfb-1eea-4a7b-a6c1-477c01659100","year":2021},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.948221Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:3b4a21cee0918f4ed6cf5ab31e9d470b2e96d43a442201461732c99a10ed4245","observation_id":"bd11874c-d85c-4564-94bb-0c22a67b3ece","resolution":{"observed_at":"2026-08-10T13:36:47.358303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.03316","last_updated":"2018-09-06T17:05:18Z","snapshot_observed_at":"2026-07-06T06:13:32.542717Z","submitted_at":"2017-12-09T00:13:59Z","title":"IQA: Visual Question Answering in Interactive Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.03316","snapshot_observed_at":"2026-08-10T13:36:46.952315Z","title":"Iqa: Visual question answering in interactive environments,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.952315Z"},"links":{"cited_paper":"/paper/1712.03316","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:a3ec1c5a1f0385a467dfd48f320e939156a1262269fca40cba9a8cc8ba31f2de","observation_id":"da900d3b-1e19-4d97-b39b-f5d63e0bb375","resolution":{"observed_at":"2026-08-10T13:36:46.952315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.11543","last_updated":"2017-12-01T16:55:05Z","snapshot_observed_at":"2026-08-08T15:31:13.967752Z","submitted_at":"2017-11-30T18:06:47Z","title":"Embodied Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.11543","snapshot_observed_at":"2026-08-10T13:36:46.957015Z","title":"Embodied question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.957015Z"},"links":{"cited_paper":"/paper/1711.11543","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:cd9ad7e83f1265bf83de0b1d78d263e1f6046b5ad9f285738a595c44b951acb1","observation_id":"13afe0da-296d-4e28-a43b-af366314ef4b","resolution":{"observed_at":"2026-08-10T13:36:46.957015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17582","last_updated":"2023-07-19T19:30:28Z","snapshot_observed_at":"2026-08-10T15:45:38.685191Z","submitted_at":"2023-02-20T06:39:06Z","title":"ChatGPT for Robotics: Design Principles and Model Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17582","snapshot_observed_at":"2026-08-10T13:36:46.960733Z","title":"Chatgpt for robotics: Design principles and model abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.960733Z"},"links":{"cited_paper":"/paper/2306.17582","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:8bbaece4ff71dc09ce805ae55dfc59ea06c4d183e683987cd1dc883570574288","observation_id":"cbe56b3e-4bca-4619-8965-da5ec86f36c3","resolution":{"observed_at":"2026-08-10T13:36:46.960733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.344132Z","title":"From words to flight: Integrating openai chatgpt with px4/gazebo for natural language-based drone control,","venue":null,"work_id":"6350a237-ccf8-41b1-a71a-948d39ca388d","year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.964114Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:cdfa01c48b6d5c99021817dd220a14fe0e36ccc39c883c7085e0dd804eba9469","observation_id":"1be16067-693c-42cf-8be6-e2497f774153","resolution":{"observed_at":"2026-08-10T13:36:47.348856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12529","last_updated":"2023-04-25T02:48:35Z","snapshot_observed_at":"2026-08-05T16:03:34.656858Z","submitted_at":"2023-04-25T02:48:35Z","title":"Improved Trust in Human-Robot Collaboration with ChatGPT","version":1},"cited_work":{"arxiv_id":"2304.12529","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.12529","snapshot_observed_at":"2026-08-10T13:36:47.264524Z","title":"Improved Trust in Human-Robot Collaboration with ChatGPT","venue":"cs.RO","work_id":"321d1827-a07e-4e43-a07a-b621ce6a0786","year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.967076Z"},"links":{"cited_paper":"/paper/2304.12529","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:43f6a8f130de651bef8388e2fcc31c6f75dca3c0a6e5363a048a40548e90272e","observation_id":"7f599fab-b503-46dc-875c-d68c812bd158","resolution":{"observed_at":"2026-08-10T13:36:47.267969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-08-05T02:35:14.331933Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07753","snapshot_observed_at":"2026-08-10T13:36:46.970913Z","title":"Code as policies: Language model programs for embodied control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.970913Z"},"links":{"cited_paper":"/paper/2209.07753","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:799f229890c3fd35818b21cfa415f7913072d090d1e0c9f3104c7828195c26cc","observation_id":"c527dd44-b5a7-4888-b178-4e6a5d642e5f","resolution":{"observed_at":"2026-08-10T13:36:46.970913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-10T13:36:46.974893Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.974893Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:b0fa88c6958473743ffc5f0b929fe042b699ca5c074f5230d05596d8ae950d08","observation_id":"173042e0-8a50-4801-bf65-0e12f766c645","resolution":{"observed_at":"2026-08-10T13:36:46.974893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-03T00:52:54.308486Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-08-10T13:36:46.978558Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.978558Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:20f158c78f202bf29bd846a40145d33a60325f6bcab5ce50b9f5ed546179f729","observation_id":"daf1eb64-5784-4abf-be05-02e01b005862","resolution":{"observed_at":"2026-08-10T13:36:46.978558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-10T13:36:46.982427Z","title":"Next-gpt: Any-to-any multimodal llm,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.982427Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:28a46aeeeb2b5f1d079fa1b18a0875552e316445fd30e8cdc8050d3a7dbf83f4","observation_id":"d322d50f-c322-4a2d-b23c-5cf795ace02f","resolution":{"observed_at":"2026-08-10T13:36:46.982427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.12098","last_updated":"2021-09-24T17:44:28Z","snapshot_observed_at":"2026-08-09T12:48:09.372572Z","submitted_at":"2021-09-24T17:44:28Z","title":"CLIPort: What and Where Pathways for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.12098","snapshot_observed_at":"2026-08-10T13:36:46.986323Z","title":"Cliport: What and where pathways for robotic manipulation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.986323Z"},"links":{"cited_paper":"/paper/2109.12098","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:71632a4c9bdc1a990960e2f1652353e693e827987a354c578b6a0d82d3707e99","observation_id":"2344987a-d7e5-43f0-abe9-cc1f789d65fc","resolution":{"observed_at":"2026-08-10T13:36:46.986323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13411","last_updated":"2022-03-25T01:36:56Z","snapshot_observed_at":"2026-07-06T12:52:12.756807Z","submitted_at":"2022-03-25T01:36:56Z","title":"Reshaping Robot Trajectories Using Natural Language Commands: A Study of Multi-Modal Data Alignment Using Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13411","snapshot_observed_at":"2026-08-10T13:36:46.990166Z","title":"Reshap- ing robot trajectories using natural language commands: A study of multi-modal data alignment using transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.990166Z"},"links":{"cited_paper":"/paper/2203.13411","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:ba6e437ed8e6958f4f08416d0ae2e5cbd109ec4fe1ba95f36c5b2aa40ff6f5d7","observation_id":"bff4d29b-e310-4ea5-a42d-8c335460711c","resolution":{"observed_at":"2026-08-10T13:36:46.990166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12083","last_updated":"2020-10-22T21:49:08Z","snapshot_observed_at":"2026-07-06T10:07:28.516350Z","submitted_at":"2020-10-22T21:49:08Z","title":"Language-Conditioned Imitation Learning for Robot Manipulation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.12083","snapshot_observed_at":"2026-08-10T13:36:46.994006Z","title":"Language-conditioned imitation learning for robot manipulation tasks,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.994006Z"},"links":{"cited_paper":"/paper/2010.12083","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:1ae6a2d0236374bfd525074c318d9ad6aa5d809b93a0a622c7bf22d8be52c792","observation_id":"52183c54-24ef-4bac-85e0-c49cd5f09f8f","resolution":{"observed_at":"2026-08-10T13:36:46.994006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06594","last_updated":"2023-03-12T07:22:08Z","snapshot_observed_at":"2026-08-10T09:51:58.628373Z","submitted_at":"2023-03-12T07:22:08Z","title":"ChatGPT Asks, BLIP-2 Answers: Automatic Questioning Towards Enriched Visual Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06594","snapshot_observed_at":"2026-08-10T13:36:46.998013Z","title":"Chatgpt asks, blip-2 answers: Automatic questioning towards enriched visual descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:46.998013Z"},"links":{"cited_paper":"/paper/2303.06594","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:ec12c7365bce2948149e76a08e968b0785c636146481cc78f7b6fdd5ac4b5d27","observation_id":"1d5e2dff-c3ec-4264-a377-9251356a8c71","resolution":{"observed_at":"2026-08-10T13:36:46.998013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17718","last_updated":"2023-11-15T14:57:32Z","snapshot_observed_at":"2026-08-10T18:39:08.811385Z","submitted_at":"2023-05-28T13:16:03Z","title":"FuseCap: Leveraging Large Language Models for Enriched Fused Image Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17718","snapshot_observed_at":"2026-08-10T13:36:47.001883Z","title":"Fusecap: Leveraging large language models for enriched fused image captions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.001883Z"},"links":{"cited_paper":"/paper/2305.17718","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:3fd8680250100dc3c2322df09c360b3fc9f4a9a3c0700fca838ce4d2f0e524b9","observation_id":"010e847c-9302-424c-a73c-063377be89db","resolution":{"observed_at":"2026-08-10T13:36:47.001883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20062","last_updated":"2023-10-05T16:40:02Z","snapshot_observed_at":"2026-07-06T15:36:07.713593Z","submitted_at":"2023-05-31T17:38:08Z","title":"Chatting Makes Perfect: Chat-based Image Retrieval","version":2},"cited_work":{"arxiv_id":"2305.20062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.20062","snapshot_observed_at":"2026-08-10T13:36:47.159562Z","title":"Chatting Makes Perfect: Chat-based Image Retrieval","venue":"cs.CV","work_id":"397262fc-88b6-462b-9c93-912c71cb6bdc","year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.005170Z"},"links":{"cited_paper":"/paper/2305.20062","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:12c9d0e6ea89878cf01af79bca0eb78d5078108e28bd8ba192ffd5c1b8ee9b29","observation_id":"d76c90cc-2e2e-4689-92bf-42705971823b","resolution":{"observed_at":"2026-08-10T13:36:47.164816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.332983Z","title":"Machine-to-machine visual dialoguing with chatgpt for enriched textual image description,","venue":null,"work_id":"ef0fc827-1994-437f-ba54-479ff2c182d7","year":2024},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.008423Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:cd661a8e98c5af5b81d3be0363149eb28ae86331b0a24e1a376a4987e76b868c","observation_id":"e2cadad3-4a4a-4084-b589-f3f46edb67f9","resolution":{"observed_at":"2026-08-10T13:36:47.337084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09699","last_updated":"2023-08-17T21:43:24Z","snapshot_observed_at":"2026-08-05T17:48:17.937618Z","submitted_at":"2022-11-15T19:07:53Z","title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09699","snapshot_observed_at":"2026-08-10T13:36:47.011389Z","title":"Promptcap: Prompt- guided task-aware image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.011389Z"},"links":{"cited_paper":"/paper/2211.09699","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:e5418f1653ff47e773f36db45af8ffa12a859d42d3f7b8db8876a6e9b8fc0250","observation_id":"f25cd4fd-ab43-4b69-9d3b-cccf5b3696c3","resolution":{"observed_at":"2026-08-10T13:36:47.011389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01903","last_updated":"2025-04-29T02:07:44Z","snapshot_observed_at":"2026-07-06T14:58:18.255439Z","submitted_at":"2023-03-03T13:05:15Z","title":"Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering","version":4},"cited_work":{"arxiv_id":"2303.01903","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.01903","snapshot_observed_at":"2026-08-10T13:36:47.133329Z","title":"Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering","venue":"cs.CV","work_id":"be2479cd-c489-4c98-93ec-7e67b9715c4c","year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.015132Z"},"links":{"cited_paper":"/paper/2303.01903","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:a2c40d811353442053c4c2f638e7fe6b191394382867194db9bfa7df5b46a714","observation_id":"34153d35-58dc-42d9-a02e-55e44b1724a3","resolution":{"observed_at":"2026-08-10T13:36:47.139732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13626","last_updated":"2022-10-24T22:01:17Z","snapshot_observed_at":"2026-08-09T13:16:04.286962Z","submitted_at":"2022-10-24T22:01:17Z","title":"VLC-BERT: Visual Question Answering with Contextualized Commonsense Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13626","snapshot_observed_at":"2026-08-10T13:36:47.018356Z","title":"Vlc-bert: Visual question answering with contextualized commonsense knowledge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.018356Z"},"links":{"cited_paper":"/paper/2210.13626","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:ff23bebcb605dc2d5ab1045b36001c2608afff9160c27c3c9f6c44327046b29d","observation_id":"0249b1ac-f2ad-487e-af56-079b4dfe6739","resolution":{"observed_at":"2026-08-10T13:36:47.018356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08773","last_updated":"2023-03-20T02:55:26Z","snapshot_observed_at":"2026-07-06T14:06:30.548204Z","submitted_at":"2022-10-17T06:29:54Z","title":"Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08773","snapshot_observed_at":"2026-08-10T13:36:47.021721Z","title":"Plug-and-play vqa: Zero-shot vqa by conjoining large pretrained models with zero training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.021721Z"},"links":{"cited_paper":"/paper/2210.08773","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:87623aaa757a3c09768349b440c1d794bb06f1144752aadee3323e8faccbda0b","observation_id":"23cb99ee-bade-4bd4-b0ee-3bb7ff2ac78d","resolution":{"observed_at":"2026-08-10T13:36:47.021721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T13:36:47.024939Z","title":"Blip: Bootstrapping language-imagepre-training forunifiedvision-languageunderstandingandgeneration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.024939Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:6ed92ef87e0bbb925ad33cc7840d634dcc8b7dee26d4123d1074877d4fed3de9","observation_id":"887e33d7-f74e-4daa-94d3-23655e2efce0","resolution":{"observed_at":"2026-08-10T13:36:47.024939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.323286Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localiza- tion,","venue":null,"work_id":"e87227b6-2497-4317-86ad-78166dd29fae","year":2017},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.028281Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:e0e8639a0c57fbf26b6aecdd6f1b98bedbadb28f9aa196a9debb954776910f30","observation_id":"38739c18-28b0-4a8e-90ec-ad2667964874","resolution":{"observed_at":"2026-08-10T13:36:47.326532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:36:47.314068Z","title":"Language models are few-shot learners,","venue":null,"work_id":"d7c69d5a-b543-47d7-9fac-45ab2bbb8b21","year":1901},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.032272Z"},"links":{"citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:b1e2234ea03db5f868d6e7235f0595496684cdf5ec4c5398c13a7a55aa7a5110","observation_id":"0b38760c-98d3-4267-946a-45dc47b5ff23","resolution":{"observed_at":"2026-08-10T13:36:47.317362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-10T13:36:47.035424Z","title":"Siren’s song in the ai ocean: A survey on hallucination in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.035424Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:febcbbcbb21d76175d90fba0a733fc380e44859e1efdcc9d9e21a5c25bfc1cf0","observation_id":"fe8a8b84-3886-4aec-89ea-9975e9b20918","resolution":{"observed_at":"2026-08-10T13:36:47.035424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.05065","last_updated":"2017-07-18T05:30:28Z","snapshot_observed_at":"2026-07-06T05:42:36.249572Z","submitted_at":"2017-05-15T04:06:22Z","title":"AirSim: High-Fidelity Visual and Physical Simulation for Autonomous Vehicles","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.05065","snapshot_observed_at":"2026-08-10T13:36:47.038964Z","title":"Airsim: High-fidelity visual and phys- ical simulation for autonomous vehicles,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.038964Z"},"links":{"cited_paper":"/paper/1705.05065","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:178478d22610f17915f39c1046c3c6f7190a82f9414add51e67e99b16fb654ae","observation_id":"c7835dad-8a51-4355-94f4-56c73e1af144","resolution":{"observed_at":"2026-08-10T13:36:47.038964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T18:39:02.989894Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2501.16300."}