{"as_of":"2026-08-11T17:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53e5f80f0d7c7e12e9ef02340d3959c64f04ec4d77b2990259eed05791c8f2e8","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:53:23.400359Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09584/citation-record","integrity":"/paper/2509.09584/integrity","json":"/paper/2509.09584/citation-record.json","paper":"/paper/2509.09584"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:16.711792Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:16.711792Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:e7ed075930fa64690675248eea348f90a1d4a2d972945b0a8f8d496f7ae49651","observation_id":"69f8be74-7cac-4b03-a998-323700a8bb09","resolution":{"observed_at":"2026-08-04T18:53:16.711792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:16.779199Z","title":"Ddd17: End-to-end davis driving dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:16.779199Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:49f431df22b6fd03b7ab987aed1aff850f51dd22121182ad3d60fc1a58fed094","observation_id":"d1f5e596-55f8-441e-91d0-d4cf340d0404","resolution":{"observed_at":"2026-08-04T18:53:16.779199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:16.875833Z","title":"A 240× 180 130 db 3 µs latency global shutter spatiotemporal vision sensor.IEEE Journal of Solid-State Circuits, 49(10):2333–2341, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:16.875833Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:bf3184ba6fe9ebbd116392a26cef08b8e4667131442fc93b5c8db15f9c98ca22","observation_id":"69c1ee43-07b2-48ae-b118-ab830b972185","resolution":{"observed_at":"2026-08-04T18:53:16.875833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.025049Z","title":"Low-latency event- based visual odometry","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.025049Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3b809b9bf84db080e3d5e7ddf2b7575af3da44d767107b2c024fae276a08c453","observation_id":"98c6c956-dcba-4818-8dd2-0d914c2d18dc","resolution":{"observed_at":"2026-08-04T18:53:17.025049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.086524Z","title":"Recent event camera innovations: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.086524Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:2e3eb013238619866e87d8b5e7520e960d27de27bc5f3206605fa53f7ada4fba","observation_id":"812efb98-3bb6-4df0-a546-fca4dfcbabce","resolution":{"observed_at":"2026-08-04T18:53:17.086524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.171789Z","title":"Ani Hsieh, Christopher Korpela, Vijay Kumar, Camillo J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.171789Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:f67e0fce70584d8fd61c37c76362b0b8f760ae2b7fe3c2de8def98e0899d2ff3","observation_id":"604bbfe8-1575-49fb-b0e0-df83954a0642","resolution":{"observed_at":"2026-08-04T18:53:17.171789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.228085Z","title":"Chang, and Matthias Nießner","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.228085Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:391f2d0361bf65c8760c3ff8425403203ac7736e1f1043d3a9c5ffd8739c7508","observation_id":"3120291f-ef87-4642-95bd-780b57ec269a","resolution":{"observed_at":"2026-08-04T18:53:17.228085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.328796Z","title":"Ecmd: An event- centric multisensory driving dataset for slam.IEEE Trans- actions on Intelligent Vehicles, 9(1):407–416, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.328796Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:2c6786eecfb716e9068e3db83650af5be8f4ff42fdbfcf2c9781e9737592ff52","observation_id":"9dd5731d-f533-444f-9522-fec36163e9a6","resolution":{"observed_at":"2026-08-04T18:53:17.328796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.460244Z","title":"Label-free event-based object recognition via joint learning with image reconstruction from events","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.460244Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:f53a83acdade43cbca54c2fddaf68b35d4ef8f0fb79359db704ad988a8461b0f","observation_id":"8449ba3d-9002-4fe7-af7e-5478e78a9ba0","resolution":{"observed_at":"2026-08-04T18:53:17.460244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.472259Z","title":"Hue dataset: High-resolution event and frame sequences for low-light vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.472259Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:1f92fe7eb0540cbbab4e6f895140e31d7b081e2a6febc67b627037cb7849ba7e","observation_id":"1ebde21e-ece5-44c5-abea-f91f2ac3c1bd","resolution":{"observed_at":"2026-08-04T18:53:17.472259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.565742Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.565742Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:4bdafd1b03723b3f841c6bfcb314b39fdb708e9a1ee621ceb8cfd4988dcfd621","observation_id":"2de6aadd-110a-4a02-afae-093159054501","resolution":{"observed_at":"2026-08-04T18:53:17.565742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:17.718226Z","title":"Event-based vision: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(1):154–180, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.718226Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:1f057414c5956efb2057a00a0ad620c7a962d9061b5838996de6c0fdfc6f3282","observation_id":"c19388c7-655a-4400-9167-f201aef53796","resolution":{"observed_at":"2026-08-04T18:53:17.718226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12324","last_updated":"2022-11-22T15:14:20Z","snapshot_observed_at":"2026-08-10T22:15:32.689165Z","submitted_at":"2022-11-22T15:14:20Z","title":"Pushing the Limits of Asynchronous Graph-based Object Detection with Event Cameras","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12324","snapshot_observed_at":"2026-08-04T18:53:17.922881Z","title":"Pushing the limits of asynchronous graph-based object detection with event cam- eras.arXiv preprint arXiv:2211.12324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:17.922881Z"},"links":{"cited_paper":"/paper/2211.12324","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:f83591c60258852ec5fc85edc185c9edcdbf1ab6c49fb7f51b560ef19f0fb850","observation_id":"cb074fa5-adc8-4d99-b9f9-b002b0c68582","resolution":{"observed_at":"2026-08-04T18:53:17.922881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.080959Z","title":"Low-latency auto- motive vision with event cameras.Nature, 629(8014):1034– 1040, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.080959Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:203173dca7b7cb23fdc3a5a7a6d1d08642e3fdce7679a788bbbd9799f4676f53","observation_id":"18caaa36-f412-4dfe-9ea3-e6e7f4bf35ec","resolution":{"observed_at":"2026-08-04T18:53:18.080959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.202202Z","title":"Derpa- nis, and Davide Scaramuzza","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.202202Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:62a7c9f4b0210f2c3381f7dca3b671cc2ec37beb520a2ba58fcdb9ebfc384a14","observation_id":"5fdf2387-b515-48bf-95b0-dcea9ddbb869","resolution":{"observed_at":"2026-08-04T18:53:18.202202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.285558Z","title":"Recurrent vision transformers for object detection with event cameras","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.285558Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:69ef0556948dd66cc223d1df341c93d2acd09079b7fb27e5069209cdac1d6d92","observation_id":"1a25491f-8afb-4728-b0d6-35c88699b11e","resolution":{"observed_at":"2026-08-04T18:53:18.285558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.440348Z","title":"Dsec: A stereo event camera dataset for driving scenarios.RA-L, 6(3):4947–4954, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.440348Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:c482905bde1d44900784bcf10861ce1a6f4cce30e8782c2051faff0bef3995d2","observation_id":"3c0223c5-0866-42c2-8e35-87e5fc47245e","resolution":{"observed_at":"2026-08-04T18:53:18.440348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.547303Z","title":"Hierarchical neural memory network for low latency event processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.547303Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:f00c1a9b4d7aed152717f30ef576306299717889c7d0f39bdda93d6060d3a971","observation_id":"38aad683-308f-4962-81d7-1aa0b95ee867","resolution":{"observed_at":"2026-08-04T18:53:18.547303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14178","last_updated":"2024-06-20T10:36:24Z","snapshot_observed_at":"2026-08-11T08:37:03.465711Z","submitted_at":"2024-06-20T10:36:24Z","title":"EvSegSNN: Neuromorphic Semantic Segmentation for Event Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14178","snapshot_observed_at":"2026-08-04T18:53:18.693039Z","title":"Evsegsnn: Neuromor- phic semantic segmentation for event data.arXiv preprint arXiv:2406.14178, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.693039Z"},"links":{"cited_paper":"/paper/2406.14178","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:0eba6240ae5a30cfab63973e353b0fb5cc0ad200317be91067723e2c10c2d5f2","observation_id":"38340529-7389-4bde-9620-4e99574ff1b9","resolution":{"observed_at":"2026-08-04T18:53:18.693039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.804191Z","title":"Event-aided direct sparse odometry","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.804191Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:13a37ef0c254e94bf76b7477ee8cfb8b8979c2dc74a13d04db51be17656ddda7","observation_id":"fbdb2d52-d332-4dfb-8201-ca949ba2871f","resolution":{"observed_at":"2026-08-04T18:53:18.804191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:18.904765Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:18.904765Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:4636cd5e423e3f13c17f6c5299dbdb1139be3de12875735ce10a2f8cb7076cd7","observation_id":"c1612e61-40f1-48e5-8a64-d4f37246e77b","resolution":{"observed_at":"2026-08-04T18:53:18.904765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.007993Z","title":"To- wards robust event-based networks for nighttime via un- paired day-to-night event translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.007993Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:018f03a8adc093fad7f9ade1c243187b21917e30b97b2e9ed420cf11f3165951","observation_id":"e6cf6090-8380-4912-91a8-0dcf3bd6087f","resolution":{"observed_at":"2026-08-04T18:53:19.007993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.116994Z","title":"Efficient learning of event-based dense representation using hierarchical mem- ories with adaptive update","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.116994Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:93e91f7d02e832587a5de5c012584124142530116d626e725242a326fb5e110d","observation_id":"b07174ee-b7ff-4c9b-afe7-69ff6ceb6594","resolution":{"observed_at":"2026-08-04T18:53:19.116994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.219250Z","title":"Mdetr- modulated detection for end-to-end multi-modal understand- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.219250Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:a6a97b0aebf5b3c28aaaebedf4a4fce2c8cf5b16aaff276a9ce87a3705d7590c","observation_id":"8de88b94-d785-436a-a551-ea26c542909e","resolution":{"observed_at":"2026-08-04T18:53:19.219250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.332871Z","title":"N-imagenet: Towards robust, fine-grained object recognition with event cameras","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.332871Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:54e975bcd4f4fb5482fb47f028cd8e3e5bed2496d63e24b4c9e95f5eabd7b39b","observation_id":"5f94b1a8-501b-4bfb-a98b-b86d1f6d491f","resolution":{"observed_at":"2026-08-04T18:53:19.332871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.384828Z","title":"Text2pos: Text-to-point-cloud cross-modal localiza- tion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.384828Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:a6bd6e25a215a599ef0c13c643412d87fa6c148272a961ef8517720e0965c3e8","observation_id":"e636b6b6-0efd-44cf-a42e-336769241ac4","resolution":{"observed_at":"2026-08-04T18:53:19.384828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.470423Z","title":"Cot- tereau, and Wei Tsang Ooi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.470423Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3aed465d2cacbb444aef20dd05b4ae54ae370638dda3df7be337dc5f67ba37f3","observation_id":"591eee3d-5201-400a-a832-6d45a007cf84","resolution":{"observed_at":"2026-08-04T18:53:19.470423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.515309Z","title":"Cottereau","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.515309Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ad77f8b660b56136e2ef593f36e198f8a67d2d5633550cd2e84a30a786322eda","observation_id":"0cec2ff5-7746-4472-8cd6-c47af8cb8d5c","resolution":{"observed_at":"2026-08-04T18:53:19.515309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.618601Z","title":"Geochat: Grounded large vision-language model for remote sensing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.618601Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:7580d32f5bc4bf15da7d849d534d31273897c11b5f409287625747065c44961a","observation_id":"7959cc76-6d31-4504-bdae-4f24635120d7","resolution":{"observed_at":"2026-08-04T18:53:19.618601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.674869Z","title":"Seeground: See and ground for zero-shot open- vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.674869Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ef149343e57828903186fcca6441848b9af104401f207b52e9d8ff0e4de29d8b","observation_id":"c4b6f792-9791-421a-954e-bf645d135e37","resolution":{"observed_at":"2026-08-04T18:53:19.674869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.772654Z","title":"Wildrefer: 3d object localization in large-scale dynamic scenes with multi-modal visual data and natural language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.772654Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3e6ae99d822bafd243aca26a83f3f39c13c9d8bd008bf55610d5b94a0abcef33","observation_id":"32ce420a-2a4b-4cc4-8520-fc47f1705e98","resolution":{"observed_at":"2026-08-04T18:53:19.772654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:19.882366Z","title":"Context-aware biaffine localizing network for temporal sentence grounding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:19.882366Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:8f9f71863af4ddeb9af69bce8c6a8ef8cc0e83c8cb178a7be0ab40fa977f6359","observation_id":"78f4b495-06a5-4a18-824a-f05c2809d2e7","resolution":{"observed_at":"2026-08-04T18:53:19.882366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.038042Z","title":"Explor- ing optical-flow-guided motion and detection-based appear- ance for temporal sentence grounding.IEEE Transactions on Multimedia, 25:8539–8553, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.038042Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:0df86395766ac31e442681ff6b5113dc02e19894587e3f9b7ab6b76a5a4f8d2b","observation_id":"81f6967e-e016-4b5a-89ec-df26cbbb2dcf","resolution":{"observed_at":"2026-08-04T18:53:20.038042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05785","last_updated":"2024-07-22T03:21:27Z","snapshot_observed_at":"2026-08-11T16:36:20.688663Z","submitted_at":"2024-06-09T13:52:12Z","title":"A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05785","snapshot_observed_at":"2026-08-04T18:53:20.096462Z","title":"A survey on text-guided 3d visual grounding: elements, recent advances, and future directions.arXiv preprint arXiv:2406.05785, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.096462Z"},"links":{"cited_paper":"/paper/2406.05785","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:46cea86efa2508cbcaee822be75ddcc85fab4ecb2dc5ab061111149974f380db","observation_id":"9b9c0c3d-8455-4aa1-bcb5-17bf349d7ccf","resolution":{"observed_at":"2026-08-04T18:53:20.096462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.171807Z","title":"Flexevent: Towards flexible event-frame object detection at varying operational frequen- cies.arXiv preprint arXiv:2412.06708, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.171807Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:67b39f477b2e062147f64c77f648db8cec8379fddddea72c84d13ee7fae6f401","observation_id":"e163339a-9e25-4824-b2a7-1d658ec8ee71","resolution":{"observed_at":"2026-08-04T18:53:20.171807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.278165Z","title":"Maqueda, Antonio Loquercio, Guillermo Gallego, Narciso Garc´ıa, and Davide Scaramuzza","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.278165Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:b6abf744daa4a46ba02a1715803ea8cdb796ed131095adafa3bf56ecdcccc651","observation_id":"d5f91996-8210-4f01-9f8b-73897c6ad2b7","resolution":{"observed_at":"2026-08-04T18:53:20.278165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.381657Z","title":"Cityrefer: geography-aware 3d visual grounding dataset on city-scale point cloud data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.381657Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:75cc80d1f24ca0871d7d8a0ccdaec147c83c70b28cfe13d369a8d0f416b4a7fd","observation_id":"7eaba23c-de75-4a18-b29e-0224efeb4b8a","resolution":{"observed_at":"2026-08-04T18:53:20.381657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.428654Z","title":"Continuous-time visual-inertial odometry for event cameras.IEEE Transactions on Robotics, 34(6): 1425–1440, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.428654Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:6b7130708f41f77c31d50b23d42c187b545ed390b6de87f6abcb962ea5409eb2","observation_id":"7797965c-a0eb-4c28-9a81-6761acaf2ef3","resolution":{"observed_at":"2026-08-04T18:53:20.428654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.529010Z","title":"Learning to detect objects with a 1 megapixel event camera","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.529010Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:1446e35f7f3174f065fd7368e9ccc3a0d16af8cb1c662de4277152cf8d0888c7","observation_id":"aff60c32-9c5d-4d1f-ba0b-d1404e72fcb1","resolution":{"observed_at":"2026-08-04T18:53:20.529010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01801","last_updated":"2024-04-02T10:03:23Z","snapshot_observed_at":"2026-08-10T10:16:33.412388Z","submitted_at":"2024-04-02T10:03:23Z","title":"EventSleep: Sleep Activity Recognition with Event Cameras","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01801","snapshot_observed_at":"2026-08-04T18:53:20.590680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.590680Z"},"links":{"cited_paper":"/paper/2404.01801","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:4fbda8014317faef4bbe13a186519c903d242645ac5d0237cf7094511382feb9","observation_id":"332ce6a3-269d-43a1-a833-8c0fee9fb132","resolution":{"observed_at":"2026-08-04T18:53:20.590680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.672133Z","title":"A qvga 143 db dynamic range frame-free pwm image sensor with lossless pixel-level video compression and time-domain cds.IEEE Journal of Solid-State Circuits, 46(1):259–275, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.672133Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:6ac1990b565c430e102795dfabad06f404a5ae6924e91d8f4c44db1931ff69e1","observation_id":"f2fb0a5a-ad70-4f47-bf88-903ebd005715","resolution":{"observed_at":"2026-08-04T18:53:20.672133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.707806Z","title":"High speed and high dynamic range video with an event camera.IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(6):1964–1980, 2019","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.707806Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:6d2d469971c1a66c30db922e402d6ad101deb1958469d7c1bf7c68b39c164cc7","observation_id":"00b2254c-78ae-405e-9459-e2311cf5c01c","resolution":{"observed_at":"2026-08-04T18:53:20.707806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.784390Z","title":"4.1 a 640×480 dynamic vision sensor with a 9µm pixel and 300meps address-event representation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.784390Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:cf12389966998266ffb4a9c34edfc0614003db2e82b0e2ff0115caffb7da3965","observation_id":"0108e2a9-53a4-479c-b8b5-f645d079c93a","resolution":{"observed_at":"2026-08-04T18:53:20.784390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.859457Z","title":"Neuromor- phic stereo vision: A survey of bio-inspired sensors and al- gorithms.Frontiers in Neuroscience, 13:28, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.859457Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:18f8e753076b753b6f314706b2b17e0678c617e89a599074f15a78dfbca98e04","observation_id":"6f7544a8-8eb7-465f-bcf7-c4e5bb0bdcbd","resolution":{"observed_at":"2026-08-04T18:53:20.859457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.943356Z","title":"Visual grounding in remote sensing images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.943356Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:42b7489b565a73e7f20a1d59ec010a5cb747e18168dfb5b3c346492b10fc2245","observation_id":"8fb4ab4e-9312-4d6a-9754-2bf1df0567a6","resolution":{"observed_at":"2026-08-04T18:53:20.943356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:20.993119Z","title":"Ess: Learning event-based semantic seg- mentation from still images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:20.993119Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:b39081c016a11ae57c3d9a4c8d04b70949140561cd99c1f38feee722d14a9294","observation_id":"0b04a64b-0355-4c43-8873-c722343a8487","resolution":{"observed_at":"2026-08-04T18:53:20.993119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.053055Z","title":"Learning two-branch neural networks for image-text match- ing tasks.IEEE Transactions on Pattern Analysis and Ma- chine Intelligence, 41(2):394–407, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.053055Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ff94cba7c977c226320ef35425682eb1767d87bc8b22f4bf15849f83db0e0653","observation_id":"8d483adc-a39f-4594-99ec-220cb171a105","resolution":{"observed_at":"2026-08-04T18:53:21.053055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.153297Z","title":"Neighbourhood watch: Refer- ring expression comprehension via language-guided graph attention networks","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.153297Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:4cd4acf7291a1403452273f294fac2953d5e07c80b50be1f9d266e7cd61ecc6e","observation_id":"5cca9e3e-b8e9-4a4e-bc29-1f194ac66429","resolution":{"observed_at":"2026-08-04T18:53:21.153297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T18:53:21.269032Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.269032Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:b8591c322ab13e1f02bc1c3cb65c2a25222b471cdadb257b0c488ac0dc19c3cb","observation_id":"7a07f36c-2589-4d7c-a274-8275e3410f27","resolution":{"observed_at":"2026-08-04T18:53:21.269032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.392604Z","title":"Event stream-based visual object tracking: A high-resolution benchmark dataset and a novel baseline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.392604Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:22333839a2009264e9631a6ef11cc032621b7c0d0ff8ad69046a2f54bcc474ec","observation_id":"0f606fb3-f844-41b5-9327-c57890a026dc","resolution":{"observed_at":"2026-08-04T18:53:21.392604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.510900Z","title":"Referring multi- object tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.510900Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:297f8f0e14f6b32a9fd2a1fcd8e6ec97de2c46c896346382b7d47c70bf5e7cca","observation_id":"bab512a4-d63b-4a10-8ebd-e5db0b04b08c","resolution":{"observed_at":"2026-08-04T18:53:21.510900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.650079Z","title":"To- wards open vocabulary learning: A survey.IEEE Transac- tions on Pattern Analysis and Machine Intelligence, 46(7): 5092–5113, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.650079Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3727ca2fa1a6aeaad739fe07c7f6af64913bde9ed5c88781584a391550e66ba4","observation_id":"ad0a6862-d22b-4657-b5ea-39f04328f843","resolution":{"observed_at":"2026-08-04T18:53:21.650079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.755383Z","title":"Towards visual grounding: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.755383Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:98389c4b681f01972da790a297fd4d638e987d833b3570142f7139c23e600c7d","observation_id":"385cd3ff-286e-4e6a-a0c9-f64c48855425","resolution":{"observed_at":"2026-08-04T18:53:21.755383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.857150Z","title":"Tubedetr: Spatio-temporal video ground- ing with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.857150Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:d2951d6d6c2bc0d01e716e9e3b326ae0fa381f519a0b6b7e1674772b8e1f538b","observation_id":"b0e9d4cf-9073-4cb4-8ff3-6630ef713b4a","resolution":{"observed_at":"2026-08-04T18:53:21.857150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:21.940853Z","title":"Cross-modal re- lationship inference for grounding referring expressions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:21.940853Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:0bd5701ad23f1a531d898df13967a9f57bb9cf6bbed46d561116b1d93179c602","observation_id":"0fe1ee83-65d2-4d82-839e-69e0cba3f951","resolution":{"observed_at":"2026-08-04T18:53:21.940853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.013876Z","title":"Event camera data pre- training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.013876Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:b453e22f3e7412b0d5957bda1ed9ef87bfa4ceed6357324a4bd390b6e80a881e","observation_id":"8e4bf53b-a296-4163-ae5b-1e50dd675270","resolution":{"observed_at":"2026-08-04T18:53:22.013876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.092359Z","title":"A fast and accurate one- stage approach to visual grounding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.092359Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:d8a4ec1e2abade948a01cf18c3f9506c6d36f230df7de83607c7d33b1023df89","observation_id":"594b23e2-b3b7-4cb6-bc67-e01397169b92","resolution":{"observed_at":"2026-08-04T18:53:22.092359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.196143Z","title":"Sat: 2d semantics assisted training for 3d visual grounding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.196143Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:3245fce72845ff59002e24ea3230cda07aaa5072e3321fa0475a98320e698c00","observation_id":"71a4a8a0-d198-478c-811c-9e046387c748","resolution":{"observed_at":"2026-08-04T18:53:22.196143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.360126Z","title":"Berg, and Tamara L","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.360126Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:0b5166aa5c334685e3705f5c8d9b812525f3862f94d66bd20a70d168ea5f63f0","observation_id":"19cee7e2-4e60-4c8a-ba06-3df8b3fdfa8f","resolution":{"observed_at":"2026-08-04T18:53:22.360126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.495576Z","title":"Visual programming for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.495576Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:59e5ebad704bc646ca5b83d87a23e943b4b35284babae72e2892a2d75768223e","observation_id":"dcf04041-cd20-453d-9005-c81adb6e3d6b","resolution":{"observed_at":"2026-08-04T18:53:22.495576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.642569Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.642569Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:78a4b8cffeed3801088ec9c4cc2464460c2869f610af98b47f50fa492331431e","observation_id":"14bf8ffb-8ba9-4220-8b93-2b433e6aa43f","resolution":{"observed_at":"2026-08-04T18:53:22.642569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.740504Z","title":"Mono3dvg: 3d visual grounding in monocular images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.740504Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:ef862f6a14d8599d6a640536cb552d7986788076c63bf0425915eb243382c65e","observation_id":"5f273e64-9f51-4d35-9c90-fb15ef10380b","resolution":{"observed_at":"2026-08-04T18:53:22.740504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:22.848156Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.848156Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:b5974e5c2fa0812079ce0cc575065f404f3ebf7e9b6ebf450cf7b0c225d5b958","observation_id":"cd76ce6a-0972-4201-baa7-a4b241afac4d","resolution":{"observed_at":"2026-08-04T18:53:22.848156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08890","last_updated":"2024-04-11T15:34:46Z","snapshot_observed_at":"2026-08-07T13:40:38.719385Z","submitted_at":"2023-02-17T14:19:28Z","title":"Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08890","snapshot_observed_at":"2026-08-04T18:53:22.971883Z","title":"Deep learning for event-based vision: A comprehensive survey and bench- marks.arXiv preprint arXiv:2302.08890, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:22.971883Z"},"links":{"cited_paper":"/paper/2302.08890","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:014866ee37bef953afe3416bc148c3fcae27f3c70b450ef8a37727a90be79ab4","observation_id":"44521fc0-d5f5-40f6-830f-e82b46f7d1fa","resolution":{"observed_at":"2026-08-04T18:53:22.971883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:23.082614Z","title":"Ex- act: Language-guided conceptual reasoning and uncertainty estimation for event-based action recognition and more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:23.082614Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:9fd615c9f58bf9cfa0613b5248033c3c69904062b7f932ed3e5f98eea752de25","observation_id":"d2df8b5d-4fe2-4e42-825b-09f60ac7801d","resolution":{"observed_at":"2026-08-04T18:53:23.082614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11904","last_updated":"2025-05-10T15:43:29Z","snapshot_observed_at":"2026-08-09T10:21:28.477024Z","submitted_at":"2024-11-16T05:12:11Z","title":"GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11904","snapshot_observed_at":"2026-08-04T18:53:23.175900Z","title":"Geoground: A unified large vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:23.175900Z"},"links":{"cited_paper":"/paper/2411.11904","citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:28c572701fe2a9595b97d9cce03d7b7fc131dff9e7269398a002123e6dc4c55e","observation_id":"4a018cba-9848-4189-9a10-e958ee7e58bd","resolution":{"observed_at":"2026-08-04T18:53:23.175900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:23.300547Z","title":"The multi- vehicle stereo event camera dataset: An event camera dataset for 3d perception.RA-L, 3(3):2032–2039, 2018","venue":null,"work_id":null,"year":2032},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:23.300547Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:4eb0e3bb9802712c91f7d35c72b28e9c7b9a99da6b4d6e07d9b4d3e58c01caca","observation_id":"9090ef6a-0730-4b32-956d-cee799d46982","resolution":{"observed_at":"2026-08-04T18:53:23.300547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:23.400359Z","title":"Cear: Com- prehensive event camera dataset for rapid perception of agile quadruped robots.RA-L, 9(10):8999–9006, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:23.400359Z"},"links":{"citing_paper":"/paper/2509.09584"},"observation_digest":"sha256:b203830da113b2da6ac6d017bb048c8c0a941901f1a060fcac3db31a532b7f76","observation_id":"1938b355-d4ba-4f92-be38-5bafd677e553","resolution":{"observed_at":"2026-08-04T18:53:23.400359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09584","last_updated":"2025-09-11T16:21:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:40:47.585046Z","submitted_at":"2025-09-11T16:21:59Z","title":"Visual Grounding from Event Cameras"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2509.09584."}