{"as_of":"2026-08-18T00:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3512fc38c78daaa2345e244579a6f7c604a9b4d4755bc8cb10fc425348a9f9f","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:59:51.477101Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:16:34.307559Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:42:06.493920Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"cited_work":{"arxiv_id":"2505.02393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02393","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.02393 , year=","venue":null,"work_id":"53308f1b-9549-4e18-9c92-2130f14cf089","year":null},"citing_paper":{"arxiv_id":"2605.08651","last_updated":"2026-05-09T03:46:39Z","snapshot_observed_at":"2026-08-14T23:03:23.491433Z","submitted_at":"2026-05-09T03:46:39Z","title":"Privacy-Aware Video Anomaly Detection through Orthogonal Subspace Projection","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T02:16:34.307559Z"},"links":{"cited_paper":"/paper/2505.02393","citing_paper":"/paper/2605.08651"},"observation_digest":"sha256:22793d5681ad2ef8bde351b979ce52e8ac5b9af0282890076f7f2a477e266ef2","observation_id":"1ab0dc88-9172-430a-b3f3-66b4553ec401","resolution":{"observed_at":"2026-05-12T07:42:06.496671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02393/citation-record","integrity":"/paper/2505.02393/integrity","json":"/paper/2505.02393/citation-record.json","paper":"/paper/2505.02393"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.911237Z","title":"Vatt: Transformers for multimodal self-supervised learning from raw video, audio and text","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.911237Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:c74a1df02cf54ab8009355bf569aa202a711d3161292e49d930679e1e7431456","observation_id":"6bd819c8-d017-4414-b352-099ae9b0d688","resolution":{"observed_at":"2026-08-16T00:59:50.911237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-16T00:59:50.916418Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.916418Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:a2f4df1688b60d83b391db23d0f072e518e625134f6ccc7905476eb478973c73","observation_id":"113eecb1-bd8d-49d4-8d18-45b79e1e96c5","resolution":{"observed_at":"2026-08-16T00:59:50.916418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.921740Z","title":"Synthetic temporal anomaly guided end-to-end video anomaly detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.921740Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:e028c68a88dd27b65cea2587452a9aa8c7568efd5eb3643135d6dc0fe2367b23","observation_id":"9a9596b2-b7bf-40bf-acd0-8af359e3795e","resolution":{"observed_at":"2026-08-16T00:59:50.921740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.927300Z","title":"An application-driven survey on event-based neuromorphic computer vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.927300Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:4c664a1a86e68e65d98b1aaf764fc195303593346a0e292e73042ffa43766e42","observation_id":"77443699-c938-4a42-9bbf-f303fb498f58","resolution":{"observed_at":"2026-08-16T00:59:50.927300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13627","last_updated":"2024-08-27T14:14:51Z","snapshot_observed_at":"2026-08-16T13:24:06.720834Z","submitted_at":"2024-08-24T16:48:25Z","title":"Recent Event Camera Innovations: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13627","snapshot_observed_at":"2026-08-16T00:59:50.932151Z","title":"Recent event camera innovations: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.932151Z"},"links":{"cited_paper":"/paper/2408.13627","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f35d7dedf06603ad01709c4454da512d9d0fdd522f194a8b85b83f43314c100a","observation_id":"ef46194c-47ff-4f10-ba9b-c470f9770bd2","resolution":{"observed_at":"2026-08-16T00:59:50.932151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.938712Z","title":"Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.938712Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:fc75627cabc19425072841822640e13d127a1d5f05abf2506d335a810da22f71","observation_id":"27a55b22-3743-4689-9c8e-640b5f761ab7","resolution":{"observed_at":"2026-08-16T00:59:50.938712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.944623Z","title":"Tevad: Improved video anomaly detection with captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.944623Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:5f583f5cae7eb8d2d62353015c34f0aaf46929571f8dfc3803c469486c29c6ef","observation_id":"de656d75-c0f8-445f-94b9-77106deed9df","resolution":{"observed_at":"2026-08-16T00:59:50.944623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.949478Z","title":"Mgfn: Magnitude-contrastive glance-and-focus network for weakly-supervised video anomaly detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.949478Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:00314d7120c7a239b03070edcea08ed6f574989731aaf199dce46c566973f939","observation_id":"aa33d1f5-7850-40ea-a696-5e36f3470cc6","resolution":{"observed_at":"2026-08-16T00:59:50.949478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.954439Z","title":"Label-free event-based object recognition via joint learning with image reconstruction from events","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.954439Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:133e2e2374ce7e483c5210a4ad93888a0e3ba40aab61b58b8a926785ded35d19","observation_id":"bf1c20af-57c9-4225-9c14-854105afcece","resolution":{"observed_at":"2026-08-16T00:59:50.954439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06126","last_updated":"2022-05-12T14:39:21Z","snapshot_observed_at":"2026-08-16T17:00:46.272100Z","submitted_at":"2022-05-12T14:39:21Z","title":"One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06126","snapshot_observed_at":"2026-08-16T00:59:50.959891Z","title":"One model, multiple modalities: A sparsely 10 activated approach for text, sound, image, video and code","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.959891Z"},"links":{"cited_paper":"/paper/2205.06126","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:02ec089a57bb3dcc0f44677c235ad1b5bc50970dbc3d2f4ab982fb8b4b23261e","observation_id":"a11adc1b-a59c-40aa-9628-c3ef04a24ec9","resolution":{"observed_at":"2026-08-16T00:59:50.959891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.346202Z","title":"Laplace redux—effortless bayesian deep learning","venue":null,"work_id":"ca8ebf35-c3f4-4a4c-8615-50d802255310","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.966163Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:6d63f1f542f0988ec6c9190cc8d3401595b6b3686df8a91eaa6e0defc951229d","observation_id":"fb408ac9-7633-40de-a00c-e0e3b99d4cb8","resolution":{"observed_at":"2026-08-16T00:59:53.351397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.328388Z","title":"Learnable expansion of graph operators for multi-modal feature fusion, 2025","venue":null,"work_id":"a56a284d-987a-44e6-bd82-31973e81fc1a","year":2025},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.971239Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:9cf1a360aa81067b6e0947b1ef584a5db76a81aef2e7783f0f3202f305961e17","observation_id":"ff68a20b-cbd2-4b0b-b0e3-21d525091025","resolution":{"observed_at":"2026-08-16T00:59:53.333787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-16T00:59:50.976185Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.976185Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f47f699a3f3639e589bdf79db812b77327a51613a7e5fa185f1108c0e4194a34","observation_id":"671655cd-4b97-47e6-a0b9-2afda514283f","resolution":{"observed_at":"2026-08-16T00:59:50.976185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.312423Z","title":"Self-supervised video forensics by audio-visual anomaly detection","venue":null,"work_id":"10ecec64-e9f6-47e8-a6e0-9c54e5539254","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.981445Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:2d2ded12932c9c20afb12e71e2761cd511a422aae62c4d381d811fc0a1163b83","observation_id":"33c05f24-6762-4846-94db-a8b44e0084f1","resolution":{"observed_at":"2026-08-16T00:59:53.317424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.986469Z","title":"Mist: Multiple instance self-training framework for video anomaly detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.986469Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:daef9d3d636fe7117eb0c56fa4a944bc8b1758f317d8ee396b344b0f73b370ae","observation_id":"626ebc13-bd99-42e4-a6fe-0ed12c58029b","resolution":{"observed_at":"2026-08-16T00:59:50.986469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.13720","last_updated":"2021-07-29T03:07:25Z","snapshot_observed_at":"2026-08-16T18:06:46.150265Z","submitted_at":"2021-07-29T03:07:25Z","title":"Convolutional Transformer based Dual Discriminator Generative Adversarial Networks for Video Anomaly Detection","version":1},"cited_work":{"arxiv_id":"2107.13720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.13720","snapshot_observed_at":"2026-08-16T00:59:51.954315Z","title":"Convolutional Transformer based Dual Discriminator Generative Adversarial Networks for Video Anomaly Detection","venue":"cs.CV","work_id":"9335db4d-7b87-4551-84e7-3ed9ad3b624b","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.991777Z"},"links":{"cited_paper":"/paper/2107.13720","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:5bb38d677bca6fe76b4ad56c71d86a6a3ed2feda7fa7da3a7134cf4fe7a49c62","observation_id":"20a128ae-b31c-4607-8b47-822c0e462755","resolution":{"observed_at":"2026-08-16T00:59:51.961730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.286140Z","title":"Multimodal motion conditioned diffusion model for skeleton- based video anomaly detection","venue":null,"work_id":"f31a2243-182e-47ed-ba09-bd2481db7c5e","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.997828Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:a0558a935e0e608def5250820574fd17b0a8685ff4a85d66fced65f715368b40","observation_id":"6c2b8468-659d-41a9-b23a-d1824a6c28ca","resolution":{"observed_at":"2026-08-16T00:59:53.292070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.002521Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.002521Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:5995aa8ae4f5e7f1855eaea8d40a181402f262be1009add55e8dfb49c2f65ada","observation_id":"d643ed1c-0217-40eb-ab9c-d5514b2381ca","resolution":{"observed_at":"2026-08-16T00:59:51.002521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.256444Z","title":"Event- based vision: A survey","venue":null,"work_id":"b0ce9433-a783-4c85-9d5e-52a253ef9417","year":2020},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.007483Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:6ceb71a40ab0ccd11acd8d1087bb1502ce7f68069ff6a1c7095966abbabd4341","observation_id":"0b6d0d52-5118-4a24-9b5a-15dc38a52a1f","resolution":{"observed_at":"2026-08-16T00:59:53.262118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.238330Z","title":"End-to-end learn- ing of representations for asynchronous event-based data","venue":null,"work_id":"8a407750-dfe2-44be-9904-000835b42a8e","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.012228Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:a01edf4b0f93110d04b9b66e1978efe4a302a6532b7a61756a8058e0f68755f8","observation_id":"b8847dee-5757-4b88-8a79-dfcb83ffa515","resolution":{"observed_at":"2026-08-16T00:59:53.244566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.221207Z","title":"Anomaly detection in video via self-supervised and multi-task learning","venue":null,"work_id":"9aa7ccde-6ef7-4954-9e27-df80d30a0426","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.016827Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:a89ff89ec92270ed7a59cda50305f6c6b8663f15a9faf7280cb69ad476e9a3a4","observation_id":"1873d1f4-c8f5-477f-810e-a3915f189a8c","resolution":{"observed_at":"2026-08-16T00:59:53.226552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20455","last_updated":"2024-12-29T12:46:57Z","snapshot_observed_at":"2026-08-16T12:59:48.157997Z","submitted_at":"2024-12-29T12:46:57Z","title":"Cross-Modal Fusion and Attention Mechanism for Weakly Supervised Video Anomaly Detection","version":1},"cited_work":{"arxiv_id":"2412.20455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20455","snapshot_observed_at":"2026-08-16T00:59:51.924744Z","title":"Cross-Modal Fusion and Attention Mechanism for Weakly Supervised Video Anomaly Detection","venue":"cs.CV","work_id":"9ca68b74-5966-47f4-969e-a98d51ce2399","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.021557Z"},"links":{"cited_paper":"/paper/2412.20455","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:4755621668fee6322bd728d74b183ed82e86158082c8ae31c2c41f99ee4362a2","observation_id":"d646ac88-3b40-4161-8ab2-2d8db07b365b","resolution":{"observed_at":"2026-08-16T00:59:51.930790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.026515Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.026515Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:c70ce485f9a37d9f04d68a19a83a19694d16cf18e608ee00c2b65a86323088fc","observation_id":"34c822e4-e7e9-4497-a776-6e4857d66fce","resolution":{"observed_at":"2026-08-16T00:59:51.026515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.192397Z","title":"Omnivore: A single model for many visual modalities","venue":null,"work_id":"9321cee2-6386-42c0-9a5d-c78a7b572fa7","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.031112Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:2132341861e24891ca142d4e81b745f40fbd8921e144a527abbedc31c9d55cab","observation_id":"48adf15d-1297-43fb-8c3e-3bef6efbcc7a","resolution":{"observed_at":"2026-08-16T00:59:53.197635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-16T00:59:51.035716Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.035716Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:248c845d96717c0f701a87525d4dcdfa8daec0fb9550a7d759902eac5433b584","observation_id":"6f3f3644-1250-40d8-9c27-06698221c5c9","resolution":{"observed_at":"2026-08-16T00:59:51.035716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.040607Z","title":"Deep multimodal representation learning: A survey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.040607Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:bcb6714c03b8164b27e6ac7bd054c2320991eb94e7a40f79651a93531e7981c8","observation_id":"b420b44f-9902-419b-8f71-17cb49a74228","resolution":{"observed_at":"2026-08-16T00:59:51.040607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.162262Z","title":"Backprop kf: Learning discriminative deterministic state estimators","venue":null,"work_id":"6cc63eca-8ddc-4cb5-aaf0-a1a57764ea12","year":2016},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.046135Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:4a4d6c61b8ca0da255bee0efa71ea69cb5ad873e199a2dd85e612e596a65bc2e","observation_id":"ae448456-c312-43ce-b31a-f60105129157","resolution":{"observed_at":"2026-08-16T00:59:53.168753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.051613Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.051613Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:4aba91b7adc870aac844618c8cc8b0a46dac4ca78413c74da60d5c43bfde1b78","observation_id":"ee01b8c1-3e41-4907-a1a3-ef711b6052ff","resolution":{"observed_at":"2026-08-16T00:59:51.051613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02703","last_updated":"2024-12-16T23:42:56Z","snapshot_observed_at":"2026-08-16T22:45:04.602281Z","submitted_at":"2022-02-06T04:18:45Z","title":"Multi-modal Sensor Fusion for Auto Driving Perception: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02703","snapshot_observed_at":"2026-08-16T00:59:51.056053Z","title":"Multi-modal sensor fusion for auto driving perception: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.056053Z"},"links":{"cited_paper":"/paper/2202.02703","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:7b4d0686728b02048e6be05fde95c1719a1eb804961ba32745cd681ae9c660f2","observation_id":"f76a891d-60ad-4ba8-9643-1438994e8ce9","resolution":{"observed_at":"2026-08-16T00:59:51.056053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.061225Z","title":"Attention-based deep multiple instance learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.061225Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:d94226b6b8f9d5d80abfeb4184032bf403def3694c53968dca19162a57553b01","observation_id":"e019a117-ebb2-4bdd-8fdf-857839c50650","resolution":{"observed_at":"2026-08-16T00:59:51.061225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03093","last_updated":"2025-05-08T09:35:41Z","snapshot_observed_at":"2026-08-13T16:13:34.418795Z","submitted_at":"2024-12-04T07:44:58Z","title":"Expanding Event Modality Applications through a Robust CLIP-Based Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03093","snapshot_observed_at":"2026-08-16T00:59:51.066336Z","title":"Expanding event modality applications through a robust clip-based encoder","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.066336Z"},"links":{"cited_paper":"/paper/2412.03093","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:0760613bcb8f339d8e848d691ee9801637c04b15fbd2e9da45f86f8cc667182b","observation_id":"b1a76d88-32eb-425a-a5f0-c9c36982733c","resolution":{"observed_at":"2026-08-16T00:59:51.066336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08637","last_updated":"2020-12-15T21:59:58Z","snapshot_observed_at":"2026-08-16T18:58:13.593484Z","submitted_at":"2020-12-15T21:59:58Z","title":"Multi-Modal Anomaly Detection for Unstructured and Uncertain Environments","version":1},"cited_work":{"arxiv_id":"2012.08637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.08637","snapshot_observed_at":"2026-08-16T00:59:51.833500Z","title":"Multi-Modal Anomaly Detection for Unstructured and Uncertain Environments","venue":"cs.RO","work_id":"38a53422-c103-4087-9190-dc0f83dc8cdc","year":2020},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.071784Z"},"links":{"cited_paper":"/paper/2012.08637","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:8f97d19c5eadd944def0b9eebec4c1f16f2064e449a13a6a31594c571a8aa8dd","observation_id":"18894592-967a-4be5-a270-6ca595174e2d","resolution":{"observed_at":"2026-08-16T00:59:51.839774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.076712Z","title":"What uncertainties do we need in bayesian deep learning for computer vision? In Advances in Neural Information Processing Systems (NeurIPS), 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.076712Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:c34c611f3cbbb3f17f1f79bda9fb315b8a62f73c6f448a08a16aec13bb2fc897","observation_id":"d810587e-ed47-43c8-9f5f-e724c2943fc5","resolution":{"observed_at":"2026-08-16T00:59:51.076712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.108833Z","title":"N-imagenet: Towards robust, fine-grained object recognition with event cameras","venue":null,"work_id":"86ab4c84-9b32-4414-a2b7-f663864c826e","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.081711Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:de00e820d541846c7209e0e2bcc8cbd72a19f5bddb3fa87c6deb0ef2a11e4a6b","observation_id":"05abf839-0e42-4fb3-b8a7-72bf3381445a","resolution":{"observed_at":"2026-08-16T00:59:53.114323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.089557Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"1d2aa7e4-65cd-403c-80c2-a828e62d6067","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.203912Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:8acd0648305bc1538e842aab7dd994416baeb46754ccb1859df4aabc57c8893a","observation_id":"e1984fd1-e3b5-4a5f-88d9-3817fffa039a","resolution":{"observed_at":"2026-08-16T00:59:53.095492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.066916Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":"cbf1b74a-dff2-4636-bc2a-37f91960d647","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.208832Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:aa87b5d8be63efe5c4e0cb9a94bde44b3b62f6e5f4e5980980309e4623b0ffb0","observation_id":"b7af93cc-28ae-4191-8f5f-acbec588e6ce","resolution":{"observed_at":"2026-08-16T00:59:53.074405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-16T00:59:51.213850Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.213850Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:da1026c7bc75fb1eb8f0ed423a63d5e51989b9e69333d4522f7d1d3621977194","observation_id":"d496875f-1c6d-4c16-8a9d-d6fbd72f8b6c","resolution":{"observed_at":"2026-08-16T00:59:51.213850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.219073Z","title":"A survey of multimodel large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.219073Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f76ce0ea1b7f6f551f3e4a211811fbde2e1a24cb845a8188d1136a01519a0eee","observation_id":"304a29a1-f79c-4620-b731-37325c15f641","resolution":{"observed_at":"2026-08-16T00:59:51.219073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.035660Z","title":"A 128×128 120 db 15µs latency asynchronous temporal contrast vision sensor","venue":null,"work_id":"9bfdc826-601a-44c7-82fb-08c19502c0a7","year":2008},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.223820Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:e51063fd9019e6173cabc53b294917b734cb41f3f80afd609b2944c31e988ed3","observation_id":"d8ec36d6-f727-4da1-a425-2ae8c93204f6","resolution":{"observed_at":"2026-08-16T00:59:53.041423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.228503Z","title":"Future frame prediction for anomaly detection–a new baseline","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.228503Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:8a6ab74c146a73c8b479fc98406f630af3c33e796d17540aa6ca2d04360ccf43","observation_id":"033d103b-bc2d-4646-a7f0-3a1c3c4a596f","resolution":{"observed_at":"2026-08-16T00:59:51.228503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.999923Z","title":"Towards multimodal model generalization: Visual-audio temporal alignment for video classification","venue":null,"work_id":"07ef4e3a-e05a-47ef-bd98-a3ce1393573b","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.233235Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:959eaf481f341ff716ec1556f8a91b639bc4a2295a03b3bf4d8eafff48202e2d","observation_id":"c100e42e-b86a-404c-8a77-8b4330fe7051","resolution":{"observed_at":"2026-08-16T00:59:53.011088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.974643Z","title":"Weakly supervised temporal anomaly localization in surveillance videos","venue":null,"work_id":"be4167e2-f8d4-4d0f-baa5-15ea49bfc3bc","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.238212Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:a9ee39138f89d91316d54e2d07746d0c4a2db825e5cfef8deae28c5386cb39b6","observation_id":"1573b672-f55d-4395-a84f-3894ff076875","resolution":{"observed_at":"2026-08-16T00:59:52.985040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T00:59:51.244654Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.244654Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:ed5353cfa4832fcdbb5ba4f4300f2bcb8d68a50f489b9da65b0ce77a56a20e47","observation_id":"a2e0b421-12e0-4ee8-a65c-8968dab48e8c","resolution":{"observed_at":"2026-08-16T00:59:51.244654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.953634Z","title":"Learning optical flow from event camera with rendered dataset","venue":null,"work_id":"1f413765-2660-4e9c-842b-88fb4bf82891","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.250065Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:975a782e504740e141f7f7c274f1fc012db784de4510eabb19f75eddc0fed3b9","observation_id":"260a2878-4efa-4630-a13b-dd34b1db2ae0","resolution":{"observed_at":"2026-08-16T00:59:52.960966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05702","last_updated":"2024-01-11T07:09:44Z","snapshot_observed_at":"2026-08-16T14:28:20.065688Z","submitted_at":"2024-01-11T07:09:44Z","title":"Video Anomaly Detection and Explanation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05702","snapshot_observed_at":"2026-08-16T00:59:51.254940Z","title":"Video anomaly detection and explanation via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.254940Z"},"links":{"cited_paper":"/paper/2401.05702","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:cede1b3d8f3d37faa540ad02229de702c067498230622034ee17c956cfd1c5b1","observation_id":"a73b8b72-6820-4c81-8cc2-f0a71929ae09","resolution":{"observed_at":"2026-08-16T00:59:51.254940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.933609Z","title":"Unbiased multiple instance learning for weakly supervised video anomaly detection","venue":null,"work_id":"95a5de5e-3f54-457d-87ea-767e674f9997","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.259995Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:b4a9f7fd5fc5be5184cc76c6cfb30e950d45354df1411d58b06d83b2ec51fe34","observation_id":"e5efb2e8-276e-41b2-b446-66fa84442a94","resolution":{"observed_at":"2026-08-16T00:59:52.940320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08315","last_updated":"2023-10-12T13:26:04Z","snapshot_observed_at":"2026-08-16T14:52:42.193269Z","submitted_at":"2023-10-12T13:26:04Z","title":"Fusion framework and multimodality for the Laplacian approximation of Bayesian neural networks","version":1},"cited_work":{"arxiv_id":"2310.08315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08315","snapshot_observed_at":"2026-08-16T00:59:51.731908Z","title":"Fusion framework and multimodality for the Laplacian approximation of Bayesian neural networks","venue":"eess.SP","work_id":"e3938d1b-1987-4520-ad69-aab26dd90a3a","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.265869Z"},"links":{"cited_paper":"/paper/2310.08315","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:78951a7d08dafe22f8ce9df935e41cb0700de37378e1fc47c8a078afa921e3a2","observation_id":"a2b0026c-0b4b-4580-a646-be1a479a374b","resolution":{"observed_at":"2026-08-16T00:59:51.738132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.914521Z","title":"Multimodal deep learning","venue":null,"work_id":"bb916efb-bbf5-420b-9839-684cf0f1dca7","year":2011},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.270980Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:967999b09045ff18ba72a2a12415a3f85ecf3f634c44142aa20012a200a6d25e","observation_id":"e83c381b-31cf-4af1-a626-27495915754f","resolution":{"observed_at":"2026-08-16T00:59:52.920087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.896423Z","title":"The promises and pitfalls of bayesian deep learning in computer vision","venue":null,"work_id":"20cccc37-71b6-4618-a2cb-dbf0dc34cd98","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.275910Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:da7e09df04f10c776e756cbf8e5f163d0dca99dfb0bab8c1996bd36a2c396c8f","observation_id":"82c82bff-e4cf-4a71-be1d-48a7ba44c637","resolution":{"observed_at":"2026-08-16T00:59:52.901587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.876602Z","title":"Converting static image datasets to spiking neuromorphic datasets using saccades","venue":null,"work_id":"e4b28b8c-f335-45ed-942a-330839eab327","year":2015},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.281415Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:6ef9de8e5c24f52de1d7ee46dbd59d154bc24f2aaf3d9c70d70be7c939eaa735","observation_id":"4851836c-707e-4a34-afdc-d29f18cdbc61","resolution":{"observed_at":"2026-08-16T00:59:52.883080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.817317Z","title":"Can you trust your model’s uncertainty? evaluating predictive uncer- tainty under dataset shift","venue":null,"work_id":"e1ecf7c9-95fa-471b-8944-62bf6f108ac5","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.287230Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:169bd4faf869b50e7f72ec41a29cd92903227a003c170312848db03c54ad4475","observation_id":"57921c89-bb07-4baf-98f9-94827a6e8a9c","resolution":{"observed_at":"2026-08-16T00:59:52.862557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.754586Z","title":"Back to event basics: Self-supervised learning of image reconstruction for event cameras via photometric constancy","venue":null,"work_id":"e7b98cae-4e8f-4bbf-8681-6ac5fe35741f","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.292299Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:0732b7ee8fb1d4de5dd724fa717f9ba7b35ff34e0ddbbb8fbc6a3d3a8f6aa66e","observation_id":"86e14edf-9d3d-4ff4-bef0-4212e5e146b7","resolution":{"observed_at":"2026-08-16T00:59:52.760900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12763","last_updated":"2024-12-19T19:37:44Z","snapshot_observed_at":"2026-08-17T20:22:14.619414Z","submitted_at":"2024-08-22T23:32:42Z","title":"Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12763","snapshot_observed_at":"2026-08-16T00:59:51.297175Z","title":"Assessing modality bias in video question answering benchmarks with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.297175Z"},"links":{"cited_paper":"/paper/2408.12763","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:928eb0d0abf405e2a2ac199677b563b8cb430c8d5341627548fc72241fbe5dde","observation_id":"5a55de31-607b-45a5-81ef-9bb470d29ee4","resolution":{"observed_at":"2026-08-16T00:59:51.297175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.302358Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.302358Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:2b3d8de428216d2eccc2678dded0679684082401912d91996bd3a7ce7723e800","observation_id":"aa77bc7b-fdee-4826-bd8a-d2f197c632e2","resolution":{"observed_at":"2026-08-16T00:59:51.302358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.726224Z","title":"Events-to-video: Bringing modern computer vision to event cameras","venue":null,"work_id":"71eb15f8-d3de-459f-890f-ec0f267603a4","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.308357Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:28fbddb2abaa249964558e02ebae0ee7d8a8f075b32d94a083e44fbac7e561f7","observation_id":"dbfbc59c-f5ec-430d-a485-43d0ca7206c1","resolution":{"observed_at":"2026-08-16T00:59:52.731398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-08-16T15:25:23.093007Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-16T00:59:51.313318Z","title":"Multimodal foundation models: From specialists to general-purpose learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.313318Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:9d2ed589e8584d6a57b4198f50e376d528d4e0e82c0267a06f85c9a25c70a488","observation_id":"0397e637-265b-4712-be5b-2ccd9f9c606b","resolution":{"observed_at":"2026-08-16T00:59:51.313318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.706425Z","title":"Secrets of event-based optical flow","venue":null,"work_id":"93f52f29-e976-4dcd-8a91-e1e7fd0127cb","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.318431Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:8ab4f301d7c6eb37a56488810992a5fc6e1d68d9ef8a569e752d0a465440fb80","observation_id":"b4808dfd-ba93-460d-ba5d-432f5998f5fa","resolution":{"observed_at":"2026-08-16T00:59:52.711966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10811","last_updated":"2019-09-20T05:35:30Z","snapshot_observed_at":"2026-08-14T17:52:52.942237Z","submitted_at":"2018-11-27T04:51:54Z","title":"Uncertainty aware audiovisual activity recognition using deep Bayesian variational inference","version":3},"cited_work":{"arxiv_id":"1811.10811","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.10811","snapshot_observed_at":"2026-08-16T00:59:51.634480Z","title":"Uncertainty aware audiovisual activity recognition using deep Bayesian variational inference","venue":"cs.NE","work_id":"e69b53ac-ff71-4c6b-a0e3-7f09f09af9d1","year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.323104Z"},"links":{"cited_paper":"/paper/1811.10811","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:c6989f4056e5f1e8f23e0d9af86d591a6acc806491a2e455a23dec5e292fc3f4","observation_id":"8f76194b-f8ca-4f74-bc18-791f27d14e66","resolution":{"observed_at":"2026-08-16T00:59:51.644298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.328135Z","title":"Real-world anomaly detection in surveillance videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.328135Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:b64adab65a790a01dbc3c85da33ca1ebffc64df274fd03cc74589dfe635e654a","observation_id":"6f9fbbc9-e74f-41a2-91c7-1206d29b18fa","resolution":{"observed_at":"2026-08-16T00:59:51.328135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.673456Z","title":"Hawk: Learning to understand open-world video anomalies","venue":null,"work_id":"b38007ca-7ad8-4a48-b72b-fefc8ed6a004","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.332826Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:5aef840e14bdec65c9dbcff60a6165c5eba152e955a7b5f515420b24f7e22e32","observation_id":"0fa57dc7-8305-4751-af3d-a4f02bb74bd0","resolution":{"observed_at":"2026-08-16T00:59:52.680219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.655902Z","title":"Weakly-supervised video anomaly detection with robust temporal feature magnitude learning","venue":null,"work_id":"d3efcc1f-f8c7-42f5-bce6-62098d7c1c08","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.337695Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:bc98001151fadee9f09a2bee85ec06a0cd11e7df3780b77ee41af76cf5769045","observation_id":"1d6824cd-2d11-4d8f-b89c-3c02bd725218","resolution":{"observed_at":"2026-08-16T00:59:52.661095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.636780Z","title":"Multimodal transformer for unaligned multimodal language sequences","venue":null,"work_id":"a23d81df-e632-49ba-87eb-8c77ea3fd034","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.343239Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:ceaba9e3d37f1aec473c22be81a063ee3bac99de324185c5f9748eb9631b2ad8","observation_id":"865ea0b8-ff42-43d2-b847-a3c26e6ab6cd","resolution":{"observed_at":"2026-08-16T00:59:52.643111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.618667Z","title":"Exploiting spatial sparsity for event cameras with visual transformers","venue":null,"work_id":"157e3eeb-f6f7-4287-b44a-27f3510bb0a2","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.348793Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:069aaa97e171bb0ba3352310c28792f44fb7df589ca6f7c18ff077ab453d6d09","observation_id":"5c085303-b8cc-4675-bff7-8bdcae640744","resolution":{"observed_at":"2026-08-16T00:59:52.623909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.533935Z","title":"An introduction to the kalman filter.University of North Carolina at Chapel Hill, Department of Computer Science, 7(1):1–16, 1995","venue":null,"work_id":"39b52fdf-b13e-4066-b822-d30c67b395af","year":1995},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.353812Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:867141782ecda439c376ba6df4ad07f3944e6075091d3f5a5b19145bd0369134","observation_id":"464f3c52-b14b-4bb7-b556-f1ad0425cf9d","resolution":{"observed_at":"2026-08-16T00:59:52.591576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.491434Z","title":"Student-t processes for bayesian deep learning","venue":null,"work_id":"67bc8e7a-8a41-49b3-838a-f35512f4ffec","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.358564Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:1af1dedb603f407f55483e36a621a286c629fd4ffd31b9b251beafdcccebaa20","observation_id":"b8965e62-46ce-4dbd-831d-185285e5d120","resolution":{"observed_at":"2026-08-16T00:59:52.501231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.471260Z","title":"Not only look, but also listen: Learning multimodal violence detection under weak supervision","venue":null,"work_id":"0267f52a-1eda-4182-bb25-2a37fe047672","year":2020},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.363313Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:2128a77cc421c964487cf55f3a588f0e2124080de0c4701f63e5d797138d82fb","observation_id":"3db6dd4a-decd-4d74-9a9e-8b30c266bf87","resolution":{"observed_at":"2026-08-16T00:59:52.477160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.451352Z","title":"Weakly supervised audio-visual violence detection","venue":null,"work_id":"a4a033b8-509d-4ab4-8550-7f9dfe1f25e6","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.368690Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:e5dcf6bdea3b35d0e3db0b9f858fb01e7ec0e3ecf645678377e23f0460d6230d","observation_id":"6d1ac934-6668-4d55-9520-3d7b59889d20","resolution":{"observed_at":"2026-08-16T00:59:52.457331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.373329Z","title":"Open-vocabulary video anomaly detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.373329Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:56ddc868dac9d318e7c6b3097c9b5ae3cdac634f61e2ca90defc395a111cd5e0","observation_id":"0365dcd2-e4df-4828-aa2f-44a7efdd657e","resolution":{"observed_at":"2026-08-16T00:59:51.373329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.417084Z","title":"Weakly supervised video anomaly detection and localization with spatio- temporal prompts","venue":null,"work_id":"846e059f-6fad-4a40-b079-65acaf141734","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.377899Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:df7c149f7bf58a9e0cd87e4aaac22728c0da86c99891a447df22477cba74b1cc","observation_id":"f125d059-3a65-4936-96a8-84d47391a91f","resolution":{"observed_at":"2026-08-16T00:59:52.422530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.400260Z","title":"Vadclip: Adapting vision-language models for weakly supervised video anomaly detection","venue":null,"work_id":"f20711ab-ba26-4ab9-8d19-ab4d1510f89f","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.382745Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:e7d14ec92eb589194a10ab1504849d23d07d67a4fdcbed604a185c106f5ed452","observation_id":"bf9329c8-4164-484f-8acd-52dbe908bb4a","resolution":{"observed_at":"2026-08-16T00:59:52.405531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06354","last_updated":"2023-11-16T19:26:02Z","snapshot_observed_at":"2026-08-16T15:24:58.432056Z","submitted_at":"2023-06-10T06:05:35Z","title":"EventCLIP: Adapting CLIP for Event-based Object Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06354","snapshot_observed_at":"2026-08-16T00:59:51.387962Z","title":"Eventclip: Adapting clip for event-based object recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.387962Z"},"links":{"cited_paper":"/paper/2306.06354","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:4b751e84cc0da10d21466434c9e1dffd67946ea33929f0c458fc20c29f3eaa23","observation_id":"abdcde94-6a30-4c5b-8d4f-8af9427c8794","resolution":{"observed_at":"2026-08-16T00:59:51.387962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.393637Z","title":"Multimodal learning with transformers: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.393637Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:3f6320cb4707f01156fe462ea5a3bf05d24b8c989dab96e71dda0b543c916550","observation_id":"69c9384f-ba9d-498c-88bc-09a8745a6e3c","resolution":{"observed_at":"2026-08-16T00:59:51.393637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.372684Z","title":"Event camera data pre-training","venue":null,"work_id":"f5cbe8e8-e418-4b13-acc6-8db1130ac4a9","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.398223Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:b8b617ce6728c08fa7380233014cb74f4ff356bd7ccd41c085b156e7851aca2a","observation_id":"ee85bb26-e6bb-4c3b-96d0-e30f2662fadd","resolution":{"observed_at":"2026-08-16T00:59:52.378273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01095","last_updated":"2025-03-31T20:17:27Z","snapshot_observed_at":"2026-08-14T23:50:48.263579Z","submitted_at":"2024-12-02T04:10:14Z","title":"VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01095","snapshot_observed_at":"2026-08-16T00:59:51.403401Z","title":"Explainable video anomaly detection via verbalized learning of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.403401Z"},"links":{"cited_paper":"/paper/2412.01095","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:69c2d13b6b34042823a356cd1e65a0ba0a3cfd25ebeb6ed1b87d1a071bf57271","observation_id":"b5ea1cc1-60d4-4d59-8442-241dcf9230c0","resolution":{"observed_at":"2026-08-16T00:59:51.403401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.286088Z","title":"Harness- ing large language models for training-free video anomaly detection","venue":null,"work_id":"284b1f47-bf64-4d0e-8f78-6a538f2e8dec","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.409044Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:9b16bb878ebacecd0f92de3070f92aa2dd7e56b63853c417d68c41817090b492","observation_id":"4ae0cbf2-168f-45a3-8317-2c6382ab08d8","resolution":{"observed_at":"2026-08-16T00:59:52.320617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06171","last_updated":"2025-03-14T10:23:06Z","snapshot_observed_at":"2026-08-17T13:28:50.254490Z","submitted_at":"2024-12-09T03:05:34Z","title":"Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06171","snapshot_observed_at":"2026-08-16T00:59:51.413560Z","title":"Holmes-vau: Towards long-term video anomaly understanding at any granularity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.413560Z"},"links":{"cited_paper":"/paper/2412.06171","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:9211f0d26bdd0b85045704c644791f1e108876546ecf1821c466aed01633cd45","observation_id":"6f3cf1e8-48b9-45cf-8d5c-55ae3be4a4fe","resolution":{"observed_at":"2026-08-16T00:59:51.413560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.194393Z","title":"Event-based vision: A survey","venue":null,"work_id":"1ee8e519-5e0a-46b7-9f7b-ff2561c0e6c9","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.419369Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:2fece88ecee82d30f70bd30ac498c9ef2955049beea1ce4a934be66e66b16d40","observation_id":"07148c3b-e4cb-4f88-9926-925f3aa97674","resolution":{"observed_at":"2026-08-16T00:59:52.229629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-08-16T13:20:46.785210Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-16T00:59:51.424778Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.424778Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:3707704b6f7eb4b1367f24646d59d87a7a8210c76296eef461876a71e9258f3c","observation_id":"c211819f-7d21-4fb2-af73-e20becea389f","resolution":{"observed_at":"2026-08-16T00:59:51.424778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08890","last_updated":"2024-04-11T15:34:46Z","snapshot_observed_at":"2026-08-17T09:05:47.162911Z","submitted_at":"2023-02-17T14:19:28Z","title":"Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08890","snapshot_observed_at":"2026-08-16T00:59:51.429796Z","title":"Deep learning for event-based vision: A comprehensive survey and benchmarks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.429796Z"},"links":{"cited_paper":"/paper/2302.08890","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:bfac48948bd3b5199ae1c0b03eb655ba04c27bed554f13ba21a26026eb85ecf5","observation_id":"d3ce162d-53f1-407a-9840-da164c299d3e","resolution":{"observed_at":"2026-08-16T00:59:51.429796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.160644Z","title":"Gtad: A semi-supervised learning framework for temporal anomaly detection in surveillance videos","venue":null,"work_id":"7dc3ebb6-9c40-4520-8519-ab3d09c3052e","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.436124Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:b70011365966bf4efc0fd344ec58ad187094b95944ae92944b4b41d0b050a800","observation_id":"f16e67c7-fd2f-47f7-9037-3de0d052a2ca","resolution":{"observed_at":"2026-08-16T00:59:52.166704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.441628Z","title":"Dual memory units with uncertainty regulation for weakly supervised video anomaly detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.441628Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:001354679e91486008b1bdcfde86800b933561587fdc2353edc3128fce8042dd","observation_id":"e5d6a689-e8fb-426e-bf40-7b9339dd8230","resolution":{"observed_at":"2026-08-16T00:59:51.441628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.129673Z","title":"Eventbind: Learning a unified repre- sentation to bind them all for event-based open-world understanding","venue":null,"work_id":"fcdb162f-7327-4f80-badc-975b18c09687","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.447874Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:7255b764547526b4464a1c5215b4eadf6a6d606130c85fabbaa300804c812ae4","observation_id":"c5893a05-a252-46f5-9bcb-b0a8975325ad","resolution":{"observed_at":"2026-08-16T00:59:52.135161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.113397Z","title":"Anomalynet: An anomaly detection network for video surveillance","venue":null,"work_id":"3abd1f2f-8df3-47e5-ae2f-200dcad0a79c","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.454311Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:3a5724d12e3c2e4cf25f3c7996ccdb0e8daec771f039a01a2a28bc0fbb2dbc54","observation_id":"340ac21e-855f-4a85-8424-fda04c9b0841","resolution":{"observed_at":"2026-08-16T00:59:52.118320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.096719Z","title":"The multivehicle stereo event camera dataset: An event camera dataset for 3d perception","venue":null,"work_id":"24b2f710-d46d-4d3b-8628-c700c76cd191","year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.459519Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:02c7e3feaf8547651433b2d83b52b623e42a01c7129bd0aa4aefa7b22e530c58","observation_id":"cb151c7d-28bb-4058-aac1-5243b9684712","resolution":{"observed_at":"2026-08-16T00:59:52.101914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.466232Z","title":"A variational bayesian approach to robust sensor fusion based on student-t distribution","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.466232Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:7dc31c813e8913dde4f15abddbf6e6a4510f1d3b143c5f6979ce1d94884287df","observation_id":"fab8f0ee-5042-48ad-9208-63e77337a909","resolution":{"observed_at":"2026-08-16T00:59:51.466232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.067315Z","title":"Advancing video anomaly detection: A concise review and a new dataset","venue":null,"work_id":"6063e788-51b1-4229-8ee7-084eb929a17e","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.472066Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:5f99d122db28a2feb878ea022fc1926d5b0f72399746b75fac740de6b1e0221e","observation_id":"99f693be-e06a-4769-9909-dafc35e6dc49","resolution":{"observed_at":"2026-08-16T00:59:52.073087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01008","last_updated":"2024-08-16T16:26:11Z","snapshot_observed_at":"2026-08-17T15:34:37.775465Z","submitted_at":"2023-03-31T16:11:56Z","title":"Self-Supervised Multimodal Learning: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01008","snapshot_observed_at":"2026-08-16T00:59:51.477101Z","title":"synthetic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.477101Z"},"links":{"cited_paper":"/paper/2304.01008","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:0f592bd3b1b6f82933ab0dc36381037e9b687d8820d9eba127e38f07586d9bf7","observation_id":"4b8ee675-dfc8-49e7-82c8-701e21427332","resolution":{"observed_at":"2026-08-16T00:59:51.477101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T22:41:38.494460Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":5,"verified_fuzzy":42},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 1 inbound Pith citation observation for arXiv:2505.02393."}