{"as_of":"2026-08-10T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25ba4fad62c0d4a68eacd800ddebc6d31ec7c6f9e6aba011fced16d2628aadf2","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:16.669323Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:30:09.804400Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T07:36:13.968526Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19877","snapshot_observed_at":"2026-08-06T13:30:09.804400Z","title":"Vad-r1: Towards video anomaly rea- soning via perception-to-cognition chain-of-thought.arXiv preprint arXiv:2505.19877, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20629","last_updated":"2025-07-28T08:42:00Z","snapshot_observed_at":"2026-08-10T02:05:49.477672Z","submitted_at":"2025-07-28T08:42:00Z","title":"DAMS:Dual-Branch Adaptive Multiscale Spatiotemporal Framework for Video Anomaly Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:30:09.804400Z"},"links":{"cited_paper":"/paper/2505.19877","citing_paper":"/paper/2507.20629"},"observation_digest":"sha256:2b307091b6234e4d0e987f43baca8ee149092674aa094d29b31ad999e1dc1209","observation_id":"6857c0f6-5f78-4966-9f29-2684b9ee4c1b","resolution":{"observed_at":"2026-08-06T13:30:09.804400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2505.19877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19877","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vad-r1: Towards video anomaly reasoning via perception-to-cognition chain- of-thought","venue":null,"work_id":"96ea5c93-0a38-4eb7-b0dd-ae8d99c141bc","year":2025},"citing_paper":{"arxiv_id":"2604.07772","last_updated":"2026-04-09T03:51:14Z","snapshot_observed_at":"2026-07-31T19:42:42.310290Z","submitted_at":"2026-04-09T03:51:14Z","title":"ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:55:32.945721Z"},"links":{"cited_paper":"/paper/2505.19877","citing_paper":"/paper/2604.07772"},"observation_digest":"sha256:5faa3361bbc4e3794c1213c0e672706ee3697a1d1dbef78a00301af70db9926c","observation_id":"2d58dce4-7863-4b4e-91da-9b45bf647994","resolution":{"observed_at":"2026-05-11T05:51:03.085000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2505.19877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19877","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vad-r1: Towards video anomaly reasoning via perception-to-cognition chain- of-thought","venue":null,"work_id":"96ea5c93-0a38-4eb7-b0dd-ae8d99c141bc","year":2025},"citing_paper":{"arxiv_id":"2605.21917","last_updated":"2026-07-08T19:55:21Z","snapshot_observed_at":"2026-07-12T23:17:31.862892Z","submitted_at":"2026-05-21T02:44:27Z","title":"MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T07:36:09.562362Z"},"links":{"cited_paper":"/paper/2505.19877","citing_paper":"/paper/2605.21917"},"observation_digest":"sha256:ee701e7d0587d0274d05d5f405e918a2db5f7c72628ac34b43f3a311431f7640","observation_id":"ba04cbef-78eb-49da-b50f-06c5f2bf4820","resolution":{"observed_at":"2026-05-22T07:36:13.970967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19877","snapshot_observed_at":"2026-07-12T16:17:21.074502Z","title":"Vad-r1: Towards video anomaly reasoning via perception-to-cognition chain- of-thought.arXiv preprint arXiv:2505.19877, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.21917","last_updated":"2026-07-08T19:55:21Z","snapshot_observed_at":"2026-07-12T23:17:31.862892Z","submitted_at":"2026-05-21T02:44:27Z","title":"MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T16:17:21.074502Z"},"links":{"cited_paper":"/paper/2505.19877","citing_paper":"/paper/2605.21917"},"observation_digest":"sha256:f27a0969e9317945d3254a0782e4f6b06190d7cd55e72f8a2a9208120198e6a7","observation_id":"7847a13a-472b-4470-a74c-608e47558be7","resolution":{"observed_at":"2026-07-12T16:17:21.074502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19877","snapshot_observed_at":"2026-08-01T15:56:41.756320Z","title":"arXiv preprint arXiv:2505.19877 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18142","last_updated":"2026-07-20T16:36:00Z","snapshot_observed_at":"2026-08-07T21:56:26.957775Z","submitted_at":"2026-07-20T16:36:00Z","title":"O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T15:56:41.756320Z"},"links":{"cited_paper":"/paper/2505.19877","citing_paper":"/paper/2607.18142"},"observation_digest":"sha256:081928a9ee656d1024a42f418154fb0ad5c29948d0fade96059e7baba330b3d4","observation_id":"615540cb-879f-45fc-b9cc-2eaa3b41bae6","resolution":{"observed_at":"2026-08-01T15:56:41.756320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19877/citation-record","integrity":"/paper/2505.19877/integrity","json":"/paper/2505.19877/citation-record.json","paper":"/paper/2505.19877"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.474749Z","title":"Ubnormal: New benchmark for supervised open-set video anomaly detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.474749Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:04684f28ccd667f25810d0a58020fadbe6d84a865b404c09c00f2158dbadf3a6","observation_id":"74b36822-cd20-42bb-ad5f-b0b31c146b13","resolution":{"observed_at":"2026-08-07T14:09:05.474749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.615261Z","title":"Claude 3.5 haiku, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.615261Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:bc5060cef9a653a0ef69db8ee2599a67e84654db161109704b20736e272c06a5","observation_id":"0a812610-d509-40fb-af09-728b338fb3e6","resolution":{"observed_at":"2026-08-07T14:09:05.615261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.755439Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.755439Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:1a04b24c91e014e6b7dfcb488c7357711bb144451f64587ac46a3f99069e8207","observation_id":"26d5540a-20ea-4024-88c9-e95a8ebe8c35","resolution":{"observed_at":"2026-08-07T14:09:05.755439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.848111Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.848111Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:401bc34872a2c54784ef1b9a4aa469dfdbbce1715aaf41d6434a9002b3e298b3","observation_id":"a97f2be7-6769-4435-b10e-77d3507e57ca","resolution":{"observed_at":"2026-08-07T14:09:05.848111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:05.965114Z","title":"A new comprehensive benchmark for semi-supervised video anomaly detection and anticipation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:05.965114Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:c9bfedf395b9cd6bc0f286551ea974ae1b6dc6e06f0bb588f53a6bab78c0707b","observation_id":"007a6b95-d44e-496d-bac1-f5ee3bd80d15","resolution":{"observed_at":"2026-08-07T14:09:05.965114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:06.064765Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.064765Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:82c6aeb528cf512c022853aad04ebda7de26d0f01261521db9c7a9c2828deb0c","observation_id":"75f469a1-55fb-4e12-bfdd-de9b17badfb2","resolution":{"observed_at":"2026-08-07T14:09:06.064765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:06.185678Z","title":"Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.185678Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:e27694393aa98a8c0e7d132f42d3021ed16c9e879b7003f6b5ddd289eacae642","observation_id":"4c726091-ed65-48b8-bb34-4b095c0e1dfe","resolution":{"observed_at":"2026-08-07T14:09:06.185678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:06.335558Z","title":"Tevad: Improved video anomaly detection with captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.335558Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:97003b825efdf27c0eb0a7fc88e730addfafc68237dfe6a0fa9c413eb1fc651c","observation_id":"e1e0d1f6-85ae-4ca4-9fe3-18bed1997561","resolution":{"observed_at":"2026-08-07T14:09:06.335558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:09:06.452918Z","title":"DeepSeek-R1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.452918Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:2cfb1d388fd83ba33e18f4ee7e3c82b065106e2eacc96c6bbe1c4304f21d7e8a","observation_id":"2bea092f-ab99-4ae8-8334-e2ad17b0e165","resolution":{"observed_at":"2026-08-07T14:09:06.452918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00540","last_updated":"2025-03-01T15:53:33Z","snapshot_observed_at":"2026-08-07T17:37:08.261243Z","submitted_at":"2025-03-01T15:53:33Z","title":"Streaming Video Question-Answering with In-context Video KV-Cache Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00540","snapshot_observed_at":"2026-08-07T14:09:06.602730Z","title":"Streaming video question-answering with in-context video kv-cache retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.602730Z"},"links":{"cited_paper":"/paper/2503.00540","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:de229d66188bea060a4e81ccbcd729db1d81f282e41e2b6eb2a1a119a080abd8","observation_id":"6fd8b443-55a2-4713-a11c-1352c1a8819a","resolution":{"observed_at":"2026-08-07T14:09:06.602730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10320","last_updated":"2025-04-14T15:30:03Z","snapshot_observed_at":"2026-08-09T07:05:10.374362Z","submitted_at":"2025-04-14T15:30:03Z","title":"SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10320","snapshot_observed_at":"2026-08-07T14:09:06.744774Z","title":"Slowfastvad: Video anomaly detection via integrating simple detector and rag-enhanced vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.744774Z"},"links":{"cited_paper":"/paper/2504.10320","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:85a4cba9a8b2708353a8f86c052e96a5e63dd026bf2f88921b5524b0973de5c8","observation_id":"6f6e1000-48b4-49d2-9084-00d401747976","resolution":{"observed_at":"2026-08-07T14:09:06.744774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07183","last_updated":"2024-12-10T04:41:44Z","snapshot_observed_at":"2026-07-06T20:04:25.198952Z","submitted_at":"2024-12-10T04:41:44Z","title":"Exploring What Why and How: A Multifaceted Benchmark for Causation Understanding of Video Anomaly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07183","snapshot_observed_at":"2026-08-07T14:09:06.865811Z","title":"Exploring what why and how: A multifaceted benchmark for causation understanding of video anomaly","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.865811Z"},"links":{"cited_paper":"/paper/2412.07183","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:9325670865a97abad85bc35af16ac71a4a43e171eb852cf9c8c32aea0b67f3f6","observation_id":"d9af6d20-f371-4888-a015-7a7e9556afd8","resolution":{"observed_at":"2026-08-07T14:09:06.865811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:06.941062Z","title":"Uncovering what why and how: A comprehensive benchmark for causation understanding of video anomaly","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:06.941062Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:00625028947bd36d018906a00be68819a1b6f8b343581a7978a623f830e19dc5","observation_id":"ae150774-d5e4-47b9-ad27-e5ab8f701bcb","resolution":{"observed_at":"2026-08-07T14:09:06.941062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T14:09:07.074909Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.074909Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:deba361b3c3f202a93a6d868778249a9a55e502a652a1412e50fa7d654420a34","observation_id":"c756657f-8bd2-4e55-a4e4-61d6835b3b62","resolution":{"observed_at":"2026-08-07T14:09:07.074909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:07.204754Z","title":"Vane-bench: Video anomaly evaluation benchmark for conversational lmms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.204754Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:8140748ffcfdd721f454ff9e3915b3acd2c13c0b90cc9ed43bb642e862b9f872","observation_id":"a502e150-fc80-453c-bf54-11fb568ebb92","resolution":{"observed_at":"2026-08-07T14:09:07.204754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:07.324835Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.324835Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:e505e77a8819dac73b803f1cacf8dbc9137808fb5fdd1e79dacc75d257270877","observation_id":"488b2ac5-11a5-4341-8c92-923f5ce21e6e","resolution":{"observed_at":"2026-08-07T14:09:07.324835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:07.457830Z","title":"Abnormal event detection using deep contrastive learning for intelligent video surveillance system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.457830Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:8add5a787c7bc200066dac06673c45b784585b5f8cd24b607b8dacad8c37e319","observation_id":"0c1d6677-8766-4f32-9967-07573de7014b","resolution":{"observed_at":"2026-08-07T14:09:07.457830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:07.584828Z","title":"Weakly supervised video anomaly detection via self-guided temporal discriminative transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.584828Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:97e839dbad4b0ecadc7291fa9e2d2fe5432252b14d4dcd380e6d33ae292a6fe6","observation_id":"a6fdc99f-7990-47d5-9de8-e07f8c1467a5","resolution":{"observed_at":"2026-08-07T14:09:07.584828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:07.694327Z","title":"Self-supervised attentive generative adversarial networks for video anomaly detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.694327Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:8e99bebcfa15fa49bdaf2875dc889bacb63dcd4eccb53c5ae7f2c424ef8e9be6","observation_id":"e92d8aac-4946-45a9-a887-1d6e19654b5b","resolution":{"observed_at":"2026-08-07T14:09:07.694327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.718533Z","title":"Long short-term dynamic prototype alignment learning for video anomaly detection","venue":null,"work_id":"d87f2004-b12b-4d7a-b3df-12384bc37885","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.844750Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:14b92b38133220f40f66e65236da170062fc63ddff15ca851ed5796e0f0b586d","observation_id":"55e4a19f-f14a-4cd2-8baf-16877e66bd40","resolution":{"observed_at":"2026-08-07T14:09:26.839108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.359891Z","title":"Multi- modal evidential learning for open-world weakly-supervised video anomaly detection","venue":null,"work_id":"f55ed69e-a7df-492a-93e8-f9b5fd0a5abe","year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:07.974751Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:d3257e3b6c884af552dc34b00d622e4636069e4f2b56bffe31ae4ea8eb109965","observation_id":"df11acfd-9dd1-408b-8acd-3f5fef27bc4d","resolution":{"observed_at":"2026-08-07T14:09:26.552206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T14:09:08.062129Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.062129Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:66cba92e5f066e86758b9c3db6c5461fcab847d43ae37cad78efbebce181e5ef","observation_id":"5693514b-b470-4e39-8cc5-c8eb8e252e09","resolution":{"observed_at":"2026-08-07T14:09:08.062129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.077042Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":"9d3e5f21-4bd9-44f7-b901-2c35899e790e","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.224753Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:7288874e0694521fd0aad6c1f3a8230235d3d64dc47aa92d14f529e99f77e096","observation_id":"ea05da91-16eb-45dc-9691-113ca936dd84","resolution":{"observed_at":"2026-08-07T14:09:26.217216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.779290Z","title":"Clip-tsa: Clip-assisted temporal self-attention for weakly-supervised video anomaly detection","venue":null,"work_id":"a8730317-9e8a-47c0-90e7-84a4792d3196","year":2023},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.484751Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:8fb44f2afcf202e650a80e126d05aa0d3c1cffb9649a9b1928629f66d02ad940","observation_id":"bd4c24f3-0769-4fee-a6d4-4e3fc60cebda","resolution":{"observed_at":"2026-08-07T14:09:25.929611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T14:09:08.616938Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.616938Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:56d8c1e3d255369b68a8aa96d1a9db00da34f18765e42a287109c7f48aaac1bf","observation_id":"055477c3-d512-49c2-84aa-4834b945b15b","resolution":{"observed_at":"2026-08-07T14:09:08.616938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.566494Z","title":"Anomaly detection and localization in crowded scenes","venue":null,"work_id":"30215818-a0fc-440e-80be-a6d8f588f1e7","year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.795213Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:bc7976abdd5a80d77d2bcca4490cf6cc9fb695e0221bf6a518db1d63b54bc823","observation_id":"43d8a0f8-915c-4c81-9e1c-28d63e786563","resolution":{"observed_at":"2026-08-07T14:09:25.694757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-07T14:09:08.944838Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:08.944838Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:be7d684deb0767265ab91949040cf12956defb03fba502f495a840540e9db248","observation_id":"7cbb5882-cc3d-430f-b987-5b744e65f3ef","resolution":{"observed_at":"2026-08-07T14:09:08.944838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T14:09:09.154751Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.154751Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:9ce4aae58644f9a9d7b8016bff3ac9cdbdcb054ffee7d6dc4fb5ff4c62db8e6d","observation_id":"553478bb-aace-4b35-baf5-b767d1820f7c","resolution":{"observed_at":"2026-08-07T14:09:09.154751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.303502Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"20900a5b-4ffb-4459-bf4a-25076089224a","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.259223Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:1276d6adf70612f3ff7725154c8e3ee5e424b61785c431aa0a01b354cb493d3c","observation_id":"2d68afd5-ad4a-4810-ad0e-9ef78d163385","resolution":{"observed_at":"2026-08-07T14:09:25.440900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T14:09:09.355173Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.355173Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:29a2f97d974dd450392ad63596be05981c4cedf0e9bef26e5a50efb8eb179f45","observation_id":"691657a4-6481-4c8d-8176-03358e97511b","resolution":{"observed_at":"2026-08-07T14:09:09.355173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:09.420025Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.420025Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:0093a7cea22fa010113a02f8b735a36cd84951233a7804a2461304cdd78b2e19","observation_id":"6d5d9df4-6d10-4750-9f61-435e7b11e8c2","resolution":{"observed_at":"2026-08-07T14:09:09.420025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.013996Z","title":"Future frame prediction for anomaly detection–a new baseline","venue":null,"work_id":"1d01b1be-ad2d-4283-b54b-8760c3c5d008","year":2018},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.505566Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:feef32905667c32f1551278526a8f01f95c6c1eba22a2c1ad05588a27ba5d7c7","observation_id":"4ebeb344-590d-49e2-9024-331040fdedd9","resolution":{"observed_at":"2026-08-07T14:09:25.114118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:09.564739Z","title":"Videomind: A chain-of-lora agent for long video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.564739Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:1d1d7f055c7ed2eadf17f63a9f430f10ae39dbe3abd2d02fb32b498191200739","observation_id":"05a3f08a-54d7-4589-8323-56bb18885531","resolution":{"observed_at":"2026-08-07T14:09:09.564739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.790289Z","title":"A hybrid video anomaly detection framework via memory-augmented flow reconstruction and flow-guided frame prediction","venue":null,"work_id":"cadb48d0-636f-40d1-95e7-c1c6faf59788","year":2021},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.627328Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:b881a3ad27c32f4ef984794e652c4b3a0631068627adda02a7e55b6a3087323d","observation_id":"7c41ad22-a1dd-4d6a-9c10-72f8d536cd85","resolution":{"observed_at":"2026-08-07T14:09:24.904990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.541014Z","title":"Abnormal event detection at 150 fps in matlab","venue":null,"work_id":"badda7e6-6935-4725-be23-856b81eb2538","year":2013},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.713530Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:d45ac675d85fc203dc053b397b3c2c82ed94b92de97573070fa15e9f3eafc072","observation_id":"fa7210e4-9495-44ff-8a9e-c199bdd8a1f7","resolution":{"observed_at":"2026-08-07T14:09:24.666630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05702","last_updated":"2024-01-11T07:09:44Z","snapshot_observed_at":"2026-08-10T20:16:26.173310Z","submitted_at":"2024-01-11T07:09:44Z","title":"Video Anomaly Detection and Explanation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05702","snapshot_observed_at":"2026-08-07T14:09:09.799641Z","title":"Video anomaly detection and explanation via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.799641Z"},"links":{"cited_paper":"/paper/2401.05702","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:ab067ce44688338dc189ca94f09d5db186850692d8e437ec88f7d1fb5a5d5112","observation_id":"e63d5cbe-9a66-4311-9a70-570cae6a6718","resolution":{"observed_at":"2026-08-07T14:09:09.799641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.321362Z","title":"Localizing anomalies from weakly-labeled videos","venue":null,"work_id":"a31472cc-a492-4572-a165-68eb2b3c713d","year":2021},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:09.912993Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:ea7b8e063f7af09588f1509b024227d4f55db02054e93fef85efd76e726fec13","observation_id":"b1165a0b-ab5b-460b-954b-803afd48c95a","resolution":{"observed_at":"2026-08-07T14:09:24.434697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.087772Z","title":"Sherlock: Towards multi-scene video abnormal event extraction and localization via a global-local spatial-sensitive llm","venue":null,"work_id":"39654434-39c5-446c-95db-d150bac81bbb","year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:10.058849Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:7910ed8227681f8393dcdf8eb46a64d764c39cb57809aece76ddf0e2d3f25720","observation_id":"b1f53c55-f8f8-4cc3-8378-0ffb6a2ddee9","resolution":{"observed_at":"2026-08-07T14:09:24.199170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T14:09:10.196311Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:10.196311Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:a7857096a1727c6c2e6ec19a042982b22968a52f64254af64549f6c750186ec5","observation_id":"b176954c-530a-42a8-bfc5-798933f5caae","resolution":{"observed_at":"2026-08-07T14:09:10.196311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:09:10.302054Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:10.302054Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:87de0dcf896a324b9f661b7985bebcaac184a733323f079d8f7e624395f19182","observation_id":"07fa7e2a-920e-4c79-92d3-5dcd7075e8a5","resolution":{"observed_at":"2026-08-07T14:09:10.302054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:09:10.444749Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:10.444749Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:1e39f5c4d8cd44664726c66a065d3cfd13524c1814c4ab1c57af2bb6533e5a5f","observation_id":"a5b0c482-f59f-4766-b458-7d87296821ea","resolution":{"observed_at":"2026-08-07T14:09:10.444749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.834258Z","title":"Openai o3 and o4-mini system card, 2025","venue":null,"work_id":"c23f5609-cbc7-4157-a138-3fb8943fecd0","year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:10.505981Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:1d54308cd5272742a37fa77411d5c61e9ed98ccbf93ccc84bedd6381f2327047","observation_id":"ff741184-1820-4969-8740-24d993a00f77","resolution":{"observed_at":"2026-08-07T14:09:23.939270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.582419Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"e4aac50f-b09b-4159-9d7f-77b0a4dfe81a","year":2002},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:10.667970Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:4f7d6cfeede882836b65b0301ff2460e4eaa3188acd579c5501a73d17130a6dc","observation_id":"c6805c43-c11e-466e-8f1b-c68ee9a2e2c8","resolution":{"observed_at":"2026-08-07T14:09:23.714214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.434560Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"d8f1ac0a-bde4-495f-aefe-8897191830ef","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:10.756335Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:b38ccb668bf09dd9973a117080f46c180d72bc7a3f37d8212c4e9434162fc835","observation_id":"97381c00-2406-43a0-a95b-e3928a48e55d","resolution":{"observed_at":"2026-08-07T14:09:23.495945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.234140Z","title":"Self-distilled masked auto-encoders are efficient video anomaly detectors","venue":null,"work_id":"500aa9c5-c9a2-4ae2-a2fa-cc9930b0e90c","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:10.887212Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:0852169594bfda5cbbd6358d2d5bb6b8927dfb49c4ec14962e14d77eb0213bc7","observation_id":"5f14ff13-2a79-46b5-bef6-5d56de4466cf","resolution":{"observed_at":"2026-08-07T14:09:23.327144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.030707Z","title":"Gen-2: The next step forward for generative ai","venue":null,"work_id":"5df30e7c-1938-4ccc-8691-f7def268072b","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.035451Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:00af8a09e80a8da51c7cd82ac95adc78164106dd8ed84fe4bd1cd9be4c1b5c48","observation_id":"ff2d1d07-f497-4710-a4fb-0c452f49e8c7","resolution":{"observed_at":"2026-08-07T14:09:23.141205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:09:11.127199Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.127199Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:04dc2f91e3e06e5f96db311783d4da0abc66c6929ffeb835b734a23ef9e3ebe8","observation_id":"e02fa9d3-ca25-41f5-a676-0994b4c8d26d","resolution":{"observed_at":"2026-08-07T14:09:11.127199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.790538Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"2ab1d1fb-cb37-4476-ab0e-10af79229567","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.208115Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:ea4a265f9b1be95da0713016b2847172ef8228bf3cce1e353c71109196204cea","observation_id":"2614eb40-de40-4d40-b6e9-943ee598bd43","resolution":{"observed_at":"2026-08-07T14:09:22.897638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.598384Z","title":"Real-world anomaly detection in surveillance videos","venue":null,"work_id":"647a6f3c-a264-4dc4-91fb-1d2c18d8deb9","year":2018},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.296667Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:24189aa5fc27523f42f497d5de65bbc4b3bd74204d8ae5d6f6f98b69b0072a73","observation_id":"afb1d732-1205-4164-9414-c057c4dbcb29","resolution":{"observed_at":"2026-08-07T14:09:22.698560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.366436Z","title":"Hawk: Learning to understand open-world video anomalies","venue":null,"work_id":"4fbdf8b5-a4cf-4715-8271-f70845841b7c","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.427614Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:67325c499ac858d0c35cc8754117b8ce28cb6ce761fcfe4a16591158b56a22e8","observation_id":"20eda1fa-7d2a-4aa5-b4cd-1d375a38df29","resolution":{"observed_at":"2026-08-07T14:09:22.477709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.130383Z","title":"Gemini 2.5 flash preview model card, 2025","venue":null,"work_id":"a486d438-14da-4191-934c-8e05813f4702","year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.520760Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:858f9baa9dac8d13a3b2eb7165471887ba4914f5982be740c9576d110688d736","observation_id":"6f3f12c2-58de-4482-8856-24dfd35cde15","resolution":{"observed_at":"2026-08-07T14:09:22.248638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.912831Z","title":"Gemini 2.5 pro preview model card, 2025","venue":null,"work_id":"483bbb0b-51c1-4ec9-bfe8-bbc657aed284","year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.656655Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:80cbedef66d6cf5c96b15f3ebdc0cd29239d28c16dc2931263972c93567d6562","observation_id":"2744d918-66fa-439e-aaa5-e79ce0f16cc2","resolution":{"observed_at":"2026-08-07T14:09:22.011914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-10T17:28:59.378726Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:09:11.779386Z","title":"Kimi k1.5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.779386Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:b0443a67479f6d00889ccb92c00387e7c8035ae41c990e63bbf15e6eb57eac5f","observation_id":"8ee43beb-a40e-4c8c-a2b2-37ea29aec736","resolution":{"observed_at":"2026-08-07T14:09:11.779386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.695348Z","title":"QwQ: Reflect deeply on the boundaries of the unknown, 2024","venue":null,"work_id":"5dbda843-d62f-49ec-8a75-2cf3558e2369","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:11.905318Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:4eed909b0e67f8bcbc2cbc5fda928581e936ef7075732a1308454384b0df924d","observation_id":"07226a3d-d355-4915-b1de-611b370b356f","resolution":{"observed_at":"2026-08-07T14:09:21.768204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:09:12.056747Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.056747Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:c3e3edc438c94e90d6bf476b8b66be74528fede1671fb0eb559016fce8575a3b","observation_id":"1f500267-5cd6-4dd0-8b16-da052f6e8663","resolution":{"observed_at":"2026-08-07T14:09:12.056747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.450031Z","title":"QVQ-Max: Think with evidence, 2025","venue":null,"work_id":"8613817b-8946-42ac-8c9e-f4d0098cf8e9","year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.193934Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:d00c97f21b0f9d7d0e4d7571f22f7ccdb7356f5016c4e05292e4b21cdbf68070","observation_id":"1ab641df-1237-4bfe-a4bb-f070f355621d","resolution":{"observed_at":"2026-08-07T14:09:21.561752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:09:12.381462Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.381462Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:607d3155a634033a8e931629ee43d5ff7351ab17cec625153af2ee3af751ee7a","observation_id":"448e5500-10ea-4142-bb64-1724dfe07742","resolution":{"observed_at":"2026-08-07T14:09:12.381462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.309713Z","title":"Qwen3: Think deeper, act faster, 2025","venue":null,"work_id":"37373aa7-957f-46b2-af9f-510622b9e670","year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.515845Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:3ec0e8160292344c01021319c868ae0d5c76e4286b82973540825fc8f9234e38","observation_id":"df645d7a-95e1-4249-b0ab-2baea805dd5e","resolution":{"observed_at":"2026-08-07T14:09:21.383574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T14:09:12.592946Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.592946Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:4482bbb899bb795f587959be32408f918cff3cda18627636d5a319b702b3be88","observation_id":"28b90eaf-839a-41af-9fbf-d26950833de2","resolution":{"observed_at":"2026-08-07T14:09:12.592946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.028746Z","title":"Federated weakly supervised video anomaly detection with multimodal prompt","venue":null,"work_id":"89b82754-cdbe-4c02-8188-6c6759e94131","year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.737393Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:76efa1dcf82aaf9a4259c4ba20e35d2ed1bd29b1d74fefa895262816bbb2c0e6","observation_id":"dd14da3b-8530-400d-aff9-1662944d3cef","resolution":{"observed_at":"2026-08-07T14:09:21.196877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.778268Z","title":"Modelscope text-to-video technical report, 2023","venue":null,"work_id":"7e970580-3f78-441b-88e4-b9beab98a06b","year":2023},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.826604Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:fd7a229c4ba589a0243d746310a5958b5163ec6c4d14f0c19c00e425af94229a","observation_id":"d5da0cb7-c562-42fe-a2f2-f59dad0ba0f5","resolution":{"observed_at":"2026-08-07T14:09:20.893590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.563027Z","title":"Videolcm: Video latent consistency model, 2023","venue":null,"work_id":"6168e75b-17b4-4b46-97cc-730f54dc084a","year":2023},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:12.954393Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:541b5ee8ea49067d8540b07e5f6c6f8463f37caf327de914bde8626f38b971d5","observation_id":"65b6ee68-ab31-4868-ac25-8f5e2446f386","resolution":{"observed_at":"2026-08-07T14:09:20.667580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.332195Z","title":"Open-r1-video, 2025","venue":null,"work_id":"df7a23ec-f707-40a0-aac1-8ae7a98c2187","year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.063090Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:1c50beaec615984580f7516e47fedcb13b7f06d7a4ba86a6aa53404dd69c3f57","observation_id":"81712c2c-aba2-44c1-bd0a-5c9359dedc18","resolution":{"observed_at":"2026-08-07T14:09:20.421517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-07T14:09:13.173718Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.173718Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:11c533065e97defd626bfb0b13b18fa556e2424b0aba139d9a8416b68589226b","observation_id":"e45504bb-270e-4351-b01d-cf44a4d26041","resolution":{"observed_at":"2026-08-07T14:09:13.173718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T14:09:13.309276Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.309276Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:21e3b625bfec548f3e863706ca227240482e4b3557c74a7884e8c0ca8d370918","observation_id":"01a233a0-30b5-42cc-a9b7-5a273bf9102d","resolution":{"observed_at":"2026-08-07T14:09:13.309276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:20.179597Z","title":"Not only look, but also listen: Learning multimodal violence detection under weak supervision","venue":null,"work_id":"aa0f7d10-0f45-4bc1-aedb-58a777f49579","year":2020},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.455450Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:494f51ca216cf629533d6d57a658211b3a52eb71e0616e075ea358d8a59b2472","observation_id":"a4d1e605-c307-44f1-80bf-b179812f6c30","resolution":{"observed_at":"2026-08-07T14:09:20.273475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.966353Z","title":"Open-vocabulary video anomaly detection","venue":null,"work_id":"f640e115-3f22-4b0c-b59e-9b0e318258e3","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.666971Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:2dfadda92e215d0d57926a0d8def171cb7d2b98220ab8aabae9f74bfede40dbf","observation_id":"7a19cb88-7667-4f19-9b35-15bf95a02bce","resolution":{"observed_at":"2026-08-07T14:09:20.056783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.671222Z","title":"Vadclip: Adapting vision-language models for weakly supervised video anomaly detection","venue":null,"work_id":"3c69c6fc-c543-4991-92d7-5aa87b44f6f2","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.834821Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:9125125b2c6fbdc293c2865a01725c2467d446edbe3bbf3d4ca660ce221a7244","observation_id":"c88bff23-6e4c-42ae-919e-f53d82d146fc","resolution":{"observed_at":"2026-08-07T14:09:19.794855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13468","last_updated":"2025-01-23T08:33:10Z","snapshot_observed_at":"2026-08-10T15:52:49.177380Z","submitted_at":"2025-01-23T08:33:10Z","title":"Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13468","snapshot_observed_at":"2026-08-07T14:09:13.898584Z","title":"Streaming video understanding and multi-round interaction with memory-enhanced knowl- edge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.898584Z"},"links":{"cited_paper":"/paper/2501.13468","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:ac16c2d9d3e1bcb26d5a99c97749d14b66d3a7c3daec04441812e232333a6de7","observation_id":"e57d3da4-cce2-4184-93a0-e8ea7e0e0757","resolution":{"observed_at":"2026-08-07T14:09:13.898584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T14:09:13.996611Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:13.996611Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:afaa3ae5fa5ea4fe01da9f6e8e7d06e70a510f89a96b3023d7c8c4aa3df265f0","observation_id":"0b2d7b0d-c14e-40c1-afad-4bb99c6a607e","resolution":{"observed_at":"2026-08-07T14:09:13.996611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T14:09:14.086670Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.086670Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:00337be0dc37a5b6935d451c572f9b7c8ef0105dee804f2af1cbfe3983bf1f5b","observation_id":"acfe4bdc-31fb-4919-a07b-0e12ef58cd21","resolution":{"observed_at":"2026-08-07T14:09:14.086670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.403992Z","title":"Feature prediction diffusion model for video anomaly detection","venue":null,"work_id":"a520202e-db07-4285-b133-c77a3226aed0","year":2023},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.200572Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:a613dd7963e43324a00a25e97bd94830af6ec97a17d7fab23db186f090edbbe4","observation_id":"a43e15e6-d262-46ed-9cc9-c4d206fa7355","resolution":{"observed_at":"2026-08-07T14:09:19.515052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.182973Z","title":"Follow the rules: reasoning for video anomaly detection with large language models","venue":null,"work_id":"b6250fad-3d1c-4202-9f21-ba0ddd8cfc91","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.315573Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:2cdd08e55c3cd96bbdf567dce50624cb5e299d3c551af59aa20b75ad97255c6e","observation_id":"109c2b18-687d-4567-abbd-242fca3d7672","resolution":{"observed_at":"2026-08-07T14:09:19.308536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:14.364645Z","title":"Svbench: A benchmark with temporal multi-turn dialogues for streaming video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.364645Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:f69e571f605d8a87e350657e67e229910a9016cbdc622f1d8547cf1fdbe96492","observation_id":"7da2edef-5179-49bc-a2d6-39b27bc27b8f","resolution":{"observed_at":"2026-08-07T14:09:14.364645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.940483Z","title":"Dota: Unsupervised detection of traffic anomaly in driving videos.IEEE transactions on pattern analysis and machine intelligence, 45(1):444–459, 2022","venue":null,"work_id":"4f2c5983-80db-4aa6-9845-551ff391eb67","year":2022},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.550526Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:57c87a243bf3ae20af874d22d1754763f1ba0692ef1e258b5b4787d2fa80ffbb","observation_id":"8cd34668-23b6-4bb2-9314-b1f26960f6b0","resolution":{"observed_at":"2026-08-07T14:09:19.059976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01095","last_updated":"2025-03-31T20:17:27Z","snapshot_observed_at":"2026-08-10T16:55:27.191164Z","submitted_at":"2024-12-02T04:10:14Z","title":"VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01095","snapshot_observed_at":"2026-08-07T14:09:14.656477Z","title":"Vera: Explainable video anomaly detection via verbalized learning of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.656477Z"},"links":{"cited_paper":"/paper/2412.01095","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:4affad495b45cee85d4e412a66aa09aab7fbb5a7bf8bd8f6e2f39d8d2072ea4b","observation_id":"92a88d12-b3c7-4dae-8ef0-d5de816ef36a","resolution":{"observed_at":"2026-08-07T14:09:14.656477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12081","last_updated":"2025-02-17T17:55:55Z","snapshot_observed_at":"2026-08-10T09:10:13.258194Z","submitted_at":"2025-02-17T17:55:55Z","title":"Unhackable Temporal Rewarding for Scalable Video MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12081","snapshot_observed_at":"2026-08-07T14:09:14.787236Z","title":"Unhackable temporal rewarding for scalable video mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.787236Z"},"links":{"cited_paper":"/paper/2502.12081","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:6b9a64e7226ed6cf32286cfbaa70267a8f5b67710d2f01ee59a1a8ebf042ff06","observation_id":"a22424f5-40a8-4045-8435-a6ee1dab4d81","resolution":{"observed_at":"2026-08-07T14:09:14.787236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.733718Z","title":"Towards surveillance video-and-language understanding: New dataset baselines and challenges","venue":null,"work_id":"0f4b148b-5f6f-48f0-aa4f-7f51c1444983","year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:14.937077Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:c8936fc346c5dab90950514ec8c3563419641b8e0d93453447902a51d7b67b06","observation_id":"1f712552-3535-42cd-9da4-ffb909c68cd5","resolution":{"observed_at":"2026-08-07T14:09:18.816692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.527213Z","title":"Generative cooperative learning for unsupervised video anomaly detection","venue":null,"work_id":"5f5eb0a8-3b99-414e-8799-ae89560eb2ee","year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.060104Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:224f7337108430ff067fce62499aee04b3e82279637ee93d6f37fa107f6c5ec7","observation_id":"deaa7724-d981-4235-b62b-1accd7085ef8","resolution":{"observed_at":"2026-08-07T14:09:18.571228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:18.259196Z","title":"Har- nessing large language models for training-free video anomaly detection","venue":null,"work_id":"fbf96885-78e3-49ac-b682-27d43ebe5da9","year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.166896Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:eec16527572c38973c74970618874506cd97e1673130857cfa8febb61abd2bc4","observation_id":"c8ec1c8e-1397-447d-a78f-c2c221af5bab","resolution":{"observed_at":"2026-08-07T14:09:18.409732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-10T11:40:54.338233Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T14:09:15.259254Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.259254Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:41210656e2b4c1c4dbe4ec5a353ef26784fb3e2dc20f022a091c657af3abedf6","observation_id":"850ec3cd-0c61-4c3f-8211-822fc8fc9f39","resolution":{"observed_at":"2026-08-07T14:09:15.259254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T14:09:15.409059Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.409059Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:a7da7d1f83f127612ab39c9d5a9a0a2a68970d389ab6327440f42755c24550f9","observation_id":"266dcb77-7c01-4542-9de0-21ee260189c1","resolution":{"observed_at":"2026-08-07T14:09:15.409059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T14:09:15.530406Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.530406Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:5ad0d35e0a47ed4fe7f31e7833791f0d72a6ac9b0d87774a38592f7b58eb52f4","observation_id":"2eb827d8-4f25-4651-ad6f-4a6795047fed","resolution":{"observed_at":"2026-08-07T14:09:15.530406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12235","last_updated":"2024-06-29T08:15:27Z","snapshot_observed_at":"2026-08-08T10:20:53.120797Z","submitted_at":"2024-06-18T03:19:24Z","title":"Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12235","snapshot_observed_at":"2026-08-07T14:09:15.602472Z","title":"Holmes-vad: Towards unbiased and explainable video anomaly detection via multi-modal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.602472Z"},"links":{"cited_paper":"/paper/2406.12235","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:14e4e0c10fa2557999a842a01fac948b176613b5c72702f53fc13564e6d4b5b0","observation_id":"728085c7-9f30-4485-b642-9e33b7928028","resolution":{"observed_at":"2026-08-07T14:09:15.602472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06171","last_updated":"2025-03-14T10:23:06Z","snapshot_observed_at":"2026-07-06T20:03:38.451641Z","submitted_at":"2024-12-09T03:05:34Z","title":"Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06171","snapshot_observed_at":"2026-08-07T14:09:15.659121Z","title":"Holmes-vau: Towards long-term video anomaly understanding at any granularity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.659121Z"},"links":{"cited_paper":"/paper/2412.06171","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:d29be587b29f24de1e0ae9af4c04c64702c7d1386131d6e95227e62444e0d457","observation_id":"af67379d-8252-48e8-9a0a-ce2e08eb9104","resolution":{"observed_at":"2026-08-07T14:09:15.659121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T14:09:15.746320Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.746320Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:7309bd699e8ded63ca7843328c7e296b4ea80decdf19bcea290146a06130ce82","observation_id":"094c0bcc-ac62-41ab-9ccc-b719cc5beb56","resolution":{"observed_at":"2026-08-07T14:09:15.746320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T14:09:15.810537Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.810537Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:2874fe6a10bee3065d9b9da59f998cabc532e7b9806a0f9ade34fc2fad16d99a","observation_id":"bd3e1bb2-1c08-43a0-95df-5a76ad9fb136","resolution":{"observed_at":"2026-08-07T14:09:15.810537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09641","last_updated":"2025-04-13T16:32:49Z","snapshot_observed_at":"2026-08-08T07:14:04.916356Z","submitted_at":"2025-04-13T16:32:49Z","title":"TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09641","snapshot_observed_at":"2026-08-07T14:09:15.937040Z","title":"Tinyllava-video-r1: Towards smaller lmms for video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.937040Z"},"links":{"cited_paper":"/paper/2504.09641","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:9d02a45e996f9651ef4e40450b101467d290fca4f8d6e923837e5973dffab6a1","observation_id":"6c710c76-cef8-41fb-ad94-db1d04df5e4e","resolution":{"observed_at":"2026-08-07T14:09:15.937040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T14:09:16.030499Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.030499Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:eae7402a4d46fecb39878842630f7eb03e05e930130a4ab8c473d5a31fb2bd22","observation_id":"98a25c67-145d-45dc-be12-5c0ffaeba027","resolution":{"observed_at":"2026-08-07T14:09:16.030499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:17.954244Z","title":"Graph convo- lutional label noise cleaner: Train a plug-and-play action classifier for anomaly detection","venue":null,"work_id":"6679f3e1-4d3f-416b-a8ee-f2eaed48e74a","year":2019},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.151891Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:0c51fd8d5f92dcf8ef59df7009be241b4423aea02a505652a0cd6849c1894124","observation_id":"c33dd798-8d2a-44b6-a9c1-eb45f49350fb","resolution":{"observed_at":"2026-08-07T14:09:18.081186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:17.737223Z","title":"Dual memory units with uncertainty regulation for weakly supervised video anomaly detection","venue":null,"work_id":"66726812-7e49-44f1-9ce6-7ed366de22ea","year":2023},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.297176Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:4c3e100c70eb97930f250e2b88f0ad8394bcca0f04c10241bf722b857f0e3e1d","observation_id":"90acc084-8ab1-42a2-a060-599dc0223d2b","resolution":{"observed_at":"2026-08-07T14:09:17.901725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:09:16.421330Z","title":"Animals Hurt Human\\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.421330Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:847318b259d0b71974f62a11644c0c4281349967d7378f8802a684b1d62c7a21","observation_id":"f059adeb-1584-42cc-8b4d-52f63e67b90f","resolution":{"observed_at":"2026-08-07T14:09:16.421330Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:17.508263Z","title":null,"venue":null,"work_id":"cd9b426a-aac3-46cd-9c19-63ed484d0cb5","year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.580056Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:34695b37b985327e11f3aa768bf7805d4e4ae3b2ca618198b53d66661c51fc90","observation_id":"4b297de6-0e45-480e-b65c-2feff6bd5c22","resolution":{"observed_at":"2026-08-07T14:09:17.593816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:17.334017Z","title":"Abnormal\\","venue":null,"work_id":"98507aca-8c36-4993-a2ac-9468853deb57","year":null},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.669323Z"},"links":{"citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:2aef888ec5e4d77047df8aa116ca9462894decb01cb4ece03fc3c20d377763a5","observation_id":"c275f453-f17a-4f16-a048-a78a2af03a71","resolution":{"observed_at":"2026-08-07T14:09:17.440481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 5 inbound Pith citation observations for arXiv:2505.19877."}