{"as_of":"2026-08-10T12:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:663f181546e413b8b081a414c18cdb8b1e572f962b8756795a2cb7760895bbb0","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:57:23.605752Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:34:00.291412Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T12:34:01.473793Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"cited_work":{"arxiv_id":"2502.09325","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09325","snapshot_observed_at":"2026-08-06T12:34:01.473793Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","venue":"cs.CV","work_id":"6849f534-a3ee-4035-9b5b-fdf5cd64821b","year":2025},"citing_paper":{"arxiv_id":"2507.21649","last_updated":"2025-07-29T10:07:24Z","snapshot_observed_at":"2026-08-10T03:49:04.165126Z","submitted_at":"2025-07-29T10:07:24Z","title":"The Evolution of Video Anomaly Detection: A Unified Framework from DNN to MLLM","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:34:00.291412Z"},"links":{"cited_paper":"/paper/2502.09325","citing_paper":"/paper/2507.21649"},"observation_digest":"sha256:5739ad62b0167a8302a283631aebf1f9fa6d4d4d084c6ce6c2be7ae6f743c138","observation_id":"5c9d601a-255d-4600-98bf-4cd34de9293f","resolution":{"observed_at":"2026-08-06T12:34:01.477068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09325/citation-record","integrity":"/paper/2502.09325/integrity","json":"/paper/2502.09325/citation-record.json","paper":"/paper/2502.09325"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.962836Z","title":"Real-world anomaly detection in surveillance videos,","venue":null,"work_id":"10b2ecc7-b68a-45ef-9eb8-4671c5bed878","year":2018},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.499488Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:89757be27a5591ca9029d00e58d20eaf98813ec84c2755f74a3b19de1ce23d2a","observation_id":"260d3569-4a70-4f89-a4e4-1849d1b19b18","resolution":{"observed_at":"2026-08-07T21:57:23.967451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.947917Z","title":"End-to-end dense video captioning with parallel decoding,","venue":null,"work_id":"8ee57ea5-d4a3-4460-bdac-01b9e6bbe271","year":2021},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.505187Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:f869dc070c99922c806c5f1b85e81b38451462c22a32d87dc089e8e9adfbcdaa","observation_id":"9fb02311-00a7-4e94-b0b5-eddf21228def","resolution":{"observed_at":"2026-08-07T21:57:23.952942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.933011Z","title":"Batchnorm-based weakly supervised video anomaly detection,","venue":null,"work_id":"22294a3e-a66e-4c8a-8b9a-6173e94f9f74","year":2024},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.510266Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:e218f5b95097183932ac8d5b2c4a55561773be1c2f73d359e16e6b8b1759320d","observation_id":"0208e327-6542-4ef8-a3f8-639f7a0b3570","resolution":{"observed_at":"2026-08-07T21:57:23.937711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.918065Z","title":"Negative sample matters: A renaissance of metric learning for temporal grounding,","venue":null,"work_id":"67601a16-3d8f-4c5e-86d7-e97496d2d0a2","year":2022},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.515602Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:cc24b02ce752b8cd34f49f6a8dfd26458121eff1b939141e7527be38a65bfc1f","observation_id":"e27c7e7d-dadf-42b1-a397-cd55746f579b","resolution":{"observed_at":"2026-08-07T21:57:23.922758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T21:57:23.520432Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.520432Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:257d815d82445073f1ee1a4f40dd7d5e62d4674adf9274a90032971c6661d27a","observation_id":"679274b7-5041-47db-bbad-dbe7f88f2517","resolution":{"observed_at":"2026-08-07T21:57:23.520432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T21:57:23.526197Z","title":"Llava- onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.526197Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:fe8de1b46c69a95c12b101304266e7016df5b4658f0398350d1f8a3364e486cc","observation_id":"58cde45a-7803-4029-8cba-4a3418c7745b","resolution":{"observed_at":"2026-08-07T21:57:23.526197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.901555Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":"e0583531-333d-4b3b-9399-458c4286fb8d","year":2024},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.531972Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:e742a6b94e383e78bae2f750d8d16cd70f8b6cf0a38f80ad9a17c8d7e08badec","observation_id":"841be4f3-bb80-498c-9357-4296f1561561","resolution":{"observed_at":"2026-08-07T21:57:23.907277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T21:57:23.536528Z","title":"Qwen2- vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.536528Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:1cfc8e9386c6f1d1484e5fd3d1c4542cf1afb56e0f6758a684e4252e9819ec75","observation_id":"b7b05c2c-a212-4279-ad41-ef48d3472378","resolution":{"observed_at":"2026-08-07T21:57:23.536528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.884893Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"e37639dc-4aba-43ba-863d-10354f300f77","year":2021},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.541353Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:a7451793cb306313359e9b5d92a3b7fc8cad56e67cb071321239db2e515ab190","observation_id":"23d7d4a6-a240-4ad5-96c4-b6711ee42ddc","resolution":{"observed_at":"2026-08-07T21:57:23.889826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T21:57:23.546071Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.546071Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:d24588372bdec0c19e4d491e7f090c7f06591742bc01ed72645110384e35d6fc","observation_id":"2a63086e-d396-48cb-8ed7-f0352f29fa7c","resolution":{"observed_at":"2026-08-07T21:57:23.546071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T21:57:23.551182Z","title":"Mmbench: Is your multi-modal model an all-around player?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.551182Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:44f923847723219b58093fe55494fc660c1d2ff765db4ce11c8a4ae8825c4f8f","observation_id":"150d137c-bdca-4a4b-b301-00436d5484cd","resolution":{"observed_at":"2026-08-07T21:57:23.551182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14515","last_updated":"2024-10-30T13:38:10Z","snapshot_observed_at":"2026-08-10T10:57:30.502675Z","submitted_at":"2024-06-20T17:26:01Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14515","snapshot_observed_at":"2026-08-07T21:57:23.556854Z","title":"Mmbench-video: A long-form multi- shot benchmark for holistic video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.556854Z"},"links":{"cited_paper":"/paper/2406.14515","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:6bcfd19184b4ea94dc02276c643b2cf8f56b9a35dcfe5e1eb6e019597b687973","observation_id":"ccd52aed-5402-4615-9018-e7e59f80c64b","resolution":{"observed_at":"2026-08-07T21:57:23.556854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.868696Z","title":"Mvbench: A comprehen- sive multi-modal video understanding benchmark,","venue":null,"work_id":"3d68018c-1bfd-4d67-aa7a-e03dcd4774a7","year":2024},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.561397Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:651c1078f9a30bd6c849cebff12f145790cb13d40e85ac5bf1824e0cb77bd957","observation_id":"2700f3e8-dc5e-4b0b-a31a-6eb540e83db8","resolution":{"observed_at":"2026-08-07T21:57:23.873404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T21:57:23.566060Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.566060Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:4353ffeda0974c635a2bfc369482df58ad1539f842cfcbfebe6b136eacd26a11","observation_id":"a56f90a3-807d-4a24-b421-f909a039c61a","resolution":{"observed_at":"2026-08-07T21:57:23.566060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.853217Z","title":"Taisu: A 166m large-scale high-quality dataset for chinese vision-language pre- training,","venue":null,"work_id":"a7066af2-38a4-45af-bdb5-1edbdbf846ac","year":2022},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.570422Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:6666d40db9df5765be363b6395b24f246b349143c9574672082b81e423f01ad8","observation_id":"eef0a864-8074-42b3-ad52-ace1fe4c0f51","resolution":{"observed_at":"2026-08-07T21:57:23.857864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.838046Z","title":"Not only look, but also listen: Learning multimodal violence detection under weak supervision,","venue":null,"work_id":"fb2ce7d8-6518-4b34-938b-28e3c6eb4610","year":2020},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.574833Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:6a59e601197fdcca6d099bc687d0d1f5946e844fb46edebaa8cfaa3e976e0b0b","observation_id":"61a203ac-3c54-4d1c-ba9f-c341e539c17d","resolution":{"observed_at":"2026-08-07T21:57:23.842682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.822918Z","title":"Towards surveillance video-and-language understanding: New dataset baselines and challenges,","venue":null,"work_id":"2ffeb88b-4b7a-42f6-8502-c57fec56b485","year":2024},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.578853Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:db8d6f00df71659ef6e3bd5c5c5bc6081abe67e6f19b5e5ef9cd6c79c4729471","observation_id":"bfddacc4-5271-4d89-b7a9-626a0f7db05c","resolution":{"observed_at":"2026-08-07T21:57:23.827753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T21:57:23.583300Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.583300Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:7b552ce2995d5942d03b957ca23afc971ac797a945bdc870e25042990e8d851c","observation_id":"6a22cef7-fb11-42e3-ac22-2787ee1981d0","resolution":{"observed_at":"2026-08-07T21:57:23.583300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.587747Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.587747Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:f18676728dd8559d9a4d8c1677ef612836a8a08d3e569aecaa00f4dd7412686b","observation_id":"baad31a9-9e0c-4e4d-89c1-04f6e3dfe3ca","resolution":{"observed_at":"2026-08-07T21:57:23.587747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.797460Z","title":"Learning spatiotemporal features with 3d convolu- tional networks,","venue":null,"work_id":"b36e29a4-852e-49fa-bdcb-142d5fb45bf6","year":2015},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.592363Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:1983edf26c0bd68244a8a266e129068c8a11d1619cbde3e21f5b685207ea80d7","observation_id":"863f404e-4d47-460d-99e7-f1cb722d6664","resolution":{"observed_at":"2026-08-07T21:57:23.802040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T21:57:23.596697Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.596697Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:c4a3a3e4f22ed531f4fa3f7a82aaa3a351c61629ea8b4f5eb4757fccaa3244cf","observation_id":"824f3a7a-d6e4-4750-85cd-ff501340ede9","resolution":{"observed_at":"2026-08-07T21:57:23.596697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.601536Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.601536Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:ee557a565db1cf442e91fa273ee40233f0177862aab7da3632f13dc926810396","observation_id":"f5c2967f-63a1-4b81-b0b2-66236210753d","resolution":{"observed_at":"2026-08-07T21:57:23.601536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:57:23.769527Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":"a261b753-ac7c-4ff8-a521-a85dc3db4d7e","year":2017},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.605752Z"},"links":{"citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:1ae38a507cb7b79b413839077ca7234916346942bd2424cd53bf9be9a7a52c5f","observation_id":"7d9ef54e-ff4f-4fda-b658-04a72035301b","resolution":{"observed_at":"2026-08-07T21:57:23.776354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2502.09325."}