{"as_of":"2026-08-20T18:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8b1d71d710ce57b2ebaa84b5bc3bcaa40b5d4a2704bb26859f44833acdd8905","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:03:27.673880Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:22:12.609121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T00:22:12.693223Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"cited_work":{"arxiv_id":"2507.09338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09338","snapshot_observed_at":"2026-08-06T00:22:12.693223Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","venue":"cs.CV","work_id":"1b569008-9b36-472c-932b-329e80892f22","year":2025},"citing_paper":{"arxiv_id":"2608.01336","last_updated":"2026-08-02T15:57:40Z","snapshot_observed_at":"2026-08-10T20:50:47.934009Z","submitted_at":"2026-08-02T15:57:40Z","title":"Asleep at the Wheel: JEPA's Limitations in Evaluating Novel Driving Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:22:12.609121Z"},"links":{"cited_paper":"/paper/2507.09338","citing_paper":"/paper/2608.01336"},"observation_digest":"sha256:e95fe5723c17bf96a2b1b26bf81e5eb5ad543fa3c71a7a24301e11f50c51c459","observation_id":"fd94202c-0eea-4329-adca-55590de9a3fe","resolution":{"observed_at":"2026-08-06T00:22:12.697368Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09338/citation-record","integrity":"/paper/2507.09338/integrity","json":"/paper/2507.09338/citation-record.json","paper":"/paper/2507.09338"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:23.695583Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:23.695583Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:7ca43a0580785c9c70182ce2b22a3d13251eead944f1cba602e3f9d8d9cc6b54","observation_id":"bccfd1b4-d00a-4dd3-90df-63d7d7e8f575","resolution":{"observed_at":"2026-08-06T18:03:23.695583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T18:03:23.758453Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:23.758453Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:a038acc5e5cfb5a6b3332301d2ece5286010d7b75b74193f3b4fff588315dd0a","observation_id":"661a675b-711e-4094-965c-e4b8b5fdbb04","resolution":{"observed_at":"2026-08-06T18:03:23.758453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-08-14T16:05:50.720818Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-06T18:03:23.826777Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:23.826777Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:72f7001567e9508325ab1e9a2c317c10fa048299b0223f3c27c55887b9995d47","observation_id":"429e1493-0895-424a-b005-bdf7916b3a91","resolution":{"observed_at":"2026-08-06T18:03:23.826777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:23.922395Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:23.922395Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:ae5b90c1cc1d6a20586876018051ad3ae0f3597a6611f81a0c992709a0932e4a","observation_id":"2e7deb86-c165-42f8-88af-805bb0751be9","resolution":{"observed_at":"2026-08-06T18:03:23.922395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:37.985070Z","title":"The matthews cor- relation coefficient (mcc) should replace the roc auc as the standard metric for assessing binary classification","venue":null,"work_id":"58593c58-2623-4875-a9fc-2cc6007945c6","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.001312Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:a68d453f579e3f19778bbbda493592ca9156f99c7c7d009826db6ffdc9e7963b","observation_id":"7457ec50-1f98-4c7e-875e-b0c52dc843a4","resolution":{"observed_at":"2026-08-06T18:03:38.115329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:37.581607Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"abc7e13c-831f-4750-9342-4e9ba7f99041","year":2018},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.058670Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:aff9b09935a42bff599334a64e52216d2d113a1980f3d4650fa3b2459a8d2087","observation_id":"bd222745-e546-4930-b44b-a7d767ebe9f8","resolution":{"observed_at":"2026-08-06T18:03:37.797049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:37.295670Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"493e8aa4-759e-4235-b282-6044a912427d","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.148227Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:6acdacff2e7d39cd54d14503071f80e309268dcc759910e103a8795cbd40ef6e","observation_id":"1900116b-642a-4200-a0eb-60167936f26f","resolution":{"observed_at":"2026-08-06T18:03:37.467482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:37.066469Z","title":"Cyclecrash: A dataset of bicycle collision videos for col- lision prediction and analysis","venue":null,"work_id":"6f7c4905-476b-4392-b17a-18ee53f4b38a","year":2025},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.219473Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:1624b6b739b07ab49831bf3fde0e2a2d74c2d34b62db70b026b50f427e15fd33","observation_id":"fc03bc65-cbbd-41d6-92ec-f98cbf47b301","resolution":{"observed_at":"2026-08-06T18:03:37.178219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:03:24.302249Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.302249Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:d1cc7948a893bd90f84501d18ece69c8ae7f487d98e0ae0247c8b8f8ddde55f9","observation_id":"5589556e-3e15-4d1e-86f4-83b5fdcf6c1b","resolution":{"observed_at":"2026-08-06T18:03:24.302249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:36.811759Z","title":"Dada: Driver attention prediction in driving accident scenarios","venue":null,"work_id":"8ad2727a-cb09-40f6-82ce-50b2d9b08e35","year":2021},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.363329Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:d3cbc2d2f498f25b29f73f824430b4600bdb5e93256abdf4918cef8d7295f578","observation_id":"c37ed47e-03c7-40f6-9694-56dc27d26a76","resolution":{"observed_at":"2026-08-06T18:03:36.947564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09381","last_updated":"2023-06-16T13:29:45Z","snapshot_observed_at":"2026-08-16T16:07:43.277473Z","submitted_at":"2022-12-19T11:43:02Z","title":"Cognitive Accident Prediction in Driving Scenes: A Multimodality Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09381","snapshot_observed_at":"2026-08-06T18:03:24.414615Z","title":"Cognitive accident prediction in driving scenes: A multimodality benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.414615Z"},"links":{"cited_paper":"/paper/2212.09381","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:1d83a2f22cfce41d54e9549ab17707cb73d640b39b28e68da63b054db50a6fc1","observation_id":"979825bd-5fa9-4a0c-a720-303606517295","resolution":{"observed_at":"2026-08-06T18:03:24.414615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:36.523179Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"056eb60c-b745-463d-b250-57e04992ecf3","year":2017},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.484634Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:a057a50570a7d7fea783a66301f26e44dfb093df2976f48845fa5eaac99b2e1b","observation_id":"79969226-8611-40b0-b3df-c3865b68edb4","resolution":{"observed_at":"2026-08-06T18:03:36.652719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:36.209122Z","title":"Don’t stop pretraining: Adapt language models to domains and tasks","venue":null,"work_id":"10382a5b-244b-4ab2-9b56-f1c716e1768e","year":2020},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.545206Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:e8c8fbb1f80b15eb0017dfa19af836698b5474948830061a0cc78dd00a7d8e70","observation_id":"1954d4c9-d9f8-4c02-a62c-f5c401497bfa","resolution":{"observed_at":"2026-08-06T18:03:36.371128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:24.614295Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.614295Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:6183f7d0b90b321305b6475d56da8c573ea6cab5b566069287e322f8c59d9e6c","observation_id":"c92d2201-95ff-4109-9d81-7f268d50507c","resolution":{"observed_at":"2026-08-06T18:03:24.614295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:35.888808Z","title":"Mgmae: Motion guided masking for video masked autoencoding","venue":null,"work_id":"6550b226-a872-45f9-a8fb-d6c22c10dc08","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.711115Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:f6629e63ab5c702f7e8c9f1edca55fbcfc54b2187e9809f71c4d7aa615215eb8","observation_id":"b04be85b-6610-4e35-9a7b-66c5bc967dcb","resolution":{"observed_at":"2026-08-06T18:03:36.087967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:35.483071Z","title":"An enhanced traffic in- cident detection using factor analysis and weighted random forest algorithm","venue":null,"work_id":"29a011d9-8899-4616-953a-d122cbd758e7","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.815333Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:0ec172949b11e6e4bf7583760f55cd43e0a370eff6b8fb2969350abbde4b1ec2","observation_id":"a7b84db8-76bb-4ca8-a398-0beb43d014f9","resolution":{"observed_at":"2026-08-06T18:03:35.683399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T18:03:24.884011Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.884011Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:2516a99a3f075cbf8612e81423c05c32d15cbe1623b2f48837e53e27124535f8","observation_id":"ec1bea89-c2af-4097-b900-1cb5571dfee6","resolution":{"observed_at":"2026-08-06T18:03:24.884011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17208","last_updated":"2024-10-08T10:09:14Z","snapshot_observed_at":"2026-08-16T13:15:26.339054Z","submitted_at":"2024-09-25T16:15:06Z","title":"First Place Solution to the ECCV 2024 BRAVO Challenge: Evaluating Robustness of Vision Foundation Models for Semantic Segmentation","version":2},"cited_work":{"arxiv_id":"2409.17208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.17208","snapshot_observed_at":"2026-08-06T18:03:27.980024Z","title":"First Place Solution to the ECCV 2024 BRAVO Challenge: Evaluating Robustness of Vision Foundation Models for Semantic Segmentation","venue":"cs.CV","work_id":"6847d1b8-f725-49fa-8a3f-5217e1278023","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:24.962854Z"},"links":{"cited_paper":"/paper/2409.17208","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:0aa6df7d862d06facacb06d015ef0e82ffed60092219cca1332cdac2c22c797d","observation_id":"6f28dcb5-205d-4f6b-b30f-faacef738c0c","resolution":{"observed_at":"2026-08-06T18:03:28.120920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:35.229797Z","title":"Your vit is secretly an image segmentation model","venue":null,"work_id":"219ffd12-0b9a-4e61-b413-7f9d11164912","year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.035772Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:7e9ee6d6407a2580553340eb1be5b2c0c6ba09f483477c2f3017e13179bb7792","observation_id":"6418d0b6-494c-4469-b9a3-fb6421601651","resolution":{"observed_at":"2026-08-06T18:03:35.369293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:35.011856Z","title":"Crash to not crash: Learn to identify dangerous vehicles using a simulator","venue":null,"work_id":"d82259d5-811e-42af-8136-2d10daa513ab","year":2019},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.116644Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:e5ac1e0cfd6ca43048cabc475d3066df4ece970665292a88b93b7d72e67d525c","observation_id":"b743e67b-1496-48ac-9007-c3c931033331","resolution":{"observed_at":"2026-08-06T18:03:35.099161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.870701Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"00f726f0-e622-48be-b873-a72d2c0cfdda","year":2011},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.200271Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:6fd774bfe020c5ad515484d978f4e2688ce316cb8279a494dbfde80bf958148c","observation_id":"d4425ac3-992c-4924-82b7-eb014653e47f","resolution":{"observed_at":"2026-08-06T18:03:34.926894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.617120Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"64c98acf-1941-467e-924c-b5965164b725","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.298323Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:8d5496cc2c46960ed30d5e819b4a7624551943cdb1235c85380451c7b80229f9","observation_id":"7ecba662-150e-4a07-9c25-d01856f2f78b","resolution":{"observed_at":"2026-08-06T18:03:34.768314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.441710Z","title":"Videomamba: State space model for efficient video understanding","venue":null,"work_id":"9cb3820d-67f8-4312-8ae4-504bf5fff925","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.382881Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:750746fe8a8c1281600f3ccf2b28543c00eb3afd5674b7404b530947e462678b","observation_id":"ec521009-6def-4ea2-ad91-266e97a6116a","resolution":{"observed_at":"2026-08-06T18:03:34.525129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.248616Z","title":"Text-driven traffic anomaly detection with temporal high- frequency modeling in driving videos","venue":null,"work_id":"0659079a-0b29-4d0c-8a64-e9ae566d66f0","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.439681Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:440e77a8e3aa4da6d15ff6d92895fd718fd05ddbc131d39b856337fdf9ef10a3","observation_id":"e4914e50-a79b-4dcb-aa4f-703b11535c58","resolution":{"observed_at":"2026-08-06T18:03:34.328413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:34.010056Z","title":"An interaction-scene collaborative representation framework for detecting traffic anomalies in driving videos","venue":null,"work_id":"3f74541c-3dfa-4131-9ac6-0fe533f19f48","year":2025},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.493215Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:7543c37980c60f6c76ac25ab672c8ba171f77e020f62eb7c35600253773a5815","observation_id":"00536d9e-1204-4106-9edb-beee98bad5d5","resolution":{"observed_at":"2026-08-06T18:03:34.150040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:33.738418Z","title":"Fu- ture frame prediction for anomaly detection–a new baseline","venue":null,"work_id":"c8b847a4-94b7-498f-8044-f6a034cea150","year":2018},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.588001Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:f7c8e40136f4317204b01cd6ec4306d074c63c5f5fa3eabfb84303c5d7a10afd","observation_id":"9ade1e04-7b83-4dbf-b256-ad66e368e7d4","resolution":{"observed_at":"2026-08-06T18:03:33.850887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:25.653452Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.653452Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:87c8cf4b10caba84b536435de5e307f64ec3d0cc3ec024bd626a4f91f179a3e0","observation_id":"60a3bbe4-f3e2-4ec9-a2ab-d55d56b174c9","resolution":{"observed_at":"2026-08-06T18:03:25.653452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:33.463815Z","title":"Video swin transformer","venue":null,"work_id":"3945e0cf-0b4c-49d8-b521-35cada92423d","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.730929Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:3675efaf880678f3c690f5471abeb41b34d10a5e793649d29992337560ac927a","observation_id":"436a92dd-7cb3-4b7a-a14e-ad67dd1b4bdc","resolution":{"observed_at":"2026-08-06T18:03:33.554293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:03:25.796075Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.796075Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:428e14ddad4d8411bab8bd888cf0b5b3053638d69e4807727cd23c380c02b64e","observation_id":"62af7b80-8dd7-4ac7-95df-ad4716df2534","resolution":{"observed_at":"2026-08-06T18:03:25.796075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:33.245932Z","title":"Remembering history with convolutional lstm for anomaly detection","venue":null,"work_id":"c9713501-de99-428c-b3a9-566a594beb06","year":2017},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.870824Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:73a93ce960f35104f9beb52958ee2eb7a76d58e00c534c4fbbf2e9dbe2ee0430","observation_id":"af920b0b-37ce-4017-a54a-269f41db3066","resolution":{"observed_at":"2026-08-06T18:03:33.352563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:33.023332Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":"0e64c78a-6bac-40e1-95dc-edba9295fcf5","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.937105Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:e74bb77a0d27e1de4aad962df5d74568b6575354689d505a6742a0506aceed7d","observation_id":"9b024d91-3053-4c89-8de9-7ab60b8df0fc","resolution":{"observed_at":"2026-08-06T18:03:33.128844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:32.759367Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"37cc4eed-931f-4c2c-9c06-f42cc61b7973","year":2019},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:25.987270Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:bf9020f6c88c55d562f9314ab984ba44d557833368a2b6ac3785e5a750ac562e","observation_id":"b2b82a26-77c2-41be-ae67-b5f30d874b66","resolution":{"observed_at":"2026-08-06T18:03:32.901464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:32.486566Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"7ee42913-cf24-454b-b88e-00ec6dd7cd8d","year":2020},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.023828Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:4ec6453a9d7004c7e39eb0ae2670eee9aba096bd00d3028ae0c2f78eb86fd4ca","observation_id":"61aa7cbe-36d8-423d-9765-0fcfdaf6c484","resolution":{"observed_at":"2026-08-06T18:03:32.593427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:26.140435Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.140435Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:b27582c50d627e9c45a19561b63c69afcac6911a143c02ed1507624cf5e3fcc8","observation_id":"d9ea70f7-53a9-4e44-bd17-56adc581b3d1","resolution":{"observed_at":"2026-08-06T18:03:26.140435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:32.286767Z","title":"Prompttad: Object-prompt enhanced traffic anomaly detection","venue":null,"work_id":"925171c3-0f6a-4abb-aef0-4ea5e40705ae","year":2025},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.221143Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:2787b9be5c391d7d5f30f0c1ac4cc1ccb4ff54ac92b8398b4d0a6a274f748d69","observation_id":"28b5ecdd-4a3e-4a73-8052-f96a13734986","resolution":{"observed_at":"2026-08-06T18:03:32.354480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:32.073287Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"565cccb5-b4dd-42f9-8f48-406426c2062d","year":2021},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.262981Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:3dab88536fc09777ad7c9ede356f3e1efb209a3237d7bbe27e239964b0fd7a73","observation_id":"2362e116-ac71-4d0a-a1e5-7ca7f5973c57","resolution":{"observed_at":"2026-08-06T18:03:32.188436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.893170Z","title":"Memory-augmented online video anomaly detection","venue":null,"work_id":"5af52af2-d720-4be0-a8b6-6e6f96cea1e7","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.319373Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:901f2169e079d55209b633bfd2613350ce029e62978cc25d4e574dab3e840ab3","observation_id":"f9f1ccad-ea79-46ff-b6b9-e964a9f62be4","resolution":{"observed_at":"2026-08-06T18:03:31.964505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.755384Z","title":"Sigma: Sinkhorn-guided masked video mod- eling","venue":null,"work_id":"540e8b31-5c43-424f-8fcc-443156e4b6e4","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.364967Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:ef2b68e8e491136eadcd666500b7944f8273ba1257b46c32ccbac3154a117b22","observation_id":"796d5331-2bcd-42ed-80fe-0baa65eefca0","resolution":{"observed_at":"2026-08-06T18:03:31.816901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.589975Z","title":"Learning to predict collision risk from sim- ulated video data","venue":null,"work_id":"4a1f919a-5681-4925-a353-b40b26475773","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.453909Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:7681f410d53ba6797a822ab93794c24c04af962536c6e7efb710eafd8e283960","observation_id":"17a4f3b1-f50e-493a-9203-a7ed4b305f88","resolution":{"observed_at":"2026-08-06T18:03:31.679589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T18:03:26.500006Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.500006Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:c50dd61e26de4cbeca2d7dca34ade0c87306ea0a8cfd18d5a11ac21c469a9fc1","observation_id":"8d19e9f5-c8cf-4d63-8148-c807d7629a6d","resolution":{"observed_at":"2026-08-06T18:03:26.500006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.394997Z","title":"Masked motion encoding for self-supervised video representation learning","venue":null,"work_id":"bea1a6fb-c2a5-45ce-9e56-9d9a163d8a9b","year":null},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.584413Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:bd5add306654c64e95cff0d134cb4c4cc1cde8e4bfcf9581b0bd4ce5f4803a71","observation_id":"ee92a948-9e5c-4cfa-920f-10b71e4a43ba","resolution":{"observed_at":"2026-08-06T18:03:31.473731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.224086Z","title":"Deep learning applied to road accident detection with transfer learning and synthetic im- ages","venue":null,"work_id":"19049f34-790f-45f0-bea3-d744014b681b","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.636581Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:94fe34c474c037d620a64861b25f0c7d58f3715694d702ae89e7e506d48c39ef","observation_id":"29625acc-aa02-45db-a3dd-c55f914eee67","resolution":{"observed_at":"2026-08-06T18:03:31.306431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:31.022566Z","title":"Smile: Infusing spatial and motion se- mantics in masked video learning","venue":null,"work_id":"57102933-4a86-47df-8d42-fd8875aa7a8b","year":2025},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.696826Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:11a701052aa66f204b56ded019c103f67bb6e299a60fb3d648e42b7be6edf005","observation_id":"45c85351-4f3b-489e-a18c-3b6906e1de56","resolution":{"observed_at":"2026-08-06T18:03:31.106432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.869459Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"71341fcd-9132-4e6c-a8f2-5064f26bac3e","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.764122Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:b1fb4db1d2d10aae4267d539e1db6bda393b42475fa700aa05bc3bb8a21a2fb1","observation_id":"4839ee61-c23f-4c65-9d5d-e170f9f049b1","resolution":{"observed_at":"2026-08-06T18:03:30.940404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.729016Z","title":"A closer look at spatiotemporal convolutions for action recognition","venue":null,"work_id":"30d01418-bd3f-4a1f-80a2-bb853421516a","year":2018},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.820510Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:f39fc3f542fc2da21050d767e445f60ebd47611720895318149ee2075540dde4","observation_id":"5d070693-5070-4602-8a43-dd64daa12313","resolution":{"observed_at":"2026-08-06T18:03:30.784533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:26.879535Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.879535Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:fb9d3ceebd3aec90f289570b5091272121e290efc72ec1336986c91fdf5a4738","observation_id":"36dce677-0167-447d-b858-471cb5bf498c","resolution":{"observed_at":"2026-08-06T18:03:26.879535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.553382Z","title":"The BRA VO Semantic Segmentation Challenge Results in UNCV2024","venue":null,"work_id":"7a46cf6d-c9cf-41a3-a9a0-916f829c62ca","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:26.928959Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:1249bc95a21f53397898f853718edcbc46eb5b5f84272c06eb653e37a3229bdb","observation_id":"d7b801be-0b65-45cb-9974-de2d9e7fcec3","resolution":{"observed_at":"2026-08-06T18:03:30.634075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.384633Z","title":"Rs2g: Data-driven scene-graph extraction and embedding for ro- bust autonomous perception and scenario understanding","venue":null,"work_id":"98c4b700-c2f3-4397-9168-ac621f6be70a","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.037581Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:c7e8d9a88a13d0273fc0b744912dedd192d901ee442a0bdba19d852abec2c190","observation_id":"376e21f5-01ce-4aad-9338-bbaf159503d5","resolution":{"observed_at":"2026-08-06T18:03:30.469803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.164102Z","title":"Abnormal event detection in videos using hy- brid spatio-temporal autoencoder","venue":null,"work_id":"e7d82c40-945f-473f-b055-fabc98f58a13","year":2018},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.090464Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:84724e54c3487f379a1fc7e5a7e57bd000f5b7f37632a2bd4e1ce61c2ccbe805","observation_id":"28b3be1b-0704-46d6-9758-bd0e09ca936d","resolution":{"observed_at":"2026-08-06T18:03:30.294941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:30.006663Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"ae6404ec-c09e-4765-bf5a-b721a2be0c03","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.147577Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:7b30cd220cf56926f4113bb3bf4a415fd7aac80269f00d68b2b95f78616549cb","observation_id":"cdf9b9ce-852c-411a-8005-06e59552d406","resolution":{"observed_at":"2026-08-06T18:03:30.076946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:29.829398Z","title":"Masked video distillation: Rethinking masked feature mod- eling for self-supervised video representation learning","venue":null,"work_id":"4f160bac-9743-4d50-854b-56e9a4bb93da","year":2023},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.208198Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:a35664f1b5c43457d2745fe3ee11ed2a17b77bbd1f7130366e972ce157463f8e","observation_id":"d4cfcded-5b7d-4c01-b59c-48d7ba0fe133","resolution":{"observed_at":"2026-08-06T18:03:29.905668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:29.563128Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"89536be7-bd6d-4afa-b573-aa1cd89025c6","year":2024},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.265943Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:a0a48f83b6148244e495b839b5bfb27a358fb43bcbb47961aa54748f4eff5322","observation_id":"d41e977d-7339-43fa-8678-b9771593a345","resolution":{"observed_at":"2026-08-06T18:03:29.741186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:29.394861Z","title":"Recurring the transformer for video action recognition","venue":null,"work_id":"a80aedb5-1d26-4fab-9821-77b6461d9cd7","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.322275Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:a5dcc63803ab1648219f0cabed087722a4ae2612d5f803dedc66ca47321af68a","observation_id":"e9e9ce6b-3316-4268-8d96-313129ca2f80","resolution":{"observed_at":"2026-08-06T18:03:29.475904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:29.192323Z","title":"Dota: unsupervised detec- tion of traffic anomaly in driving videos","venue":null,"work_id":"7bac4a6f-fbdb-423f-a153-fe1111a45e31","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.392733Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:6d5b95205ba947ca0505d8869f6587c59befcba0545f6364d08564cecff93c21","observation_id":"4afd28b7-5f1f-4362-b869-179e7b41ef5f","resolution":{"observed_at":"2026-08-06T18:03:29.306398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:28.985413Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitask learning","venue":null,"work_id":"756ad7cf-3932-403e-90bb-c726f32fa8f2","year":2020},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.488627Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:460c7eed5016d88b932497f99953690aba89f1b07c12d61131a70c27accfb968","observation_id":"3be299d7-da65-43e5-ab2d-7d7d3048955b","resolution":{"observed_at":"2026-08-06T18:03:29.105493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:28.788761Z","title":"Scaling vision transformers","venue":null,"work_id":"988cc775-e92f-4974-b54b-706f4561e84f","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.576856Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:ec5c30204c51bdbe5212ef5952901b3216368d001a262c840d7a57bcc44d16a0","observation_id":"18749a73-6617-4a64-855e-69118ab4983c","resolution":{"observed_at":"2026-08-06T18:03:28.866362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:03:28.461534Z","title":"Spatio-temporal feature encoding for traffic accident detection in vanet environment","venue":null,"work_id":"978be436-1b38-430f-92c8-90e2ed26738f","year":2022},"citing_paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:27.673880Z"},"links":{"citing_paper":"/paper/2507.09338"},"observation_digest":"sha256:61a340a9b1eb4b49c8738e7191544d9c5cc70b2ee54659ea9936d84b2aff8d3d","observation_id":"2f465c5b-39c0-4cc8-9faf-c9555870332f","resolution":{"observed_at":"2026-08-06T18:03:28.601040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09338","last_updated":"2025-09-01T09:43:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T22:12:49.934154Z","submitted_at":"2025-07-12T16:36:49Z","title":"Simplifying Traffic Anomaly Detection with Video Foundation Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2507.09338."}