{"as_of":"2026-08-13T18:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e40ace35f94507e50a594fc2fce80548e079fedb3afbda218699eb271ba02660","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:01:41.590694Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10933/citation-record","integrity":"/paper/2608.10933/integrity","json":"/paper/2608.10933/citation-record.json","paper":"/paper/2608.10933"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.855742Z","title":"luma dream machine, 2024","venue":null,"work_id":"b059e7d6-95dd-4560-a07b-f3e318c93787","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.251423Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:d008b55c1d4f9b366f92bb9f4e1bc2c4daac92066dca9c2dedd2b96570a03c38","observation_id":"3621170c-3fdd-46e2-80f0-fc40c4eed616","resolution":{"observed_at":"2026-08-12T14:01:42.862468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.835051Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval, 2021","venue":null,"work_id":"972c7e1e-3510-46df-80f3-b485628048ad","year":2021},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.258136Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:2001bcf2fcfe5cc891db75aa547d89afb8cfde9dc29c8c81c591b7a7b10c57b8","observation_id":"ec10b06b-8c33-4795-9427-3d480ba6238c","resolution":{"observed_at":"2026-08-12T14:01:42.841263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T14:01:41.263970Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.263970Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:e57320268d55fbd190f296f60d12be91656019efae4e8fe9c3518b012f194edb","observation_id":"3b67e2fa-adaa-4280-968c-b8d964b66e78","resolution":{"observed_at":"2026-08-12T14:01:41.263970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09838","last_updated":"2021-04-05T11:19:28Z","snapshot_observed_at":"2026-08-12T22:54:15.655627Z","submitted_at":"2020-12-17T18:56:33Z","title":"Transformer Interpretability Beyond Attention Visualization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09838","snapshot_observed_at":"2026-08-12T14:01:41.272247Z","title":"Transformer inter- pretability beyond attention visualization.arXiv preprint, arXiv:2012.09838, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.272247Z"},"links":{"cited_paper":"/paper/2012.09838","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:6f0bd9a66f41d61c6efc9a0fd8347fd7986c68b4e01ae614b285b4d8c269471e","observation_id":"f00a8dc0-52d0-42c0-b2e2-9dc01d3ef0d5","resolution":{"observed_at":"2026-08-12T14:01:41.272247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.814589Z","title":"Transformer inter- pretability beyond attention visualization","venue":null,"work_id":"5d093bea-9ad5-4431-9130-b1ea00f4c599","year":2021},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.278872Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:4e27dc558b9f63a6b76e6a7aa4b0c990562d445969905ea6df65ba4f0b066b27","observation_id":"3207e168-661f-4923-8765-b9c2cd0cbc9d","resolution":{"observed_at":"2026-08-12T14:01:42.820844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.786609Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":"24c6aa71-906d-413b-83ac-0123373d7bbf","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.286281Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:f7c4bec166e1db336535fb1c104bba9b8700acd78b2a964bd722325b296b5e9f","observation_id":"dd18a8dc-8fa7-41f5-b1ef-592bd7b2418c","resolution":{"observed_at":"2026-08-12T14:01:42.793770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06878","last_updated":"2024-12-09T18:59:04Z","snapshot_observed_at":"2026-08-13T10:32:27.316360Z","submitted_at":"2024-12-09T18:59:04Z","title":"SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06878","snapshot_observed_at":"2026-08-12T14:01:41.294275Z","title":"Safewatch: An efficient safety-policy following video guardrail model with transparent explanations.arXiv preprint arXiv:2412.06878, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.294275Z"},"links":{"cited_paper":"/paper/2412.06878","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:ba9847c9d7519952becabcc5245abf911f2414c1c0cc4f14ccb24f3dc92e7841","observation_id":"1b194c8a-90e4-44d1-8fbb-0dd988a485f4","resolution":{"observed_at":"2026-08-12T14:01:41.294275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00523","last_updated":"2025-06-24T18:55:29Z","snapshot_observed_at":"2026-08-12T23:10:17.184579Z","submitted_at":"2024-08-01T12:54:46Z","title":"Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00523","snapshot_observed_at":"2026-08-12T14:01:41.299903Z","title":"Jailbreaking text-to-image models with llm- based agents.arXiv preprint arXiv:2408.00523, 1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.299903Z"},"links":{"cited_paper":"/paper/2408.00523","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:752065494dc9d69f3f7fd401557f12efbd7648f4abc056347e4b9900bd264861","observation_id":"6d9cfe28-841e-4496-95dc-fa4bf40d3c83","resolution":{"observed_at":"2026-08-12T14:01:41.299903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.770813Z","title":"Not what you’ve signed up for: Compromising real-world llm-integrated ap- plications with indirect prompt injection","venue":null,"work_id":"b04c18f8-c540-4444-a2e5-b06e5b4b4452","year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.307066Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:82365875ae2f3e729fb2474331e093c78f51ae4b21b7aebeaf9bfb0267def024","observation_id":"3fd487d9-3984-4e6c-ac3f-90d1a8f2657f","resolution":{"observed_at":"2026-08-12T14:01:42.776223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08567","last_updated":"2024-06-03T14:15:03Z","snapshot_observed_at":"2026-08-13T04:19:43.326759Z","submitted_at":"2024-02-13T16:06:17Z","title":"Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08567","snapshot_observed_at":"2026-08-12T14:01:41.313665Z","title":"Agent smith: A single image can jailbreak one million multimodal llm agents exponentially fast.arXiv preprint arXiv:2402.08567, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.313665Z"},"links":{"cited_paper":"/paper/2402.08567","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:c1ea681b6e72151d540c420bd8eacd7d47ee73ac8f7e3627420664ac95621fba","observation_id":"c215ba6d-439a-4854-91f7-b8745555ad68","resolution":{"observed_at":"2026-08-12T14:01:41.313665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08970","last_updated":"2024-10-29T05:23:53Z","snapshot_observed_at":"2026-08-12T22:25:16.584744Z","submitted_at":"2024-10-11T16:40:03Z","title":"NoVo: Norm Voting off Hallucinations with Attention Heads in Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.08970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08970","snapshot_observed_at":"2026-08-12T14:01:42.370995Z","title":"NoVo: Norm Voting off Hallucinations with Attention Heads in Large Language Models","venue":"cs.CL","work_id":"19ed3715-b1e3-4911-abf3-d370c2e9f61c","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.323593Z"},"links":{"cited_paper":"/paper/2410.08970","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:1c34ca1be7e2a1a58fe27e93a0dfd5011df0a49f6a19329d63d5411b654163fe","observation_id":"66a3a2b8-8ce7-42e6-a674-8a2e9f4cc013","resolution":{"observed_at":"2026-08-12T14:01:42.378552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-12T14:01:41.329399Z","title":"Baseline defenses for adversarial attacks against aligned language models.arXiv preprint arXiv:2309.00614,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.329399Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:fd3d1b0ddd768c7f31fa15c93e5c41abfa9294aec36258f5f9795ab16dd477d5","observation_id":"4c4bc3a6-4452-4519-b453-f790865937f6","resolution":{"observed_at":"2026-08-12T14:01:41.329399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11815","last_updated":"2025-01-22T03:17:01Z","snapshot_observed_at":"2026-08-13T15:03:06.254960Z","submitted_at":"2025-01-21T01:45:56Z","title":"CogMorph: Cognitive Morphing Attacks for Text-to-Image Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11815","snapshot_observed_at":"2026-08-12T14:01:41.335157Z","title":"Cogmorph: Cognitive morphing attacks for text-to-image models.arXiv preprint arXiv:2501.11815, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.335157Z"},"links":{"cited_paper":"/paper/2501.11815","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:05aabdb9b070b3ff4a3e514a94232400b604f7beb076a9c6a788cd41285ffc6a","observation_id":"8972b9cb-ce23-4fc2-97e7-a8a31332e2be","resolution":{"observed_at":"2026-08-12T14:01:41.335157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-12T14:01:41.341437Z","title":"Videopoet: A large language model for zero-shot video gen- eration.arXiv preprint arXiv:2312.14125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.341437Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:ebd05614c419ce48e22bc966d52bbd568effad493f74f43e3a019d18545a02d9","observation_id":"13b9dec2-e8b1-4543-a0d5-68eeb5a64972","resolution":{"observed_at":"2026-08-12T14:01:41.341437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-12T14:01:41.348391Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.348391Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:14ee72c9a92365de5e6e521533b22acc97e23fe4ddc6afac8f41621622bef002","observation_id":"43710e97-8d7a-4c1e-a991-9ea39212dba6","resolution":{"observed_at":"2026-08-12T14:01:41.348391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:41.354134Z","title":"Bridg- ing text and video generation: A survey.arXiv preprint arXiv:2510.04999, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.354134Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:13d9ee00dc4ee4ec883727847b8bcbd115ecb203949245c0295a8235b4ccc9f7","observation_id":"2d353691-0f5f-4120-91bc-cef5f852c683","resolution":{"observed_at":"2026-08-12T14:01:41.354134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14872","last_updated":"2024-02-27T13:49:22Z","snapshot_observed_at":"2026-08-13T04:13:38.316013Z","submitted_at":"2024-02-21T15:13:50Z","title":"Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14872","snapshot_observed_at":"2026-08-12T14:01:41.360266Z","title":"Semantic mirror jailbreak: Genetic algorithm based jailbreak prompts against open-source llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.360266Z"},"links":{"cited_paper":"/paper/2402.14872","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:eb39ce4c3bc61e73b21a6a468f2a5b8b40d8e655cd19eed702ae9389a20d2669","observation_id":"bd25bb91-9d8f-4890-b3c5-17aa88224f50","resolution":{"observed_at":"2026-08-12T14:01:41.360266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15182","last_updated":"2025-08-21T02:39:14Z","snapshot_observed_at":"2026-08-08T01:21:32.994965Z","submitted_at":"2025-08-21T02:39:14Z","title":"SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15182","snapshot_observed_at":"2026-08-12T14:01:41.366538Z","title":"Safellm: Unlearning harmful outputs from large language models against jailbreak attacks.arXiv preprint arXiv:2508.15182, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.366538Z"},"links":{"cited_paper":"/paper/2508.15182","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:f324cae2636f5dda3f29c0e771c1b0388b15fbdf7e9550dbdda30113a39aebc8","observation_id":"f784ee13-bc4b-41fc-a28e-37dd8c9be12e","resolution":{"observed_at":"2026-08-12T14:01:41.366538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.747344Z","title":"Exploring inconsistent knowledge distil- lation for object detection with data augmentation","venue":null,"work_id":"afff501a-81b5-47df-b3de-a29f99002e56","year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.371822Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:1324b914f61647412d94c8d126dc7f0b1d8f9b846a8df754595118ad96c31ce9","observation_id":"d734b093-3c1e-468d-b241-58ca493f5254","resolution":{"observed_at":"2026-08-12T14:01:42.753162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.729277Z","title":"A large-scale multiple- objective method for black-box attack against object detec- tion","venue":null,"work_id":"8abaccae-b07f-4c71-8c4c-7c1fcf68b491","year":2022},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.376752Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:89239681f810b6f40a891b00cbdd9a0ee4763f3457658b44ef470c4117a66f4d","observation_id":"acb65aa9-fd16-4785-9da7-5838883f6ecd","resolution":{"observed_at":"2026-08-12T14:01:42.734396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.710778Z","title":"Imitated detectors: Stealing knowl- edge of black-box object detectors","venue":null,"work_id":"0e539eea-82e7-4d13-9fb3-52a9e07403e2","year":2022},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.385652Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:c448cb702da2c3020e386b2c738156fe122a72893668154220e7f87b2a74cbf6","observation_id":"aa3512d5-d9fd-465e-a773-0bed35cd8693","resolution":{"observed_at":"2026-08-12T14:01:42.716384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.688525Z","title":"Badclip: Dual- embedding guided backdoor attack on multimodal con- trastive learning","venue":null,"work_id":"37842211-e5cb-4e9c-904a-c286b17aa395","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.392269Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:e92b3c6de7b98bdfa0dada61c37d1e7b1f4ee49aa0c33161fc8f0cba2b73a911","observation_id":"5997afa1-715b-4658-93ed-45fe0e387139","resolution":{"observed_at":"2026-08-12T14:01:42.694850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.667728Z","title":"Re- visiting backdoor attacks against large vision-language mod- els from domain shift","venue":null,"work_id":"558fbcfd-5960-45a5-a75f-61b5b43f0ee5","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.403136Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:fce2818fb0b0b2db1a192883b39fb7195877bce7135a6e585fa9eac05539ad46","observation_id":"03be24ac-c4ba-4923-95eb-0e8b77dbb5cb","resolution":{"observed_at":"2026-08-12T14:01:42.675758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15512","last_updated":"2025-04-26T16:17:55Z","snapshot_observed_at":"2026-08-07T16:00:24.594893Z","submitted_at":"2025-04-22T01:18:42Z","title":"T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15512","snapshot_observed_at":"2026-08-12T14:01:41.409683Z","title":"T2vshield: Model-agnostic jailbreak defense for text- to-video models.arXiv preprint arXiv:2504.15512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.409683Z"},"links":{"cited_paper":"/paper/2504.15512","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:db4b259df355ef3316b0921acd4d28cdcf9a705e3e6ffaa964d7b4f04ec2baf7","observation_id":"75b6184d-628f-4045-8014-aa06a4e4f31a","resolution":{"observed_at":"2026-08-12T14:01:41.409683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06679","last_updated":"2025-06-17T07:44:28Z","snapshot_observed_at":"2026-08-08T06:57:13.896585Z","submitted_at":"2025-05-10T16:04:52Z","title":"T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06679","snapshot_observed_at":"2026-08-12T14:01:41.416164Z","title":"T2v-optjail: Discrete prompt optimization for text-to-video jailbreak attacks.arXiv preprint arXiv:2505.06679, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.416164Z"},"links":{"cited_paper":"/paper/2505.06679","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:bf91fc2c8f9a6f1a09b8a5aae460e1b29190491b97696157d3836cb467911715","observation_id":"49c1450e-a640-44d9-a75a-f765678b4c7b","resolution":{"observed_at":"2026-08-12T14:01:41.416164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-12T14:01:41.421711Z","title":"Sora: A review on background, technology, 9 limitations, and opportunities of large vision models.arXiv preprint arXiv:2402.17177, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.421711Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:36370758e59b66f98d0c4fc9b003126c98cd135206919b144cb97416c60ad2d9","observation_id":"b37bf1e9-2c04-4f9a-bdb1-6d6a0da3e612","resolution":{"observed_at":"2026-08-12T14:01:41.421711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.644985Z","title":"T2vsafetybench: Evaluating the safety of text-to-video generative models.Advances in Neural In- formation Processing Systems, 37:63858–63872, 2024","venue":null,"work_id":"d212c4c0-5db7-4b7a-a204-e8cfe0d0e4eb","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.427081Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:073d156d89b74ebd75e8448dc3fc945247f92717f73db86269ba9d05c6695c11","observation_id":"3430bbff-3f71-4fc1-9474-13c77bfbd341","resolution":{"observed_at":"2026-08-12T14:01:42.651236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-12T14:01:41.432312Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation.arXiv preprint arXiv:2407.02371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.432312Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:3840bd0bebe6e400370de1af5053d6224c7cd3bb4cfde2d4a78cfafd6f95be90","observation_id":"9cbb6cf0-a596-4ec5-808f-38138c7904fb","resolution":{"observed_at":"2026-08-12T14:01:41.432312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.628739Z","title":"T2veval: Benchmark dataset and objective evaluation method for t2v-generated videos.Displays, page 103178,","venue":null,"work_id":"b74dd5de-0b83-4bee-bb95-d5e89f2f731c","year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.439770Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:0b8131660620944cfec9dfc10dfb8f382c8346bab65d1dc6eebbe39313ecbf05","observation_id":"c6ebe9aa-8a0d-474c-b5f6-506e679252c8","resolution":{"observed_at":"2026-08-12T14:01:42.634346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-12T14:01:41.446099Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.446099Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:d503b37b9f9bac1e8a98154d7e70c279f1dc99962f092e5cd1acdeb729ec9673","observation_id":"9085880b-0bed-4c4d-871b-ad881d48e851","resolution":{"observed_at":"2026-08-12T14:01:41.446099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.614403Z","title":"Kling-omni technical report, 2025","venue":null,"work_id":"c61b5513-22da-4144-98ad-f14184fced3f","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.451995Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:f19e33229b900f69bf78765a1762c2365a408f008b74baa0fe9e393f704ee8f3","observation_id":"91185768-7cf0-4da1-a1a5-4580ab734650","resolution":{"observed_at":"2026-08-12T14:01:42.618604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.596951Z","title":"Videotetris: Towards compositional text-to-video generation.Advances in Neural Information Processing Sys- tems, 37:29489–29513, 2024","venue":null,"work_id":"26a5f127-f211-4110-b26a-e2a65675a250","year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.457213Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:dcc242de7e8d282379d93ecdb2be86506a48b73f7a646e2bda8875bfa6f20f1d","observation_id":"787ac11e-2afb-4b10-959c-eebed3a757ad","resolution":{"observed_at":"2026-08-12T14:01:42.602757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14348","last_updated":"2025-07-27T10:12:52Z","snapshot_observed_at":"2026-08-07T21:52:02.659469Z","submitted_at":"2025-04-19T16:28:03Z","title":"Manipulating Multimodal Agents via Cross-Modal Prompt Injection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14348","snapshot_observed_at":"2026-08-12T14:01:41.462806Z","title":"Manipulating multimodal agents via cross-modal prompt injection.arXiv preprint arXiv:2504.14348, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.462806Z"},"links":{"cited_paper":"/paper/2504.14348","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:c7bf537c5cf6380316d27780995e3abb8a4e5c3eb48dc48334736926c9ddf437","observation_id":"aa6d094c-6ecd-415f-a8a3-05a3584c3702","resolution":{"observed_at":"2026-08-12T14:01:41.462806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.578146Z","title":"Jail- broken: How does llm safety training fail?Advances in neu- ral information processing systems, 36:80079–80110, 2023","venue":null,"work_id":"9691e8d1-cbdb-4410-9c71-0163e8042d5c","year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.470170Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:911f3b16d6b95077de554c13268062853078f0178229f7e978f929e8ab5b65c5","observation_id":"7f40b8f3-844b-41c1-9968-e5b0f8480707","resolution":{"observed_at":"2026-08-12T14:01:42.583597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.555338Z","title":"Defensive prompt patch: A robust and generalizable defense of large language models against jailbreak attacks","venue":null,"work_id":"ad91f73f-dfde-4766-84ee-8afb03a04a1a","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.484064Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:054570c0e95fd20c7bb980b43c80ff5c9d7a872169791c7ec16562c641348cab","observation_id":"fc4eeec0-dd76-452b-abce-c1d7f2013989","resolution":{"observed_at":"2026-08-12T14:01:42.560545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.535984Z","title":"Video- eraser: Concept erasure in text-to-video diffusion models","venue":null,"work_id":"95a2cd59-4b02-44e3-80b4-75738e8293ba","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.490263Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:63433a05b39e8bb1a299ab66bab7507d030b80260f34e131ad6394b11ea11b94","observation_id":"532d45e4-ee0e-4995-a0ca-a53616ba061a","resolution":{"observed_at":"2026-08-12T14:01:42.541646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T14:01:41.500641Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.500641Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:c2b2e9641f335617196c01dba21f0c520f6e8a05546047d4774bfe68bcda2565","observation_id":"6b4a4a8d-21e5-42fe-a6fa-0d08d8f668dd","resolution":{"observed_at":"2026-08-12T14:01:41.500641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-12T17:45:10.384900Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-12T14:01:41.509428Z","title":"Jailbreak attacks and defenses against large language models: A survey.arXiv preprint arXiv:2407.04295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.509428Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:3c743bf1ee692920d283dd67999ff970474b7b7f98cdb843ab7572757b4e6f55","observation_id":"81a610f3-d5d9-4ea5-a11e-e2d4588ba948","resolution":{"observed_at":"2026-08-12T14:01:41.509428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04031","last_updated":"2024-07-01T14:25:23Z","snapshot_observed_at":"2026-08-12T23:48:48.833189Z","submitted_at":"2024-06-06T13:00:42Z","title":"Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04031","snapshot_observed_at":"2026-08-12T14:01:41.516193Z","title":"Jailbreak vision language models via bi-modal adversarial prompt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.516193Z"},"links":{"cited_paper":"/paper/2406.04031","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:bd9bcd8cd3d38bc8fda631607896f4f9d22b7e30b53aa6b627081bd78223e10f","observation_id":"62a1afb1-8ef7-4f5d-9bd2-81bbc9236c81","resolution":{"observed_at":"2026-08-12T14:01:41.516193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12430","last_updated":"2025-07-11T02:01:54Z","snapshot_observed_at":"2026-08-09T20:22:46.693664Z","submitted_at":"2025-06-14T10:03:17Z","title":"Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12430","snapshot_observed_at":"2026-08-12T14:01:41.521564Z","title":"Pushing the limits of safety: A tech- nical report on the atlas challenge 2025.arXiv preprint arXiv:2506.12430, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.521564Z"},"links":{"cited_paper":"/paper/2506.12430","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:374393e379411acd63be050e89683bc24d18ceda3e6971fbb060ec16eb4f5b9b","observation_id":"f9a84e0f-5891-4928-8125-6b618b3d553f","resolution":{"observed_at":"2026-08-12T14:01:41.521564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11054","last_updated":"2025-03-11T03:06:17Z","snapshot_observed_at":"2026-08-11T01:06:25.294944Z","submitted_at":"2025-02-16T09:27:44Z","title":"Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11054","snapshot_observed_at":"2026-08-12T14:01:41.527677Z","title":"Reasoning- augmented conversation for multi-turn jailbreak attacks on large language models.arXiv preprint arXiv:2502.11054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.527677Z"},"links":{"cited_paper":"/paper/2502.11054","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:98ab17ab384535a7cfeb9e2f8ed826e86060e903d0008e711f1a45418c25957f","observation_id":"dd8eaec9-7540-4b66-b0ff-cf4653a68eb6","resolution":{"observed_at":"2026-08-12T14:01:41.527677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12761","last_updated":"2025-03-14T04:47:39Z","snapshot_observed_at":"2026-08-12T22:21:40.084656Z","submitted_at":"2024-10-16T17:32:23Z","title":"SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12761","snapshot_observed_at":"2026-08-12T14:01:41.533067Z","title":"Safree: Training-free and adaptive guard for safe text-to-image and video generation.arXiv preprint arXiv:2410.12761, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.533067Z"},"links":{"cited_paper":"/paper/2410.12761","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:e461c3c83d5c77251f532432278f9828e54f39ab9ea678343f38fdd916acf791","observation_id":"d33333d5-1b61-4c26-b77e-7a84afc3ae10","resolution":{"observed_at":"2026-08-12T14:01:41.533067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.516733Z","title":"Safree: Training-free and adaptive guard for safe text-to-image and video generation","venue":null,"work_id":"9b06c47a-931f-4ccc-923e-91c0d39ffa96","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.539171Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:888ab3426ab810ba0d4598d7960fabe8f14cf545ff8b4ec6796690984584cad7","observation_id":"2ab41e49-4e0a-42f6-bcc1-bdcd5fa9660a","resolution":{"observed_at":"2026-08-12T14:01:42.522597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-12T14:01:41.549719Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.549719Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:05b7df8a8422dc66ec3650ed3a752e3b8c750d1435f5f294e2ba401301e9f608","observation_id":"c100e2ec-4c37-49f1-bdfa-be661290bb15","resolution":{"observed_at":"2026-08-12T14:01:41.549719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20242","last_updated":"2026-06-09T05:19:18Z","snapshot_observed_at":"2026-08-13T04:16:56.340592Z","submitted_at":"2024-07-16T13:13:16Z","title":"BadRobot: Jailbreaking Embodied LLM Agents in the Physical World","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20242","snapshot_observed_at":"2026-08-12T14:01:41.556081Z","title":"Badrobot: Jailbreaking llm-based embodied ai in the physical world.arXiv preprint arXiv:2407.20242, 3:1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.556081Z"},"links":{"cited_paper":"/paper/2407.20242","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:11286b0db8b4cbdb810b7eae84a7c5e98a3f32c33ae6f5deb6565fc3bae94600","observation_id":"19624e28-881f-42bb-964d-0cfc1773be5d","resolution":{"observed_at":"2026-08-12T14:01:41.556081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:42.495446Z","title":"Jbshield: Defending large lan- guage models from jailbreak attacks through activated con- cept analysis and manipulation","venue":null,"work_id":"b0a5c2e5-58e8-47aa-b465-e5a493fc0b30","year":2025},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.562372Z"},"links":{"citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:cc535a1102256fb872469ed6edcbb281934ed85e87b2a5bcaa7f7f2e8e55cc76","observation_id":"4e47367e-6738-42a7-9a3e-be9d00ec226c","resolution":{"observed_at":"2026-08-12T14:01:42.503946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08924","last_updated":"2024-08-22T17:21:34Z","snapshot_observed_at":"2026-08-12T23:03:06.239063Z","submitted_at":"2024-08-15T14:51:32Z","title":"Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08924","snapshot_observed_at":"2026-08-12T14:01:41.567414Z","title":"Prefix guidance: A steering wheel for large language models to defend against jailbreak attacks.arXiv preprint arXiv:2408.08924, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.567414Z"},"links":{"cited_paper":"/paper/2408.08924","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:e130cc18db5979df1c6d1f7437756088cbbff9b6176a71b358c54b4513f2a107","observation_id":"9f387c79-6dd8-4fdd-9df1-3c138f0b56fd","resolution":{"observed_at":"2026-08-12T14:01:41.567414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-12T14:01:41.585415Z","title":"Open-sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.585415Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:b7737726427cecb837ce0f7de8168f576a571a1521a45acd9182f28e0056df62","observation_id":"1fa8f2b4-2334-4a8e-bc4d-9c924c6f477b","resolution":{"observed_at":"2026-08-12T14:01:41.585415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-12T14:01:41.590694Z","title":"Universal and transferable ad- versarial attacks on aligned language models.arXiv preprint arXiv:2307.15043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:41.590694Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2608.10933"},"observation_digest":"sha256:c777ec90dea9aca89d68f7d3d4d70f25e5d81846e501ce500eb038b17b62eed3","observation_id":"827e0253-8a58-4128-9d07-a5c44328da0a","resolution":{"observed_at":"2026-08-12T14:01:41.590694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10933","last_updated":"2026-08-11T14:01:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T17:30:28.754877Z","submitted_at":"2026-08-11T14:01:24Z","title":"SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2608.10933."}