{"as_of":"2026-08-19T21:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65b8a62e8264a2655c48ae28705dcf13684e09011d7328cf0a30f6e6e3b3dc7d","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:23:20.684103Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:12:23.019873Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T15:13:25.052578Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00526","snapshot_observed_at":"2026-08-08T21:12:23.019873Z","title":"Human action clips: Detecting ai- generated human motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05240","last_updated":"2025-02-12T14:43:02Z","snapshot_observed_at":"2026-08-19T16:33:48.605529Z","submitted_at":"2025-02-07T12:18:20Z","title":"Survey on AI-Generated Media Detection: From Non-MLLM to MLLM","version":2},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-08-08T21:12:23.019873Z"},"links":{"cited_paper":"/paper/2412.00526","citing_paper":"/paper/2502.05240"},"observation_digest":"sha256:538d3c968c112c19e02af3cd7a034885dafd3ef8c514e22a91e7e16d5bcfd3fb","observation_id":"d2dd6fc4-7569-4714-bdf3-b51737b727bd","resolution":{"observed_at":"2026-08-08T21:12:23.019873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"cited_work":{"arxiv_id":"2412.00526","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00526","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human action clips: Detecting ai-generated human motion","venue":null,"work_id":"214a1d5c-3b65-4ef5-92c6-d057b580e91c","year":2024},"citing_paper":{"arxiv_id":"2602.04939","last_updated":"2026-05-08T16:47:05Z","snapshot_observed_at":"2026-08-15T13:02:23.634924Z","submitted_at":"2026-02-04T16:47:37Z","title":"SynthForensics: Benchmarking and Evaluating People-Centric Synthetic Video Deepfakes","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T07:32:30.580643Z"},"links":{"cited_paper":"/paper/2412.00526","citing_paper":"/paper/2602.04939"},"observation_digest":"sha256:3e0ab6f45f101492e50874ba8c42303f3da0ed4fadd5e71893a176b3a5a3e89f","observation_id":"1fac0a74-999a-4860-9013-1b5e30fddcdd","resolution":{"observed_at":"2026-05-16T07:37:33.016331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"cited_work":{"arxiv_id":"2412.00526","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00526","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human action clips: Detecting ai-generated human motion","venue":null,"work_id":"214a1d5c-3b65-4ef5-92c6-d057b580e91c","year":2024},"citing_paper":{"arxiv_id":"2605.17133","last_updated":"2026-05-16T19:46:33Z","snapshot_observed_at":"2026-08-15T19:25:06.732340Z","submitted_at":"2026-05-16T19:46:33Z","title":"CAM-VFD: Cross-Attention Multimodal Video Forgery Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T15:08:25.309094Z"},"links":{"cited_paper":"/paper/2412.00526","citing_paper":"/paper/2605.17133"},"observation_digest":"sha256:77b1ea5b5aa2aee4eaab648f9a65438120687c57000392cfcbc48efda1f78108","observation_id":"23b91fb0-a20f-4881-a85c-ab2c1b4876da","resolution":{"observed_at":"2026-05-20T15:13:25.054227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00526/citation-record","integrity":"/paper/2412.00526/integrity","json":"/paper/2412.00526/citation-record.json","paper":"/paper/2412.00526"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03791","last_updated":"2025-01-25T01:18:23Z","snapshot_observed_at":"2026-08-18T23:21:32.162011Z","submitted_at":"2024-10-03T21:26:58Z","title":"People are poorly equipped to detect AI-powered voice clones","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03791","snapshot_observed_at":"2026-08-12T05:23:20.615674Z","title":"People are poorly equipped to detect AI-powered voice clones","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.615674Z"},"links":{"cited_paper":"/paper/2410.03791","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:1ea845692f5b9f078bf2993d49277da8bb2b6b42c52d5db55f05ff0af9a98be5","observation_id":"85c9dbce-8aa6-46ec-9002-eca253eaa487","resolution":{"observed_at":"2026-08-12T05:23:20.615674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T05:23:20.620799Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.620799Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:a093c1bd4cdc4119706464077dfa572229e32802e243ffa83c8eb14f571bfab3","observation_id":"9f07d460-e61c-4e4d-bdc7-9dcf7f770f24","resolution":{"observed_at":"2026-08-12T05:23:20.620799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07588","last_updated":"2024-09-08T16:20:11Z","snapshot_observed_at":"2026-08-16T17:49:14.798623Z","submitted_at":"2021-10-14T17:49:42Z","title":"Playing for 3D Human Recovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07588","snapshot_observed_at":"2026-08-12T05:23:20.625984Z","title":"Playing for 3D human recovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.625984Z"},"links":{"cited_paper":"/paper/2110.07588","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:e353d4c8400265244916e8979275f4418dda02004c3aeabdd2f05f5f9447ccaf","observation_id":"ed0b7a9b-2803-4c74-a8e5-10033bf0e925","resolution":{"observed_at":"2026-08-12T05:23:20.625984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-19T06:18:29.748887Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-12T05:23:20.631282Z","title":"PaLI: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.631282Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:c96705075030388995fb49ed46f33338fea0efb84db86efc736eb3669fbacf3b","observation_id":"fd524c48-284d-4e88-8b0d-6c44be0146b5","resolution":{"observed_at":"2026-08-12T05:23:20.631282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10113","last_updated":"2024-06-03T21:29:28Z","snapshot_observed_at":"2026-08-16T23:14:56.223861Z","submitted_at":"2024-01-18T16:35:37Z","title":"Exposing Lip-syncing Deepfakes from Mouth Inconsistencies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10113","snapshot_observed_at":"2026-08-12T05:23:20.636834Z","title":"Expos- ing lip-syncing deepfakes from mouth inconsistencies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.636834Z"},"links":{"cited_paper":"/paper/2401.10113","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:dfac090f77e9bb620f9fe2755fb45b99372a59ccbb027e61a14e7d953923439d","observation_id":"9cdfbb66-0a0b-4d1b-a09b-b090c93b4404","resolution":{"observed_at":"2026-08-12T05:23:20.636834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19553","last_updated":"2024-10-23T16:06:32Z","snapshot_observed_at":"2026-08-18T06:48:52.935957Z","submitted_at":"2024-07-28T18:20:08Z","title":"Exploring the Adversarial Robustness of CLIP for AI-generated Image Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19553","snapshot_observed_at":"2026-08-12T05:23:20.641475Z","title":"Exploring the adver- sarial robustness of CLIP for AI-generated image detec- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.641475Z"},"links":{"cited_paper":"/paper/2407.19553","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:393daa2a3e560b490bcf8a34302e572c5acf81dadebb163fdf9054c25cb43234","observation_id":"b1a2d967-7dcc-487f-a665-7a7c303f991f","resolution":{"observed_at":"2026-08-12T05:23:20.641475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-12T05:23:20.646151Z","title":"VideoPoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.646151Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:b3abbe6434b021ac88c78a49c1280ac04dda7a1d1d891f275d1676d41a7d02bc","observation_id":"6442f9c9-2048-40d6-9bda-349bc54598f1","resolution":{"observed_at":"2026-08-12T05:23:20.646151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12706","last_updated":"2024-03-19T13:08:54Z","snapshot_observed_at":"2026-08-16T14:08:24.768726Z","submitted_at":"2024-03-19T13:08:54Z","title":"AnimateDiff-Lightning: Cross-Model Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12706","snapshot_observed_at":"2026-08-12T05:23:20.655486Z","title":"AnimateDiff-Lightning: Cross-model diffusion distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.655486Z"},"links":{"cited_paper":"/paper/2403.12706","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:66121a99f60857da0f966663f63414a68e23cd5fe3710b6942a646ed5a4cbb03","observation_id":"71d4e8e1-5848-4744-aeb1-65df39c7d66b","resolution":{"observed_at":"2026-08-12T05:23:20.655486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08849","last_updated":"2024-12-10T15:35:31Z","snapshot_observed_at":"2026-08-19T12:31:21.871002Z","submitted_at":"2024-09-12T17:59:08Z","title":"DeCLIP: Decoding CLIP representations for deepfake localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08849","snapshot_observed_at":"2026-08-12T05:23:20.670086Z","title":"DeCLIP: Decoding CLIP representations for deepfake localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.670086Z"},"links":{"cited_paper":"/paper/2409.08849","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:c72c0d95c24075675805b947f369f2ba81f2432a99c42edfba71cdb76de28686","observation_id":"1f938311-0eef-4ee4-86e1-db65f2fa704b","resolution":{"observed_at":"2026-08-12T05:23:20.670086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07190","last_updated":"2022-03-14T15:29:27Z","snapshot_observed_at":"2026-08-19T03:50:45.013111Z","submitted_at":"2022-03-14T15:29:27Z","title":"CLIP Models are Few-shot Learners: Empirical Studies on VQA and Visual Entailment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07190","snapshot_observed_at":"2026-08-12T05:23:20.674694Z","title":"CLIP models are few-shot learners: Empirical studies on vqa and visual entailment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.674694Z"},"links":{"cited_paper":"/paper/2203.07190","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:ae393cd30ae6ccc6a881131ba0caa6d2c068d2a16c8f8d79227a3bd7de14d017","observation_id":"15b8295a-9ff7-47af-bd7f-be6e5e19c222","resolution":{"observed_at":"2026-08-12T05:23:20.674694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07472","last_updated":"2024-11-20T01:32:48Z","snapshot_observed_at":"2026-08-18T18:18:21.354883Z","submitted_at":"2024-06-11T17:19:26Z","title":"4Real: Towards Photorealistic 4D Scene Generation via Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07472","snapshot_observed_at":"2026-08-12T05:23:20.684103Z","title":"4Real: Towards photo- realistic 4D scene generation via video diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.684103Z"},"links":{"cited_paper":"/paper/2406.07472","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:4f074e34d7a3faa000220ea4350b366b6f802868000fb678c2904d07a66bb6b0","observation_id":"6e7baf02-b2af-48f4-8b46-e556881897fa","resolution":{"observed_at":"2026-08-12T05:23:20.684103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T05:23:20.679515Z","title":"CogVideoX: Text- to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.679515Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:e9598d2f35dfe0ab19ae714e3a4f256b20d5b1d3ce8eb7f347e7f684dbf70e3d","observation_id":"81aa69e6-e2e5-4fa3-baf2-59251b8623b2","resolution":{"observed_at":"2026-08-12T05:23:20.679515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-16T13:54:44.432320Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-12T05:23:20.604699Z","title":"Vidu: A highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.604699Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:3c5d897ac2f2645ff9888edb6961fc2ce20ca8a8cf2691e7c2e276022f87123b","observation_id":"2931710b-9f08-4443-9809-b6230cff4857","resolution":{"observed_at":"2026-08-12T05:23:20.604699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-12T05:23:20.660085Z","title":"LAION- 400M: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.660085Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:afe447be176abf456a74534805fa593ec020a1320dc8a6eb7509c5e090e1f607","observation_id":"0de5dad8-3326-4922-b73d-f82e5443a8b0","resolution":{"observed_at":"2026-08-12T05:23:20.660085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-18T14:41:48.442811Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-12T05:23:20.665056Z","title":"How much can CLIP benefit vision-and-language tasks? arXiv:2107.06383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.665056Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:141ea4fba57ab14f0498ac68d3aaa985707693aece27d83ee3662f562d2c48bb","observation_id":"d0fa75b4-7dfa-451b-bcfd-ee04f69247cc","resolution":{"observed_at":"2026-08-12T05:23:20.665056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-08-19T07:45:48.742232Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-12T05:23:20.650879Z","title":"Jina CLIP: Your CLIP model is also your text retriever","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.650879Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:71e88c8ea72bd5c345771a0060df945402907fb4c44bcb7cf802504c60f477c7","observation_id":"3997a9ce-1f6b-45bc-a7c4-e62e457061ee","resolution":{"observed_at":"2026-08-12T05:23:20.650879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-16T14:25:07.068786Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-12T05:23:20.610451Z","title":"Lu- miere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T05:23:20.610451Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2412.00526"},"observation_digest":"sha256:55a8bb70a67e2ec5f08a70df7b123a210432e0f4a32e838ce552c0f67c6bb9f2","observation_id":"993eeb03-e35c-4bb5-8cb1-4e4ccf310ffc","resolution":{"observed_at":"2026-08-12T05:23:20.610451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.00526","last_updated":"2025-06-22T18:13:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T19:10:28.060925Z","submitted_at":"2024-11-30T16:20:58Z","title":"Human Action CLIPs: Detecting AI-generated Human Motion"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 3 inbound Pith citation observations for arXiv:2412.00526."}