{"as_of":"2026-08-09T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2605573ff12f0f69076e63646ecfb4128a6e33cdce0e69470aef91fe51fd1e4c","coverage":[{"denominator":120,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T20:07:51.766473Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16742/citation-record","integrity":"/paper/2607.16742/integrity","json":"/paper/2607.16742/citation-record.json","paper":"/paper/2607.16742"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-01T20:07:40.102398Z","title":"Hunyuanvideo: A systematic framework for large video generative models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:40.102398Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:4012267d14a61ad1371bc2d249464ffcf514adda0c4be01e61a7585357f765a5","observation_id":"6913f94e-cc42-4c57-9f9a-ebd6f2342038","resolution":{"observed_at":"2026-08-01T20:07:40.102398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T20:07:40.313917Z","title":"Wan: Open and advanced large-scale video generative models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:40.313917Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:5e626cc2075a955fed1314e217eb2f68796dbc1ea3b778f42b10e5b7b02b93ab","observation_id":"db2d7b52-7204-43d4-b73b-c2257b3d159c","resolution":{"observed_at":"2026-08-01T20:07:40.313917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-01T20:07:40.424676Z","title":"Magi-1: Autoregressive video generation at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:40.424676Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:d625f3ff54ff90454c6eeab8e042b03a2551ebc8ec70f8360c825097497f00e0","observation_id":"da9cd4ea-0a95-4435-8e99-d7e00284a9be","resolution":{"observed_at":"2026-08-01T20:07:40.424676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:40.564745Z","title":"Team, “Sora,” https://openai.com/sora/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:40.564745Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:994b899557c3855b950d2497397b0b6ac7a65c7ce295efdbda23e93715e62c3b","observation_id":"eff9db93-98d0-4cf5-ad12-adf927d58038","resolution":{"observed_at":"2026-08-01T20:07:40.564745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:40.697180Z","title":"Pixverse,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:40.697180Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:6f64fd5981189da8c60b783a268862502a84e14afd7258a025eda5e8762f49a0","observation_id":"7db36a13-01ce-46ef-acbb-8c44d04cea73","resolution":{"observed_at":"2026-08-01T20:07:40.697180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:40.840388Z","title":"I, II, III-B, VI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:40.840388Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:98b89215a8aa03fe8825ab4c252ac19f34ee6a28b2387b76f1521d54f49367c5","observation_id":"121d0b56-b8a8-4ac3-ab94-1637289e9c3c","resolution":{"observed_at":"2026-08-01T20:07:40.840388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:41.003233Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:41.003233Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:5131a950695d4bb73fd923f670617acd096e95dcba10f5d1015a9f375d1f6085","observation_id":"124a0845-e9f6-4277-bbb2-12600de34933","resolution":{"observed_at":"2026-08-01T20:07:41.003233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-07T11:56:57.969083Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15111","snapshot_observed_at":"2026-08-01T20:07:41.111549Z","title":"Humanomni: A large vision-speech language model for human-centric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:41.111549Z"},"links":{"cited_paper":"/paper/2501.15111","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:7e5541cda7a990d5fcdbc403751e1f04d1677181f231350afe5582ff2237bdf5","observation_id":"d47f81cc-cea3-4ad9-a62b-73d38c8f2d38","resolution":{"observed_at":"2026-08-01T20:07:41.111549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:41.237671Z","title":"Singinghead: A large-scale 4d dataset for singing head animation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:41.237671Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:93018c9024b108042f4a994bedf8c906631e02cb0f3ce2293134b07cf9fed99e","observation_id":"b9fa9b14-3f7e-4ff9-8826-25469eb0266d","resolution":{"observed_at":"2026-08-01T20:07:41.237671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:41.395291Z","title":"Human-activity agv quality assessment: A benchmark dataset and an objective evaluation metric,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:41.395291Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:22b45300676d46d196884acd30014e07158c8f0a7116a21b950671bc2cc836e2","observation_id":"2d7fea19-71f1-42ed-83bb-051cbfed79c1","resolution":{"observed_at":"2026-08-01T20:07:41.395291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:41.538488Z","title":"Hveval: Towards unified evaluation of human-centric video generation and understand- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:41.538488Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:f37a5bb615c1facbf34fad93854cd0ee36934b7ee5d49256e456fe2814e60287","observation_id":"c5e1c6af-0bc9-4eeb-a378-fb8074604df7","resolution":{"observed_at":"2026-08-01T20:07:41.538488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14205","last_updated":"2024-11-21T15:13:38Z","snapshot_observed_at":"2026-08-07T18:20:42.799278Z","submitted_at":"2024-11-21T15:13:38Z","title":"Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-body","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14205","snapshot_observed_at":"2026-08-01T20:07:41.668754Z","title":"Is this generated person existed in real-world? fine-grained detecting and calibrating abnormal human-body,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:41.668754Z"},"links":{"cited_paper":"/paper/2411.14205","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:e77c17f96ece8008e7f4b778d3079c1fd30d61100df5e8070fadafc03b1033e0","observation_id":"7b045d5c-ee11-49a1-949c-a027abf37e0e","resolution":{"observed_at":"2026-08-01T20:07:41.668754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:41.777630Z","title":"Improved techniques for training gans,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:41.777630Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:54e8eef6d71c290a1c14b26ce7cb7575f240d69f1923b42a5762d119f6ece95b","observation_id":"05fe4fb3-ca6a-4971-bb00-48004fc0d777","resolution":{"observed_at":"2026-08-01T20:07:41.777630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:41.890323Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:41.890323Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b3ee97e567e559d12e73f65d5ca439378e391be3f0ef3103fff59b6df877313b","observation_id":"4b6e176b-a41c-4d4e-ac7d-c8bed74dab28","resolution":{"observed_at":"2026-08-01T20:07:41.890323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-01T20:07:42.038084Z","title":"Towards accurate generative models of video: A new metric & challenges,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:42.038084Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:d3526008ba7ad7f92e8485fc141538a0db724d66009846de7c06089863665b17","observation_id":"c7fbea01-07a6-4062-ad2a-2fa40565143c","resolution":{"observed_at":"2026-08-01T20:07:42.038084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:42.195020Z","title":"Vbench: Comprehensive benchmark suite for video generative models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:42.195020Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:93b3c8943eacaa416f7f8fbb6319c03226b9c979430c9cce8c67a0200d5585ea","observation_id":"67353350-c58d-4e35-8c78-9b5f0e3d2dc3","resolution":{"observed_at":"2026-08-01T20:07:42.195020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-01T20:07:42.360182Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:42.360182Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:dd81543288fd00151a23cf686c94987da838c25f36e3bd583d9f5dd7ed3c9ec4","observation_id":"49755b21-b2a4-403e-940a-a0a36eda2e28","resolution":{"observed_at":"2026-08-01T20:07:42.360182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-07T21:50:52.094296Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-01T20:07:42.500888Z","title":"T2v- compbench: A comprehensive benchmark for compositional text-to- video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:42.500888Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b63f34885462e798326a1c5edffbbf8f0683d6a90ef6e73b3b2399247705c7c7","observation_id":"2a76ccff-3e84-469b-ac40-77cb35f8d457","resolution":{"observed_at":"2026-08-01T20:07:42.500888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:42.635745Z","title":"Subjective-aligned dataset and metric for text-to-video quality assessment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:42.635745Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:78f7638018f76f39b786e079e24e8af4779dd4fc69d8437caaf85ad3163a5d65","observation_id":"c69b63ca-d484-4655-b8f6-989930d81051","resolution":{"observed_at":"2026-08-01T20:07:42.635745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21408","last_updated":"2024-12-26T03:21:00Z","snapshot_observed_at":"2026-07-06T18:54:54.118506Z","submitted_at":"2024-07-31T07:54:26Z","title":"Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21408","snapshot_observed_at":"2026-08-01T20:07:42.771208Z","title":"Benchmarking aigc video quality assessment: A dataset and unified model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:42.771208Z"},"links":{"cited_paper":"/paper/2407.21408","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:3a17a080d4ab90435e34f0c62fb55a70a424d378d8b0af4c21369e10cd9a7e2c","observation_id":"c46b2bba-f5ae-4eb7-bf41-b43d8f6aff0e","resolution":{"observed_at":"2026-08-01T20:07:42.771208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:42.946362Z","title":"Aigv-assessor: benchmarking and evaluating the perceptual quality of text-to-video generation with lmm,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:42.946362Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:ad8ab8c07d4811f36756df8ddf548c39440456022566ed35171aa5723017a2f8","observation_id":"d635b28d-20fd-4bb8-97ad-b90732fa605f","resolution":{"observed_at":"2026-08-01T20:07:42.946362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:43.058253Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.058253Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:0f181f5afa842318fb34555b87444cbc52b43de640341cbbe71e38b125375777","observation_id":"d4416fad-852e-40fc-b175-4c586efe37da","resolution":{"observed_at":"2026-08-01T20:07:43.058253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:43.193018Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to- video generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.193018Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:0862ff6ef31673a708615e9a27b45a72e80881685954a813e72e1d66552ca917","observation_id":"80e0f8db-78f2-4e1c-afec-c1be2f766408","resolution":{"observed_at":"2026-08-01T20:07:43.193018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:43.338652Z","title":"Evaluating and improving compositional text-to-visual generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.338652Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:4896c4ba7dbfd6803ede0f0fcad8ffa810da9137d2583882cfdc6c7594d0746f","observation_id":"e29d969f-7e50-4c15-867b-3fcb57aee99b","resolution":{"observed_at":"2026-08-01T20:07:43.338652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:43.478209Z","title":"F-bench: Rethinking human preference evaluation metrics for benchmarking face generation, customization, and restoration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.478209Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:8b689379643c68503f8784f6815c6e86b95a665530597ab58ea5109e77ee7b09","observation_id":"a34fc10b-835d-43a7-8461-aaabaf1773ab","resolution":{"observed_at":"2026-08-01T20:07:43.478209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:43.536828Z","title":"Multi- dimensional text-to-face image quality assessment using llm: Database and method,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.536828Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b519a356c54f6858c5493e9981166a97d330930f06b35af890468745b07d95da","observation_id":"6fd5be7f-55bd-4d85-a880-1192da18e7c9","resolution":{"observed_at":"2026-08-01T20:07:43.536828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:43.615642Z","title":"Aghi-qa: A subjective-aligned dataset and metric for ai- generated human images,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.615642Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:8394ff2f6a2ee20c3d5569a625660df25afdf2c0bee41fad9d2ab316f4edf815","observation_id":"d4c9ef6c-175f-4292-aab7-8cf6ae755bc2","resolution":{"observed_at":"2026-08-01T20:07:43.615642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-07T22:08:49.929764Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-01T20:07:43.669494Z","title":"Dreambench++: A human- aligned benchmark for personalized image generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.669494Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:16b96751f57c87a3a784e81236a8c482539ff205172a1da221c048932d13cdd7","observation_id":"410ad504-2ca2-450a-badf-f170fdf88de5","resolution":{"observed_at":"2026-08-01T20:07:43.669494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:43.733967Z","title":"Chatgpt-4o,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.733967Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:6f83d068bd2d287f5cc21c331d512b267a3f24af7fd272029ab1289f574c4f77","observation_id":"89909fa7-d27b-4efd-8e9d-c15c492f1342","resolution":{"observed_at":"2026-08-01T20:07:43.733967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12706","last_updated":"2024-03-19T13:08:54Z","snapshot_observed_at":"2026-07-06T17:46:58.758589Z","submitted_at":"2024-03-19T13:08:54Z","title":"AnimateDiff-Lightning: Cross-Model Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12706","snapshot_observed_at":"2026-08-01T20:07:43.786453Z","title":"Animatediff-lightning: Cross-model diffusion distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.786453Z"},"links":{"cited_paper":"/paper/2403.12706","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:a4eeaa22f320b077476b8734a7797b98f0aa0bf52ea84c3e19bafa41f964dcdc","observation_id":"ac266fc1-5846-4747-9c9d-b757e6d53171","resolution":{"observed_at":"2026-08-01T20:07:43.786453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:43.825847Z","title":"Animatelcm: Computation-efficient personalized style video generation without personalized video data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.825847Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:f52de6d14eb10559f8072f12166afa51e7a08272ce2f8dbc069fa89d7bcff26a","observation_id":"33668e07-dc6a-4f66-8cb2-187688634869","resolution":{"observed_at":"2026-08-01T20:07:43.825847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:43.870566Z","title":"Magictime: Time-lapse video generation models as metamorphic simulators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.870566Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b8254bdd1843bee818cd93803b3523e7d0a782cacd29cdfd145e1ac2ba161bd7","observation_id":"209db5c1-0a16-47af-9159-a2d228aa5b7a","resolution":{"observed_at":"2026-08-01T20:07:43.870566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-01T20:07:43.935811Z","title":"Modelscope text-to-video technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:43.935811Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:ed561e2f69c888ebe7856fae1689e1cf1502f00bb9b5264b9cb50634bb4b64b0","observation_id":"0a7f2ce3-9112-427c-8e33-719f98abfeeb","resolution":{"observed_at":"2026-08-01T20:07:43.935811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:44.002251Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.002251Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:2e45e1dd1484d410c7898898cf699acca43a2aa0121b6dca61c42f687f2ad6e4","observation_id":"4cbf430d-1329-48e0-adc9-e1d54b2cffd8","resolution":{"observed_at":"2026-08-01T20:07:44.002251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:44.084673Z","title":"T2v-turbo-v2: Enhancing video generation model post-training through data, reward, and conditional guidance design,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.084673Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:f86a847130120dede9c8e3d253a3e778ce4e6741726859d0bbbd1d90ad97b871","observation_id":"b55e2fbd-faa7-443a-b3cf-aee1cf842015","resolution":{"observed_at":"2026-08-01T20:07:44.084673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:44.145655Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.145655Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:4818e2092b29b563b949c0aa8b3f3eabb20b0d6ed2785ff1a62977f5cd3aaac5","observation_id":"7e2b4fcf-9bc6-433f-a0c2-3a41c1e11dbf","resolution":{"observed_at":"2026-08-01T20:07:44.145655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:44.228172Z","title":"Zeroscope,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.228172Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:e7df19d7880c88008c23282d75aa0602f029de9cdf3bb8754f7f9f00c12fa29e","observation_id":"c1d0153f-83e1-4e29-a4a4-9ba26f433cb6","resolution":{"observed_at":"2026-08-01T20:07:44.228172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-01T20:07:44.289402Z","title":"Cogvideox: Text-to- video diffusion models with an expert transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.289402Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:25ca98f967282c32183c08dd627ae236eed0e74ff61c49d0fe64e80730e4403d","observation_id":"dbc6229f-a4e2-408f-9716-e5f5cbb8dd87","resolution":{"observed_at":"2026-08-01T20:07:44.289402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-01T20:07:44.350027Z","title":"Ltx-video: Realtime video latent diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.350027Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:d6bf8f43200d34293a82977eb86cc320fffc444456355a79ac1d00ca37768257","observation_id":"1da898d9-ed78-44a9-9493-32ae5fb29ce9","resolution":{"observed_at":"2026-08-01T20:07:44.350027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-01T20:07:44.413824Z","title":"Latte: Latent diffusion transformer for video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.413824Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:21df54d48634130be8ed51ffedefd6c0aa59849b1defaca67121325900210971","observation_id":"0778bbfd-74b0-4a4e-9415-a7989816067d","resolution":{"observed_at":"2026-08-01T20:07:44.413824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-01T20:07:44.492273Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.492273Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:48368afc08fc6bd11bcdf91bfbf0a07edff58100a3e0a425d117817e9271d795","observation_id":"377abb5b-dc37-4e3c-acf3-546a995b061c","resolution":{"observed_at":"2026-08-01T20:07:44.492273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:44.556844Z","title":"Mochi 1,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.556844Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:75c59d52743ea72698ce43aad504c55ad06fed76287eca826d7efe88e437ae85","observation_id":"15d28b0d-dd6c-4cbb-b4f6-220b2e94587b","resolution":{"observed_at":"2026-08-01T20:07:44.556844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-01T20:07:44.655356Z","title":"Skyreels-v2: Infinite-length film generative model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.655356Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:47f10ba7a9de0dc34e2a4a5adec4ea2cd9a7be1cda0ca735d658f4959e551435","observation_id":"337113b9-1194-460a-b059-bcced000c07f","resolution":{"observed_at":"2026-08-01T20:07:44.655356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:44.791196Z","title":"Cofnet: contrastive object-aware fusion using box-level masks for multispectral object detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.791196Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:e86cae78ffc56978fb2f5828c82f7cc4bad9beea8f6b938898b72a92d43611a8","observation_id":"0aca61c8-4211-4c88-9b87-fcc5766588d1","resolution":{"observed_at":"2026-08-01T20:07:44.791196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:44.905458Z","title":"Afes: Attention-based feature excitation and sorting for action recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.905458Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:fb060db87bb968e85a7deedc1f3dcdd84321481ae947775e34ac3a3fc3e90684","observation_id":"b11b7509-e703-4c65-8777-daf7362c9530","resolution":{"observed_at":"2026-08-01T20:07:44.905458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:44.959358Z","title":"An end-to-end blind image quality assessment method using a recurrent network and self-attention,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:44.959358Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:638e66fa79115272d8930805b9ac29db05dc7d2007734a24b3a26c9270a96683","observation_id":"2f7a453f-a23e-4f88-aed6-b42695e21b20","resolution":{"observed_at":"2026-08-01T20:07:44.959358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:45.032742Z","title":"Attentional feature fusion for end-to-end blind image quality assessment,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:45.032742Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:c6731c8ea2f0fdb649d22cdfa0897da480ccc37616230ccb9a6cb7a98665a69e","observation_id":"e4309af7-1e14-49fa-abed-6c4cd6aa2c35","resolution":{"observed_at":"2026-08-01T20:07:45.032742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:45.083371Z","title":"Multilevel feature fusion for end-to-end blind image quality assessment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:45.083371Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:29d35f6d793fab92a57807e28fc8555501551982591ac94aeefe1bd3bc6e4e4e","observation_id":"0bdda225-a928-4174-a6f4-48662cc51a40","resolution":{"observed_at":"2026-08-01T20:07:45.083371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:45.219678Z","title":"Blind image quality assessment based on perceptual comparison,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:45.219678Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:de840b2262de6d66776f4ec222f4793dfe2c7654cde5f9297602ff8d54eda623","observation_id":"f8d1a3d9-6c82-4519-bedc-20c48601248a","resolution":{"observed_at":"2026-08-01T20:07:45.219678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:45.354310Z","title":"Graph-represented distribution similarity index for full-reference image quality assess- ment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:45.354310Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:af75c5763fc2898f8257cde290ca661e169997075ecc903a0bb2985173ede22e","observation_id":"a122fc58-a548-4086-98d7-411ac872b101","resolution":{"observed_at":"2026-08-01T20:07:45.354310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:45.431594Z","title":"Bridging the synthetic-to-authentic gap: Distortion-guided unsupervised domain adaptation for blind image quality assessment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:45.431594Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:e29c2c4eb20fcbe2f2b7e2fd953b659224a7c2a9ad71a4cffbfa0d4404988a53","observation_id":"6ba4ec52-15dd-469b-ad5b-820de183e68a","resolution":{"observed_at":"2026-08-01T20:07:45.431594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:45.555280Z","title":"Blind image quality assessment: Exploring content fidelity perceptibility via quality adversarial learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:45.555280Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:13c1eff7e76fb8e50b0ecfd37eb83e29eb080624f64ef707a9bcb7bdaa1767c5","observation_id":"f50bba8c-f557-4ea0-b354-07dc1f2a5ee3","resolution":{"observed_at":"2026-08-01T20:07:45.555280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:45.684998Z","title":"Image quality assessment: Investigating causal perceptual effects with abductive counterfactual inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:45.684998Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:f399643c81c6e34e2901b96361871941902d0c50817872e59f5da0789b06db61","observation_id":"93d17d93-22fa-471f-8658-59250e0246e6","resolution":{"observed_at":"2026-08-01T20:07:45.684998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:45.821908Z","title":"No-reference image quality assessment: Exploring intrinsic distortion characteristics via generative noise estimation with mamba,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:45.821908Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:1be5b6569faf0e0fd1798ee83ce06fdc582a730c7e9908ab0fc4f72ac2ae1d5c","observation_id":"cb65c0c8-b4cd-4464-8d54-f841f7b82b40","resolution":{"observed_at":"2026-08-01T20:07:45.821908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:45.962261Z","title":"Towards syn-to-real iqa: A novel perspective on reshaping synthetic data distributions,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:45.962261Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:c54edb93def6ee8532ffe616049821f78ba7807067e322ab312261a32ebf42f4","observation_id":"ba6091cb-b598-450c-91d8-5474ad673829","resolution":{"observed_at":"2026-08-01T20:07:45.962261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:46.089593Z","title":"Uni-iqa: A unified approach for mutual promotion of natural and screen content image quality assessment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:46.089593Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:9f308b28cb14b8a8977d8d6f1e00b3cdda2586fe683b32b34c985d4caddc3dbf","observation_id":"0f7e6c68-7abf-4a54-8d4d-d48ac2cac99a","resolution":{"observed_at":"2026-08-01T20:07:46.089593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:46.277249Z","title":"Beyond pixels: text-guided deep insights into graphic design image aesthetics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:46.277249Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:60a277317abe7d750eeac16c832cd68dd8b734970635517ac1c019f70f98b186","observation_id":"c9d37514-f0e5-48ea-88f6-ad327f5a4791","resolution":{"observed_at":"2026-08-01T20:07:46.277249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:46.412737Z","title":"A deep learning based no- reference quality assessment model for ugc videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:46.412737Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:84ccaed014040957943395a5acf235ef62e521552ea97aa9384d4db6daa2e0ad","observation_id":"68d87028-8249-4130-afaa-5bc505c0eddb","resolution":{"observed_at":"2026-08-01T20:07:46.412737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:46.609547Z","title":"Analysis of video quality datasets via design of minimalistic video quality models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:46.609547Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:75149029522d897867ec7308c56e4c2b740081fb637c0e7a572f3fc082fa1408","observation_id":"1f51d02e-2cb1-48f1-8fa7-6de7f7a45f9a","resolution":{"observed_at":"2026-08-01T20:07:46.609547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:46.747952Z","title":"Fast-vqa: Efficient end-to-end video quality assessment with fragment sampling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:46.747952Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:7b7012648502a4c5dd82e419d41693ef35e85cfe953525c04ce1a36043f53595","observation_id":"103ef23e-55bc-4ed5-b516-103dbac657be","resolution":{"observed_at":"2026-08-01T20:07:46.747952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:46.905602Z","title":"Dynamic expert- knowledge ensemble for generalizable video quality assessment,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:46.905602Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:da0b23d3c831d6ca89b8dbb657cfd8eb677f1983209f3bdaaa54ecc4c21c6e3d","observation_id":"61cb87fd-c174-43c5-b5cd-ce1b8ec5ac38","resolution":{"observed_at":"2026-08-01T20:07:46.905602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:47.056630Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:47.056630Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:352288280dcea901c757a7eec13a196d9b6397dd09feb978c4110094d7c4122b","observation_id":"1cff413d-2296-4f63-9626-842bc1abf5be","resolution":{"observed_at":"2026-08-01T20:07:47.056630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-01T20:07:47.248839Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:47.248839Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:e0b15bbda6ecdb81245af4bd69ed79fed03bbb48311a9ead7a5f7d3a8d8e3486","observation_id":"30338aed-d3e4-4875-bef8-c148556d2bbb","resolution":{"observed_at":"2026-08-01T20:07:47.248839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:47.447240Z","title":"Kvq: Kwai video quality assessment for short-form videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:47.447240Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:4c0276b6f19ddc7571f33fb494f9d4432ad5ec4d448a4accd306701a7e293fdf","observation_id":"49227d85-476f-47bd-80f6-7ee07af442cb","resolution":{"observed_at":"2026-08-01T20:07:47.447240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:47.615618Z","title":"Scaling and masking: A new paradigm of data sampling for image and video quality assess- ment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:47.615618Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:e13db310b31fbd97c61155deffcac38280336d25c8cc8a93e94202b05d873d3a","observation_id":"d39b3937-810d-4121-b096-97048c8f39a8","resolution":{"observed_at":"2026-08-01T20:07:47.615618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:47.820145Z","title":"Video quality assessment for online processing: From spatial to temporal sampling,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:47.820145Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:119bb6613cfd05f5d08c1f39075a805b45b27141fe9cb8152f5c4a9162ce4784","observation_id":"85737e07-2040-46c2-86ec-ff427df5a447","resolution":{"observed_at":"2026-08-01T20:07:47.820145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:47.921016Z","title":"Pea265: Perceptual assessment of video compression artifacts,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:47.921016Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:d5096619c2047de59fe32cdc5f2eae163fd7b0711f8d4ab7c1c8f44cc594bef1","observation_id":"b9bfa9d2-694d-4130-9fc5-47a4b131fa6d","resolution":{"observed_at":"2026-08-01T20:07:47.921016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:48.096049Z","title":"Patch- vq:’patching up’the video quality problem,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:48.096049Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:6752fa5e692a714e63b9036d31e1a6a2adfeae016d68c1ff46b35b88fb25f1d8","observation_id":"9261cc25-7432-4c29-8877-9f35c53234d2","resolution":{"observed_at":"2026-08-01T20:07:48.096049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:48.222527Z","title":"Fvq: A large-scale dataset and an lmm-based method for face video quality assessment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:48.222527Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:4fd8f694a31663b603a84b6b3ddcd897e6bfa9a7713f2c8317f7969cf1ffe20a","observation_id":"a106f764-035a-48f8-b2b2-453d4711a0c4","resolution":{"observed_at":"2026-08-01T20:07:48.222527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:48.345475Z","title":"Rgc-vqa: An exploration database for robotic-generated video quality assessment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:48.345475Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:fd5d062d7c4b0974edd5d55fd0f8beac88bae807b9217243719ab481a9d39885","observation_id":"52da6e1f-bcd7-4864-9d4a-3c7bd70dad3f","resolution":{"observed_at":"2026-08-01T20:07:48.345475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:48.453488Z","title":"Ges-qa: A multidimensional quality assessment dataset for audio-to-3d gesture generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:48.453488Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:7b0dcae612a0bd66d749b178b29dddf06bdb23404878cdf327c553b31f87484a","observation_id":"4ec6cbd0-de00-467f-a8eb-bc7f874599a5","resolution":{"observed_at":"2026-08-01T20:07:48.453488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:48.543125Z","title":"Sfqa: A comprehensive perceptual quality assessment dataset for singing face generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:48.543125Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:ede1de81e1009cd739d2a31ead26dee10739f0cec52ff6674a963f8a4853568c","observation_id":"c039bd1e-2256-4e75-928f-6cb72552edd5","resolution":{"observed_at":"2026-08-01T20:07:48.543125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:48.648978Z","title":"Two-level approach for no-reference consumer video quality assessment,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:48.648978Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:5b3b90e1cce8cb8d7828f896085713274fad37e6cb9cd01660ceb9dcf152a252","observation_id":"ec0c0be6-4c34-4dc5-9508-a472bf6a7cd6","resolution":{"observed_at":"2026-08-01T20:07:48.648978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:48.812989Z","title":"Rapique: Rapid and accurate video quality prediction of user generated content,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:48.812989Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:964f2f7402c5a3faebae08c24b390b711869213a01c5e7d47bd32a985a7e2c37","observation_id":"78e0828e-2c51-4a67-b531-1c0e78087587","resolution":{"observed_at":"2026-08-01T20:07:48.812989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:48.962214Z","title":"Ugc- vqa: Benchmarking blind video quality assessment for user generated content,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:48.962214Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:5bbbeee151ce6d0edc7492c6a4b0f7319c542e03d521423a5b623ba1ed5b9fe6","observation_id":"3de8e223-7ffd-4092-87cf-e3edefe64313","resolution":{"observed_at":"2026-08-01T20:07:48.962214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:49.032237Z","title":"Learning gen- eralized spatial-temporal deep feature representation for no-reference video quality assessment,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:49.032237Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b1c9c265c47fcb2fa9830dcd4686adc29192c06d61515060ecb5bd36868d14ca","observation_id":"93c809e0-d9ef-46aa-938f-31b964c57676","resolution":{"observed_at":"2026-08-01T20:07:49.032237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:49.108540Z","title":"An end-to-end no-reference video quality assessment method with hierarchical spatiotemporal feature representation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:49.108540Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:a28012eb26df492c85faa34b2ba61dbccdb5adbdbcaad04235024dbf4d1515c7","observation_id":"a133ff7d-0df7-45ac-a2e2-243cb9dfd632","resolution":{"observed_at":"2026-08-01T20:07:49.108540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:49.194274Z","title":"Blind quality assessment of wide-angle videos based on deformation representation learning and multi-dimensional feature fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:49.194274Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:d8dc8e48d8521e49ec90ee6a9b8ea5726f3c72a5b1bc8a3f487d8ece686e3c03","observation_id":"c77370c0-6e31-4cd5-819f-d099b97a535e","resolution":{"observed_at":"2026-08-01T20:07:49.194274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:49.256502Z","title":"Mi3s: a multimodal large language model assisted quality assessment framework for ai-generated talking heads,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:49.256502Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:230f30ec9c22b8f3f1e39e5539f72afae76266684bab90eae91f70c9e8d1ad15","observation_id":"5b227162-f6c5-44f2-a4d4-caa5a14446b9","resolution":{"observed_at":"2026-08-01T20:07:49.256502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:49.309647Z","title":"Objective quality assessment of ai- generated content videos with transformation consistency focus,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:49.309647Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:04f6e8fd7c7ae0ca7791194d257c6f01b5cdd7a583c026eeef0595fcf24fc363","observation_id":"6d0d55de-35b4-41e2-9093-212dbffc86bf","resolution":{"observed_at":"2026-08-01T20:07:49.309647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:49.446299Z","title":"Dreamina,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:49.446299Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:2727ef5966ec03098411f7fbeb1cd7ef3a98c1165536b0e12354ffffefde2abb","observation_id":"61a6baf0-9091-4c4f-8110-e29948e6e25a","resolution":{"observed_at":"2026-08-01T20:07:49.446299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:49.597533Z","title":"Introducing gen-3 alpha: A new frontier for video gener- ation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:49.597533Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:02a972acf6ee31c5e1e7d512314401e669d99f1b2af80d90cfd6068de30a576c","observation_id":"d4b66ca6-62c2-45ab-b3ed-1c9c75eea3ad","resolution":{"observed_at":"2026-08-01T20:07:49.597533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:49.794012Z","title":"II, III-B, VI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:49.794012Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:987920d85db05c5e0d51ab7f978b878608cd49f9e40f7256d1aed8b439d30be0","observation_id":"206ffdf0-4da1-4946-a6fa-9ed6d4157012","resolution":{"observed_at":"2026-08-01T20:07:49.794012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:49.947471Z","title":"Methodology for the subjective assessment of the quality of television pictures,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:49.947471Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:737469775a721d221adf966a26d7e626ea8951db4d0ff4105a7b12f142749490","observation_id":"23021419-52aa-4251-a426-f44830f38abd","resolution":{"observed_at":"2026-08-01T20:07:49.947471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-01T20:07:50.079288Z","title":"Clip- score: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:50.079288Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:d623daf2ee8d9c3fb02bc1e226d4d51b776c3c47396cdd9f4cf37217a067ee9b","observation_id":"bec5484e-1e95-464c-ad2a-12d872c8c3e7","resolution":{"observed_at":"2026-08-01T20:07:50.079288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:50.260800Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:50.260800Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b422e6f3108002f52cc0a54c4d7b50ed3a75746bcc5e6e89946b78674ced037c","observation_id":"369bf5bd-c1fa-46d7-9af6-0b811b993fce","resolution":{"observed_at":"2026-08-01T20:07:50.260800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:50.419203Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:50.419203Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:ac64d07b0e1b5cb76c10f0422efbe2e4c71bde30cad1cd09995258b2c451715d","observation_id":"1f50e640-dfdb-41a6-a1d0-526c9955a797","resolution":{"observed_at":"2026-08-01T20:07:50.419203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:50.547295Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image gen- eration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:50.547295Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:34933374c0a374ce90a9e5a2707a46f354cae35026b50679af3ca02dae0038e8","observation_id":"b9ce64c7-7fd5-4011-9ab6-b6f1ca8e012f","resolution":{"observed_at":"2026-08-01T20:07:50.547295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:50.671684Z","title":"Imagereward: Learning and evaluating human preferences for text- to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:50.671684Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:787bbbd5676b1d058c253778c1b34d71d40bdca8550e5cbbe6d1059a6eddf5e8","observation_id":"81a2f375-c0eb-44b8-baa3-88a1281911fe","resolution":{"observed_at":"2026-08-01T20:07:50.671684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:50.851257Z","title":"Evaluating text-to-visual generation with image-to-text generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:50.851257Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:3c67aac13f61a406b9f41b8fcd324c2c6f219923e4cbdac283c4fbf755f67a2c","observation_id":"28d58e01-229b-4106-b31b-1f9540f241d8","resolution":{"observed_at":"2026-08-01T20:07:50.851257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-01T20:07:50.972763Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:50.972763Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:9c0db3d3f7c1c8084b58182de9510e501a5268e893b4f49ae007a860551b733e","observation_id":"f84a5fc0-ad7a-43eb-bb32-e6fd1f3188fa","resolution":{"observed_at":"2026-08-01T20:07:50.972763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-01T20:07:51.084614Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:51.084614Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b37fd3d71d1ddd9fd4b9d9197366b6e9375c01497860000e17a0b1af7c302fd1","observation_id":"c6317215-f3ab-48cf-9e5c-118936021b88","resolution":{"observed_at":"2026-08-01T20:07:51.084614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-01T20:07:51.198128Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:51.198128Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:5a033b9958f9e8124d0e21e0f8932a8ef9feb35d72e8be99895e10e3905da6ee","observation_id":"8940fffe-875c-4155-86a4-586e305c2ee9","resolution":{"observed_at":"2026-08-01T20:07:51.198128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T20:07:51.347110Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:51.347110Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:ca0461aa0e8f90f4bacf95d3898e926367903dce54a32a6964ef2dbff80e68a5","observation_id":"685218fd-ecf4-40bd-beec-536d1668f342","resolution":{"observed_at":"2026-08-01T20:07:51.347110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T20:07:51.421243Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:51.421243Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:0530c43758cb860e716863138495e1a0a140d5d497dafc4bc5d9f3e9672239be","observation_id":"0f3eda30-4d57-405b-8737-7e80c191224c","resolution":{"observed_at":"2026-08-01T20:07:51.421243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-01T20:07:51.470448Z","title":"Deepseek-vl: towards real-world vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:51.470448Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:f826182bc797bd4a74f8104c77d1018c2eec9bd66478830b3637801f31890b11","observation_id":"a5883d84-8488-4de6-bf6c-317ec05b201c","resolution":{"observed_at":"2026-08-01T20:07:51.470448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-01T20:07:51.537525Z","title":"Ui-tars: Pioneering automated gui interaction with native agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:51.537525Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:b185bf5f686be7225f5adea5c716f6fcf8c0c193631d19bf63bca79d4a8b12e7","observation_id":"ead9baf6-4b65-48fc-b262-5b959053ea0a","resolution":{"observed_at":"2026-08-01T20:07:51.537525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-01T20:07:51.608279Z","title":"Expanding performance boundaries of open- source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:51.608279Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:705d35588837379e75732c6dd3bd7b193cd114abd940cbcc7ae3b6933984654b","observation_id":"831ada82-5b4c-4b57-83b2-7c19ff2fa2f3","resolution":{"observed_at":"2026-08-01T20:07:51.608279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-01T20:07:51.654949Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:51.654949Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:a49acacbbd3157cd6b9a58d218c56c1a1b380bdaa040dc9e6e636e6aeb167c6b","observation_id":"459f84df-c024-4e13-9429-31c9e3716f2f","resolution":{"observed_at":"2026-08-01T20:07:51.654949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:07:51.766473Z","title":"Cogagent: A visual language model for gui agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-01T20:07:51.766473Z"},"links":{"citing_paper":"/paper/2607.16742"},"observation_digest":"sha256:e5de0f09fffbcb7166f942a616dd2f1c57b9ced833a6593a5a52d4814794bd63","observation_id":"0a688b26-52a6-4e87-b244-1ca2913263d1","resolution":{"observed_at":"2026-08-01T20:07:51.766473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16742","last_updated":"2026-07-18T10:04:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:51:22.400147Z","submitted_at":"2026-07-18T10:04:18Z","title":"Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":120},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 120 outbound references and 0 inbound Pith citation observations for arXiv:2607.16742."}