{"as_of":"2026-08-03T20:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80c868925d7c569026c122676eb572ec251b94ac46fa78353060319811d510fc","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T20:13:41.533598Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.26763/citation-record","integrity":"/paper/2603.26763/integrity","json":"/paper/2603.26763/citation-record.json","paper":"/paper/2603.26763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"near-raw,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:f4149361f911f1cdfb1f66600961eea09cae9d600b6af9ed78d375a0b4bd886e","observation_id":"80836f1c-d6f0-43f9-a622-ba58098ccfae","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:e4a5a7eb5cb5c5e965667a87f939e3272d2a5bc9b4a76e0fae64528f4d05cc45","observation_id":"994ac37f-1c34-4363-8b0c-8850b6ac1ec7","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:e8b2267699e2f056c871e8b0cd50ecb8c0e85ab0b89d225818560962b13b20ce","observation_id":"7a043387-2c74-4c84-b61f-c39ff3187c56","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:e4b6f6de785c3c27a0a5e2b43e108dda129fe410616741a87f0503fd89285881","observation_id":"49f36493-99b3-4efc-9f67-1b6affb55634","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"near-raw","venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:353b9cbf358ffd7caa10d98e699ecce2001e56914579a02d332b1130f78891e6","observation_id":"6b7de09c-2489-4197-a93c-f4a164d6ba46","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:378b40c392d7ce97f7739465657295dffcf8b7802f060445b6adb0babde714b2","observation_id":"06fad653-adb6-4d77-b734-59303b16f31d","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"VCD: A Video Conferencing Dataset for Video Compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:5307b9a7ef36b01d26e1d6521723b667a81ebcd3e93a5ffbc8afe7d103a9cd07","observation_id":"d745759c-88e2-4bf2-8baf-e105aad7763e","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"VFHQ: A high-quality dataset and benchmark for video face super-resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:a89a486825889d91ead24ea3141bff72b6115abd8385a643768d22e73b32a40c","observation_id":"a7594676-ee4f-47b4-9183-46fc254d4e84","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Common test conditions and software reference configura- tions,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:e11a604c6d7961fef7cdeea52bf81912eeec068716612723b3f2885796275cd9","observation_id":"6b91a5f0-90a0-46af-8f60-f107b67ce0e5","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"JVET common test conditions and software reference configurations for SDR video,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:f58f9ea5a01ab4702e312f60a35d8a90d834fbae912f10d21bca0de30b0b4cf2","observation_id":"a5a5b3a8-1671-4f9a-a494-09c34ad30b7f","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"UVG dataset: 50/120fps 4K sequences for video codec analysis and development,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:ac04cd201b907ba945c61731cb1905495c41dc1953a26e542468c098579a5312","observation_id":"1176eccc-3312-409d-8792-3908a299fe42","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"MCL-JCV: A JND- based H.264/A VC video quality assessment dataset,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:6202bce4b2702aa0a9c901fb7ab98b765e28d8a3dc97489806544aaa8e12b183","observation_id":"ceb317ba-6f51-437c-ba33-f20e89b1bf62","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-02T05:48:34.226234Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"V oxCeleb: a large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:2167b94c7298d3abd0323a221636a8bf7a1a08896fb7224ceb5025fb91780d51","observation_id":"415c7d77-473a-4142-aef9-8bd4bcf10254","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"V oxCeleb2: Deep Speaker Recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:e950b935ece305c45299c598878e05e975c2bd1981c40092e2717ba50343d916","observation_id":"a94eaa98-e54e-44b0-93bd-f0b7c76d6e76","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:ba43e8ae1df09624200c621de89b36ad456596ff8c404fe5d7d4188716304d44","observation_id":"95e4189b-7f6d-4eca-8819-1ddedf1b82f9","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"CelebV-HQ: A large-scale video facial attributes dataset,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:e0880e7377e7953ec0082b7a1d5e1f06f80416b72b1e608033b32896e0fbe1b0","observation_id":"215d437b-738c-4e3c-82e3-eb2b1dfdef8c","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"DH-FaceVid-1K: A large-scale high-quality dataset for face video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:32b5757161dd1973c9b36817ae6b51bafa83ae8bfac343a8e7a4dd3035c6e1c2","observation_id":"0e5250d8-59aa-4001-8854-d8a38d99c336","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"MEAD: A large-scale audio-visual dataset for emotional talking-face generation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:a636c455175948dea7e607df9fe6b3755d962c6633297ce29d386bbf86bfddfb","observation_id":"08648543-e79b-4006-abe3-ed70c2e0d8f3","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"FaceForensics++: Learning to detect manipulated facial images,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:2fc851adb2c8c8535f404f66dc4bcb3483ba3b95d4d7b42e6cbfe2bfd229e8b2","observation_id":"72cd0ea9-ef4f-440b-bae7-2695d8c12751","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"NTIRE 2019 Challenge on video super-resolution: Methods and results,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:b8f1fd666bc215c4f62af93f6930702daea27bdaa27a4d29b03ca7cdf16cdfd4","observation_id":"8a67f7d5-29ee-42a8-9e67-7f9c1d530be5","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"EDVR: Video restoration with enhanced deformable convolutional networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:2e31b8759960fd87d980edc4f8c11c5b23214a7bd63fa05dfcde2d696a31526b","observation_id":"a21dd68d-ef39-4a90-a9fd-7ad4c790b9e8","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Basicvsr: The search for essential components in video super-resolution and beyond,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:cbdd6901f8bf7ba3709531950d537fd7080c5223dcf94a8c35a27b2ac0223ee0","observation_id":"a3bedc00-17b2-4434-8dd6-799c6a2e0f17","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Basicvsr++: Improving video super-resolution with enhanced propagation and alignment,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:3a536bf8421ded05fbe74f64aa5cb7fa7f35323efea6809e59a0a5428d3745bf","observation_id":"9a63607a-5b84-4a51-9905-42f88897d577","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Real-world video super- resolution: A benchmark dataset and a decomposition based learning scheme,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:5b12473280424b9477abc02ba0c5362dca53495f5306bc37a595dbeffcc62f33","observation_id":"112b6ff8-60fe-4749-93b6-3932bab486d1","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Investigating tradeoffs in real-world video super-resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:4a8eca1f4e1805eb08cac2c788951e707cefcddbc09d8170be774db2cfe5489e","observation_id":"8e093ec4-48b6-4f37-850c-92f3750c5f8a","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Generative face video coding techniques and standardization efforts: A review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:3b3229dc6f5959c4dae2958b31093a3fb9ab9be8b1b802314fb9b1e05a445965","observation_id":"71be2ad1-7d78-4db8-8dc7-e13733e0eab7","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Gemino: Practical and robust neural compression for video conferencing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:7948856381acbd5eb29917610a1cf3da780a4b054db40ade4202be80b0aff97b","observation_id":"08eea192-6557-4469-9fc1-241359511937","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Overview of the H.264 / A VC Video Coding Standard,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:0d34cd989e77a87d8eb77ba20dfff4b16edd126f1dce64fd943c976ca4e376e7","observation_id":"bbaaa54d-8aa9-47fe-b9ef-ea548e542f72","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Overview of the High Efficiency Video Coding (HEVC) Standard,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:ca8fbba40a912c1790671b69bc979b3a183d5c7e41a65401136abd78743498d8","observation_id":"0031b3a3-1c1a-4a7f-bfb1-a05a4b6e9b45","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Overview of the Versatile Video Coding (VVC) Standard and its Applications,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:093997cbf839003d7118ad3767c13cfc13485402136d2c55e87248025fc08af5","observation_id":"461be69b-54c7-4a85-9396-a31e7427f51d","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"A Technical Overview of A V1,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:f27d0b6ccb1b6924de74bef56c773213be1bdc77174325e66ca9a20f31c27ce0","observation_id":"6b250666-ec17-4849-bee4-37be859d351c","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"FFV1 video coding format versions 0, 1, and 3,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:491d1b5f6d22eb03c508e4d62c13359c046738079df8b1ed117d5f6c810254ca","observation_id":"ceef4cc9-82bb-48c2-82ee-a0da208ab03d","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"A crowdsourcing approach to video quality assessment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:144dea73f17d9cc862f89f56de78de2130a52871498b12a6faca53aaa19abe45","observation_id":"f42a1901-4298-418e-8045-806464de88ed","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Crowdsourcing Quality of Experience Ex- periments,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:600fd2fbe225410b9d4b0b18d566648863b87083ce58189cd7e785bf04228eda","observation_id":"15297ef8-cf7c-485f-91cb-2409b99a3a4b","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"CROWDMOS: An approach for crowdsourcing mean opinion score studies,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:c72e4aecc87478d644cd35a9f8f1c889e13cdb55362028db0181fa055925c648","observation_id":"576f64bc-5203-4157-b20b-327617adb97c","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"The Ishihara test for color blindness","venue":null,"work_id":null,"year":1924},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:08a64cd0ac3db56d76c50128f609c012360112499235e9c276ae7e6dc85b5a45","observation_id":"11ab77f6-363c-4cbd-b932-2923a726ae08","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"An index of factorial simplicity,","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:2f9650549b23fa12c9e0e2be4dc86aa8f2280153e28e49c8e58a819a37947e14","observation_id":"c263441b-6e64-4758-8f51-7ad7c0ebee12","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Calculation of average PSNR differences between RD-curves,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:8df5d41405798ca1dd22e5cb6de248c8027d3760e61bf0e4851bcaea14bad481","observation_id":"dacef736-3fa4-4582-98ee-3be90df06a7f","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"VMAF: The Journey Continues,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:5f526396ccb3d2fd010e539909f0e9fe2c870763070e8d2112c9e5d8b7767db5","observation_id":"bc408c49-eb0d-4d74-be47-2298fa4019c9","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"WebRTC video processing and codec requirements,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:c84853978d7425f74d5b08629d21c1e3fc2b7d565fe89145af9bb5272ff6ca93","observation_id":"b820cd30-5e1c-4f24-ac67-428c93112e68","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T05:50:44.685138Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2603.26763."}