{"as_of":"2026-08-09T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9741895a2475a08946d100e5034f6547e62ce32be53da19fc46dd96d7cb2b0d","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:05:03.793979Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13164/citation-record","integrity":"/paper/2607.13164/integrity","json":"/paper/2607.13164/citation-record.json","paper":"/paper/2607.13164"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.048704Z","title":"Deafness and hearing loss,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.048704Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:4cf873bb9abcde7d886c63246f45408da41113874cc63e7ddea73d439545e0b4","observation_id":"8230f131-91f1-4da8-b5ad-d48b817143b0","resolution":{"observed_at":"2026-08-02T06:05:01.048704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.110852Z","title":"Occupational outlook handbook: Interpreters and translators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.110852Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:d727e8f528f075cfb9916e0d8d1bff8bdbc6e79d5df92b9c70350156bdc78ecc","observation_id":"9f5d5057-8d73-4a90-9160-5a752f279ba0","resolution":{"observed_at":"2026-08-02T06:05:01.110852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.14874","last_updated":"2020-07-20T10:20:03Z","snapshot_observed_at":"2026-07-31T00:47:49.520619Z","submitted_at":"2020-04-30T15:20:25Z","title":"Progressive Transformers for End-to-End Sign Language Production","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.14874","snapshot_observed_at":"2026-08-02T06:05:01.193423Z","title":"Pro- gressive transformers for end-to-end sign language production,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.193423Z"},"links":{"cited_paper":"/paper/2004.14874","citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:fa4776d02fcb34bf7f50359d070fbd30fbfcf718eae4343103686dd99744947b","observation_id":"a97d1e0e-b3e2-444a-9a53-65d0a4835c64","resolution":{"observed_at":"2026-08-02T06:05:01.193423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.253723Z","title":"How2sign: A large-scale multimodal dataset for continuous american sign language,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.253723Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:72a615d81a900eed663025e9be68e7feaa1c8c9391d619bcd25d466e9ac42c99","observation_id":"8b40dbc6-0224-412c-aca0-bd837dcfd14e","resolution":{"observed_at":"2026-08-02T06:05:01.253723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.336483Z","title":"Denoising diffu- sion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.336483Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:026e4c9903d6be04ae502a1bb58876832ff73d14a2862de942b39594acc0bdc2","observation_id":"755cc2fd-a087-4d11-bd40-3cb2c83a7f88","resolution":{"observed_at":"2026-08-02T06:05:01.336483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.418186Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.418186Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:8027c0e60d713bd89e22e0705d505e19249057fe793d2bcbc585f079ed3b3709","observation_id":"6801b072-104c-4080-bb2c-8328ba2f7a27","resolution":{"observed_at":"2026-08-02T06:05:01.418186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-02T06:05:01.486232Z","title":"Video diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.486232Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:d2741c832b78f49d6dd8ef060f34edd53aeddde9caa3dc95f7eb9868efa2e273","observation_id":"0fe3a6d2-eddb-4438-8e93-ba645fa11c22","resolution":{"observed_at":"2026-08-02T06:05:01.486232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-02T06:05:01.548160Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.548160Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:d36a79f28ab8088da2f54b58bb608950bbfca998622e36078302bd11a8ecfefc","observation_id":"9714fe8f-b312-4fbd-9158-943abeb5f551","resolution":{"observed_at":"2026-08-02T06:05:01.548160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.633167Z","title":"Neural sign language translation based on human keypoint estimation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.633167Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:5488dd4558936d056b50cc2bc9b4a83dad3f8f3c643544aba71771c071a68fdc","observation_id":"b5ee73d0-855b-48f3-9a22-3eabd2acf47f","resolution":{"observed_at":"2026-08-02T06:05:01.633167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.715992Z","title":"Auto- matic sign language to text translation using medi- apipe and transformer architectures,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.715992Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:fa66d0c0b2e82d72794e675fb21c9604a896b87312df90ef9ab27a0a9662d377","observation_id":"1a602a1f-dfb9-4f47-a928-268f6285ad00","resolution":{"observed_at":"2026-08-02T06:05:01.715992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.773307Z","title":"Machine translation from text to sign language: A systematic review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.773307Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:18fa1aad0d6c5fbf18f8ce43aa6cc8ff41d8ae87f2b7592b627a0c720a44ffd0","observation_id":"c9e37191-e66f-49f8-aa01-9aff93b00714","resolution":{"observed_at":"2026-08-02T06:05:01.773307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.835566Z","title":"Benefits and development of assistive tech- nologies for deaf people’s communication: A sys- tematic review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.835566Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:ef7903781a95272edded82097f1be16be0838433ca9576dbcf624ddb932fde88","observation_id":"1c3c377f-7824-46fb-b59f-ec04b4cacd3a","resolution":{"observed_at":"2026-08-02T06:05:01.835566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.888017Z","title":"Idf-sign: Addressing inconsistent depth features for dynamic sign word recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.888017Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:17712743693edca309ee3aef89c08cb5acc182981544d014e23921d43e1f3e44","observation_id":"87d97aa7-c192-49b0-9edb-c189aa48aba7","resolution":{"observed_at":"2026-08-02T06:05:01.888017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:01.955487Z","title":"Fsign-Net: Depth sensor aggre- gated frame-based fourier network for sign word recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:01.955487Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:ec2f612e7990e56279578a27f8345f7b3e940a369f355752423febd36f469a5d","observation_id":"4d5e16d8-4196-4b9f-a1b5-98f726f8e89d","resolution":{"observed_at":"2026-08-02T06:05:01.955487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:02.013875Z","title":"Spatial–temporal feature- based end-to-end fourier network for 3d sign lan- guage recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.013875Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:ce63c8f6d75cc65e0034cabbe4f81a3e01064f07d3eac86dae332202df1cd472","observation_id":"c11841fb-49ee-4c04-91ad-806d7be956e0","resolution":{"observed_at":"2026-08-02T06:05:02.013875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:02.095152Z","title":"Ameri- can sign language words recognition using spatio- temporal prosodic and angle features: A sequential learning approach,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.095152Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:29f1fa13a963b2399b4d14127af203a233b72b4b58dbfa57c56b2d15669962df","observation_id":"daf3b109-032f-410e-845b-e634301d7391","resolution":{"observed_at":"2026-08-02T06:05:02.095152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:02.156186Z","title":"Minimizing redundancy in hand dynamic features for enhanced sign language recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.156186Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:f32e158747277ac89b29c92a8d4aa0fc3c34abda76d8bd66e943c2b5853dd207","observation_id":"12858d31-d43c-4587-86fa-5c53cd5115d1","resolution":{"observed_at":"2026-08-02T06:05:02.156186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:02.230567Z","title":"Sign language video generation from text using generative adversarial networks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.230567Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:b65a10261412139e9988c60aff0e74bf29698323025a95bf574fe8ba5d5283da","observation_id":"fc38e003-bb54-4e51-b0e8-ae6d48050e7b","resolution":{"observed_at":"2026-08-02T06:05:02.230567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:02.307914Z","title":"Text- to-sign language video generation using gans, bert, and sora,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.307914Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:9f742635e13bd723ec6611f497325f6dc8e14d14fa576fe948abe91ecf61c2e7","observation_id":"0db37364-a238-4487-a454-45f228c9f98d","resolution":{"observed_at":"2026-08-02T06:05:02.307914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:02.371260Z","title":"Signgen: End-to-end sign language video generation with la- tent diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.371260Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:f5b96b926d07fbebf9b85ce2cd3cbf091a56553ec2049974ee769b5c020bdb4c","observation_id":"b560e112-8905-4f52-8698-23773687d91d","resolution":{"observed_at":"2026-08-02T06:05:02.371260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-02T06:05:02.446942Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.446942Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:f56a290bf6e74e575649b34d78d10849d2c7531ddb6aad62a12524a9b076eb04","observation_id":"f09fb1a3-3485-414b-a887-cb88c14aba83","resolution":{"observed_at":"2026-08-02T06:05:02.446942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:02.505873Z","title":"A rule triggering system for automatic text-to-sign transla- tion,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.505873Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:f69b2941c66b6945e03ee54dc0bbef9c798f10ad3c4a36f92622d512bfcef3e2","observation_id":"be5f6a79-1e27-48c1-be5c-aec03f9e5bd3","resolution":{"observed_at":"2026-08-02T06:05:02.505873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:02.546576Z","title":"Improved denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.546576Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:520b1a46440543e7b15eebd419c8ae3eebe7f7c152840235ec53a06ad8d786de","observation_id":"e86ceaf2-bd7e-439e-aa35-1c541ccc1ab7","resolution":{"observed_at":"2026-08-02T06:05:02.546576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-02T06:05:02.673844Z","title":"Lavie: High- quality video generation with cascaded latent dif- fusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.673844Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:ad745a25af0deac3e438dc1ced23f10ac3e320a370ead992217922b192a75725","observation_id":"ee310664-512f-438a-8840-582722858699","resolution":{"observed_at":"2026-08-02T06:05:02.673844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-02T06:05:02.709704Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.709704Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:4fed4cd3609a412f1db895554aa0101c6f0a58afa8a349bbe96ed8120067b96c","observation_id":"96cc5b63-b7d1-4934-83b4-eefb072ad407","resolution":{"observed_at":"2026-08-02T06:05:02.709704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01199","last_updated":"2024-12-02T07:05:39Z","snapshot_observed_at":"2026-08-07T17:07:55.964734Z","submitted_at":"2024-12-02T07:05:39Z","title":"TinyFusion: Diffusion Transformers Learned Shallow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01199","snapshot_observed_at":"2026-08-02T06:05:02.778859Z","title":"Tinyfu- sion: Diffusion transformers learned shallow,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.778859Z"},"links":{"cited_paper":"/paper/2412.01199","citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:4d1c880a183adfb62351f07a54ffc0c3a38c2b0980d46e7c099e2981d03cf923","observation_id":"e877f783-d8ed-4127-b657-6ba1c515c6ff","resolution":{"observed_at":"2026-08-02T06:05:02.778859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-02T06:05:02.902536Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.902536Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:2c5a9d621e29e9b13b202dfd3e31acf4b88830ac23f0272bb6beda90078bcacd","observation_id":"c7d178d4-bb19-467f-83f5-efdb99942eac","resolution":{"observed_at":"2026-08-02T06:05:02.902536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-02T06:05:02.987576Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:02.987576Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:e0096508c666bc2af9c7f753381e9f101c7019a37216aedbd63b329d480a7cb1","observation_id":"ee6b706a-cbf6-4091-b292-39f1d2afd96f","resolution":{"observed_at":"2026-08-02T06:05:02.987576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:03.084503Z","title":"Video diffusion generation: com- prehensive review and open problems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:03.084503Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:41f99a96fe6da618d6d0ff5e70413f60aa25836f70ac369c3c8a7c0ab51957c6","observation_id":"433e1596-d5f2-4967-93d2-168ba1936420","resolution":{"observed_at":"2026-08-02T06:05:03.084503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:03.123291Z","title":"Survey of video diffusion models: Foundations, implementations, and appli- cations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:03.123291Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:de14a217f16456ec49013b05a857b098b588e16c60d624aaab52b0373bf5d5f4","observation_id":"76a7c52f-f7e6-4e86-a6d4-d3b80a1e60b6","resolution":{"observed_at":"2026-08-02T06:05:03.123291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:03.177201Z","title":"Deep compression: Compressing deep neural networks with pruning, trained quantization and huffman coding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:03.177201Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:3c52eb86c8d897ce9617b845633a1e58a0503cfafbdd92ba26ce9f3adb5c9a53","observation_id":"67706124-c5a6-4eed-963a-17fa23da15aa","resolution":{"observed_at":"2026-08-02T06:05:03.177201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:03.267398Z","title":"Visual- sign: Revolutionizingvideoaccessibilitythroughsign language translation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:03.267398Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:4222c56da04ff76ae22266164e4df821b5da4cb8f663905ef05e1f1ee53f7d88","observation_id":"59d05d29-ceed-4605-b8da-784593082dab","resolution":{"observed_at":"2026-08-02T06:05:03.267398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:03.375290Z","title":"How we built signstream: Rapidly devel- oping accessible video translation software for sign language in just 30 days,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:03.375290Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:5a99c6661eae6890be4a6e3e7ca3eabc9b8400e1f3e50376c194e52f92493194","observation_id":"cb55fafb-3323-459a-a649-222051a2720b","resolution":{"observed_at":"2026-08-02T06:05:03.375290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:03.463988Z","title":"Leveraging ai models to enhance ac- cessibility with sign language in video streams,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:03.463988Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:e24e83d1eebdb17691df8511cb764de3b96fa3fa1695e9472485c3429d41184f","observation_id":"f0b30d2f-df7c-4130-b561-694aeb01441b","resolution":{"observed_at":"2026-08-02T06:05:03.463988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:03.522253Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:03.522253Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:deaf050f87e8d49a58f89a57f4d72a5551c853678e21e6d4f32aa1768cb45679","observation_id":"b391cdd6-f363-4e64-8281-decca231ea83","resolution":{"observed_at":"2026-08-02T06:05:03.522253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:03.684306Z","title":"Denoisingdiffusion implicit models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:03.684306Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:440cb335ecacbe609f1c0d7da361389e91fe2b997489f9ebdc94c5bf61791335","observation_id":"02320f66-2134-4a58-9a3a-8d2ef0702335","resolution":{"observed_at":"2026-08-02T06:05:03.684306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:05:03.793979Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T06:05:03.793979Z"},"links":{"citing_paper":"/paper/2607.13164"},"observation_digest":"sha256:b8a52b30721741e7296aab0c347dcb6cb14099b8ea157620bd71567cddb568f4","observation_id":"73ca746b-f6ab-4d68-ac9f-f950569fdf24","resolution":{"observed_at":"2026-08-02T06:05:03.793979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13164","last_updated":"2026-07-14T18:15:32Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T04:26:16.985642Z","submitted_at":"2026-07-14T18:15:32Z","title":"Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.13164."}