{"as_of":"2026-08-11T16:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fac1b8a953d1d84098a227b6e9b9232921c40350e02a1fead995e0e703761b5f","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:48:35.417654Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23465/citation-record","integrity":"/paper/2505.23465/integrity","json":"/paper/2505.23465/citation-record.json","paper":"/paper/2505.23465"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:45.803970Z","title":"Face and Gesture submission ID 324","venue":null,"work_id":"99086962-f653-4066-9afc-2e1e6daeb3bf","year":2012},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:28.475958Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:cda32c84c958fca5c3e1f3e97df1a5366ee8632b6c6300f30a61b4aee94ff6fe","observation_id":"32ea3c2d-1d4b-4f78-b709-33f7b942f9ce","resolution":{"observed_at":"2026-08-07T12:48:45.895879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:45.507905Z","title":"Supplied as additional material tr.pdf","venue":null,"work_id":"a4752921-4eed-4c8b-86b4-87b550935819","year":2012},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:28.622104Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:314769fa3263fed02a4a3ff1b1573f82d329b1585eb0482c2bd5b647bd77fccb","observation_id":"09eb3869-5cf9-42c9-a6df-73b56eb0397c","resolution":{"observed_at":"2026-08-07T12:48:45.645751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:45.183956Z","title":"Alpher, Frobnication, Journal of Foo 12 (2002) 234–778","venue":null,"work_id":"5f14a99f-2c3b-4791-ab79-4810647ce386","year":2002},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:28.801236Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:b49ee0925a0f1660fe0b5dea6435854e4f7173ef73eea65a55f2be1abd244802","observation_id":"5f6d70bb-3eaf-4491-a527-19bdba68b390","resolution":{"observed_at":"2026-08-07T12:48:45.357202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.936078Z","title":"Alpher, J","venue":null,"work_id":"ae74fc6b-8f64-4fdc-ac8a-6156cc5d0320","year":2003},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:28.987467Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:bbe40c1813d7f9329dceb05df0ea84cef294f3a73e02f144a079a225b275ceca","observation_id":"9add43e0-9bdd-46c8-ab45-c8294a5369ea","resolution":{"observed_at":"2026-08-07T12:48:45.055520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.674672Z","title":"Alpher, J","venue":null,"work_id":"c7fb2696-630e-40e2-8e10-b4f4aab0f140","year":2004},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.160133Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:6044918212f0c87609be4136244fc973731a0b03cb2310038e40ef38bd245b30","observation_id":"571630ed-5f75-43c7-9d0a-4862a61d1683","resolution":{"observed_at":"2026-08-07T12:48:44.802769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.442302Z","title":"Goodfellow, J","venue":null,"work_id":"cf9679ef-59a8-442a-aaa0-6691362b4608","year":2020},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.328990Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:2ff74ce7b8f50c02b982deb3396b6b9423f38f178a04b7532f1c22857a0fd7e8","observation_id":"91abb601-e67e-4932-b726-f11d03afde80","resolution":{"observed_at":"2026-08-07T12:48:44.538082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T12:48:29.492325Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.492325Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:4e02fbc236db7ef37d63ee1080ccc862770ea2756d9254e48b8da826749ff6ac","observation_id":"1053191c-b1ee-4616-95c0-30ba3d8960cb","resolution":{"observed_at":"2026-08-07T12:48:29.492325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.243317Z","title":"Papamakarios, E","venue":null,"work_id":"7112d434-77df-4d80-9a35-113fa7e915d7","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.648535Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:5eb2e656dd82bab372811345afa6467038a6defd1140f387817478036192315f","observation_id":"3087725e-f0ec-4e11-81f7-3a4044a47527","resolution":{"observed_at":"2026-08-07T12:48:44.330433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:29.800564Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.800564Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:f5f16bc0b0afbb851ce86e52e1d58bf8a9025f62f438fa04ef39c987f7adcd41","observation_id":"54fcf793-6162-4546-ba8c-b3f21e134268","resolution":{"observed_at":"2026-08-07T12:48:29.800564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:44.022369Z","title":"Chang, H","venue":null,"work_id":"8cd10127-49c0-4bbe-af81-a9f3678a5c12","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:29.954331Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:c673f251178c449b0f33cc6bff8d960312413a4c3666946b8be15fff42fadd23","observation_id":"6942e70e-1ed5-40f8-bcc3-bd89581804a1","resolution":{"observed_at":"2026-08-07T12:48:44.118328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:43.738137Z","title":null,"venue":null,"work_id":"b969ff81-8fda-469d-af13-cdeac8ebe148","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.088460Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:606bfc4a21536026574baecc91d2fea9327ad5669da7015968ec37593d90251e","observation_id":"4248e582-5fea-43b9-b3a5-0fd9272746b0","resolution":{"observed_at":"2026-08-07T12:48:43.875932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T12:48:30.160886Z","title":"D ´efossez, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.160886Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:b6347a8364d362fcb2377cd3023f74d2e4bde2b37289a281252771f8b88e5a7a","observation_id":"6a9cd3cd-e234-42a6-9acf-1c8e595d7127","resolution":{"observed_at":"2026-08-07T12:48:30.160886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:30.266521Z","title":"Radford, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.266521Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:498adae48fc8c7a1893371832e9ed9dbff410b33c49c90b5a0f6dcc3167c010c","observation_id":"1aa6e636-9e9a-4f57-b861-655d40731fbe","resolution":{"observed_at":"2026-08-07T12:48:30.266521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:43.540445Z","title":"Girdhar, A","venue":null,"work_id":"39f96f9c-e264-4861-8f1e-b12928e8c702","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.361411Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:bb187f78aee989a6afc26aa90a0c67c3f7af3bab7d33e791ae5defb9619feb50","observation_id":"eae2489a-f3c1-4092-a69d-dee82b6cacb6","resolution":{"observed_at":"2026-08-07T12:48:43.630504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:43.258218Z","title":"Ahuja, L.-P","venue":null,"work_id":"5e41d2e1-f5cb-4cd9-8835-63f69b104d67","year":2019},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.466051Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:cb15e5ef1947afc03fbcdf2aee0ecf10e8e22a7e4b37ee3bca5ba798987daffd","observation_id":"d5478827-6875-4243-9fc4-d3a6fe27dfcb","resolution":{"observed_at":"2026-08-07T12:48:43.404961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:43.056639Z","title":"Ghosh, N","venue":null,"work_id":"ace7d65f-841e-4fc7-9612-be53d48cef52","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.566101Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:7b5f7c8f42d3cc8f3619e4d2e53dabe6e691af33db057b8c3cefe033de0856c1","observation_id":"06c43946-dbff-451c-8bdd-c76a56a7007a","resolution":{"observed_at":"2026-08-07T12:48:43.128688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:42.889442Z","title":null,"venue":null,"work_id":"407cff81-254f-4fdb-a21b-101ec529643d","year":2018},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.698912Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:0b2372af51fee517a1b5cb82490bb846917e78414a6d0515264cc5860a290a20","observation_id":"d2f488c2-7cdc-4250-8b11-bfcfc665a08c","resolution":{"observed_at":"2026-08-07T12:48:42.989154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:42.668391Z","title":"Tevet, B","venue":null,"work_id":"5981c2b0-c1b1-4f45-963c-491e9a3cd438","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.798418Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:c4aafa2870db739d9e7e8a779b206ecffde50661359c749c6c3e897bb2866fe6","observation_id":"af585d36-9fe9-46fc-8bbe-dc78a6ffd446","resolution":{"observed_at":"2026-08-07T12:48:42.762837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:30.897496Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.897496Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:150371d54201b02db2a2c7244ad983bddbbed5745cfc0ebccda7df0d6c2e8ce0","observation_id":"482d63e1-fde6-4753-8e85-cdae8d56b253","resolution":{"observed_at":"2026-08-07T12:48:30.897496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:42.434489Z","title":"Petrovich, M","venue":null,"work_id":"fe53feba-59ff-4190-bd8b-27bd1f86d3b3","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:30.987703Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:dcc905dc376a536bbe65d7efcf0d1d129e43529e0610b29398f60e583581fe8d","observation_id":"d2c80da4-0b32-4e74-a9b5-a579fbf2b6dc","resolution":{"observed_at":"2026-08-07T12:48:42.561607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:42.112979Z","title":null,"venue":null,"work_id":"dab31dcd-a3b3-4611-afe5-b90f5a2208da","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.061745Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:603f4198b179617cdf11667360c8fd5a8fb510aa9491f17f18481b3eaaa91d74","observation_id":"5644ff68-8094-484a-9fc0-758237eb7400","resolution":{"observed_at":"2026-08-07T12:48:42.275713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:41.793615Z","title":"Van Den Oord, O","venue":null,"work_id":"067bc1a8-3b84-47ad-86df-55ca7a482a6f","year":2017},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.180120Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:d7ad6ea3940711bcb5c6b1304dceca588bea3ef2568c440128c5b18f5255ed94","observation_id":"ee16f271-7365-421c-a09b-a91473a812b5","resolution":{"observed_at":"2026-08-07T12:48:41.936835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:41.515608Z","title":"Zhang, Y","venue":null,"work_id":"0122185c-13c4-4dc6-a02c-298441ec485b","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.325999Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:572850610bb296351c9eaaf05e7b3f9986552ec1923d266a65ecfb83aaaef793","observation_id":"2824cac4-861a-4fb1-9ec8-5487c4d6068e","resolution":{"observed_at":"2026-08-07T12:48:41.666554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:41.289026Z","title":null,"venue":null,"work_id":"e957ec12-de7d-4840-b7d1-5e1278074ff4","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.434958Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:18beb5daf8089317e405bf8252005093530db0ac6d4aa2b46b3f3a19c70f057b","observation_id":"baa0919b-2b35-4071-98b9-fac8c4b39bc6","resolution":{"observed_at":"2026-08-07T12:48:41.425016Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:41.100909Z","title":null,"venue":null,"work_id":"3387727b-832a-4988-b37d-a69132418ddb","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.550668Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:227eac84982cb4bf49fbf289b564d650e287678ad6b9f81a976977a999bed8d7","observation_id":"b57385e3-066f-474e-b9c2-18fcd60d4e48","resolution":{"observed_at":"2026-08-07T12:48:41.185407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:40.808153Z","title":"Tevet, S","venue":null,"work_id":"c8642e10-3a8d-40e5-a46e-5d20512fca6b","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.634605Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:cfb2c40e712ac9fff8815eeb9490e067edb9953ef64c8c75616fcfd9adfb8531","observation_id":"4d4d9b23-19f7-4a6f-8fdc-39aa9a80b8cf","resolution":{"observed_at":"2026-08-07T12:48:40.884976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:40.590183Z","title":null,"venue":null,"work_id":"375cf241-cd25-4515-9b27-d791fb6bb4fb","year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.718916Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:bc5bd31f8148ba75652d8932926677e9b11c4e2ca0e9ad0dcbe7c5c268fe9ed0","observation_id":"8e14ddc8-8658-4dc6-9160-fe9d75bb9825","resolution":{"observed_at":"2026-08-07T12:48:40.709463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:40.426471Z","title":null,"venue":null,"work_id":"bbd4293f-0524-423b-8ac3-d1505019870c","year":2018},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.809836Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:0f55e983682ace7927d99906ab76123124a106a845300d3ab720af61b0e219d0","observation_id":"1069b9bd-058c-481e-8a86-5634ed7d0af0","resolution":{"observed_at":"2026-08-07T12:48:40.488448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:31.883626Z","title":"Graves, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.883626Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:db824002b79398003d7c3d40dc51a9f2f7138c51617a1b7658e536693eae277c","observation_id":"a9ffa00d-bce2-4edf-b00c-60196d91084a","resolution":{"observed_at":"2026-08-07T12:48:31.883626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:40.173650Z","title":null,"venue":null,"work_id":"f403aa6b-2380-4333-b8bc-fce3d6f0763f","year":2019},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:31.971558Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:72dd117a10f3ccbf383180569252b1823c77b2e60757a78a5fa1407341786f20","observation_id":"258f33b0-1b12-4cb0-8463-8e8c337d3e64","resolution":{"observed_at":"2026-08-07T12:48:40.302430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:39.959850Z","title":null,"venue":null,"work_id":"d9584b53-45db-467e-9a67-5ea462839bc4","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.068432Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:0a3fd160c876cee8e1610c4e5ca7fc8ab89f0d868b4982aab9a3a3d901b7d54d","observation_id":"522548e9-1524-4174-b9d9-d0ea74f62182","resolution":{"observed_at":"2026-08-07T12:48:40.059721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:39.677052Z","title":"Ginosar, A","venue":null,"work_id":"bd614055-996c-4350-aef4-97d630aece80","year":2019},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.160091Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:437c88f52c556a85e7c1125fb49266ca2db925ff1b5668e4e30b5dad84c07496","observation_id":"6b8da444-74b6-4f75-a988-22f71f73cf3b","resolution":{"observed_at":"2026-08-07T12:48:39.863747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:39.425397Z","title":"Kucherenko, D","venue":null,"work_id":"8e1a529c-9117-46fa-9040-5106e635a575","year":2019},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.270079Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:1a51e2fa95bb8fda4f4a90cb8b81d2f0cce8907e4db2d63c12e878f103305f36","observation_id":"1519f6cb-080a-48e5-b5e1-67c166db0ba9","resolution":{"observed_at":"2026-08-07T12:48:39.574575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:39.043231Z","title":null,"venue":null,"work_id":"94725fa1-55b7-491e-84fb-e08afaaa71a3","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.425973Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:4f9703f8b323a8877c1f9a941f0e0c8d3bc56ea7249d5d7e5d74992c53d6c70e","observation_id":"07e75fe4-3023-44a0-9e9b-898b939246a3","resolution":{"observed_at":"2026-08-07T12:48:39.215381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.869521Z","title":null,"venue":null,"work_id":"d53d2bc8-aa27-42ae-bcd0-9698a01b2c67","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.540551Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:c0677b02596cc2d195031947aed6a564a3eaa88936ce051576a2014a620e7dc6","observation_id":"7f0b348c-4e5d-414a-a9dc-1c698408088d","resolution":{"observed_at":"2026-08-07T12:48:38.951268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.666789Z","title":"Borsos, R","venue":null,"work_id":"14ba0e8f-ebe2-4a82-9a26-1afb3f4c42c0","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.704523Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:bda2d5380429198ca8dbc51cc5f38521f89fd4a7d1b26d9e49793aa7fe58a240","observation_id":"e7c08a5b-d4ce-4f01-96c2-a1114365cc99","resolution":{"observed_at":"2026-08-07T12:48:38.770763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:48:32.844410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:32.844410Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:87241d68e0209f747b7916f0e06445d36e8cfe88c444f825dd15cb95a64cdf11","observation_id":"5d732dd6-0347-4f66-9bb3-9698cf1fa76d","resolution":{"observed_at":"2026-08-07T12:48:32.844410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-08-10T19:02:23.351550Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-07T12:48:33.068807Z","title":"Betker, Better speech synthesis through scaling, arXiv preprint arXiv:2305.07243 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.068807Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:e5eee6a9c285ee77850e57d7dea41e39674785d10519dea99635738492716f66","observation_id":"9951754c-b7b0-4e2a-9983-da0f89676296","resolution":{"observed_at":"2026-08-07T12:48:33.068807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.501481Z","title":"Plappert, C","venue":null,"work_id":"657a78ec-fff4-4005-ad86-7e870e32de47","year":2016},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.301703Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:0e675bf65e8d170f064d639e3624f5a0f4a0193d4954a28e807c0c4891e927d8","observation_id":"7f156e53-90cd-40df-979c-ebd5d1ef1455","resolution":{"observed_at":"2026-08-07T12:48:38.590821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:33.462793Z","title":"Vaswani, Attention is all you need, Advances in Neural Information Processing Systems (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.462793Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:d20ca067de89f9c6cf999991902d09cdd36b9af3e860609bc284d0e2d46b3be0","observation_id":"0fc1d520-aae1-4238-8358-a83a245b3a88","resolution":{"observed_at":"2026-08-07T12:48:33.462793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-07T12:48:33.623830Z","title":"Jiang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.623830Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:75958a750641274f1e8a8307a0dc9066ba2c687db5179e0efd2681def5543983","observation_id":"80a0caee-1176-4f7a-9ba9-c988ee5e6f94","resolution":{"observed_at":"2026-08-07T12:48:33.623830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-09T16:31:06.714132Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-07T12:48:33.768138Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.768138Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:37043cf990f6d6626b17944585e2a0c79006d19f6e07595b71e97b9d144ac31e","observation_id":"64a5c0d7-4d35-44c3-a43e-fa2a2e0ab991","resolution":{"observed_at":"2026-08-07T12:48:33.768138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.324776Z","title":null,"venue":null,"work_id":"b7ba1865-0d4f-482b-92e8-5432e010a03a","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.936843Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:7ba750915eb317e9325c521c0a18d136fae766e2c7bb0a5bfb041411975a3483","observation_id":"24371080-31e8-4dda-bd68-7f4ddeba936e","resolution":{"observed_at":"2026-08-07T12:48:38.396233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.170843Z","title":null,"venue":null,"work_id":"7b8e95e3-9236-4e4d-aa17-42d1b01a74ea","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.087078Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:4add9c79776ce914b0e31f2cb083eab7995fbbe61cf6bb299b6aa7bbfd049776","observation_id":"94042ffc-8e29-4b14-bfb8-297c32c71635","resolution":{"observed_at":"2026-08-07T12:48:38.245274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:38.009787Z","title":"Zhang, X","venue":null,"work_id":"e2755b31-7b42-4fd5-bf01-1269791dea23","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.192711Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:341c056bded9bf2d88963d7f5c141eae770de25157485fd1e761728bb6c53717","observation_id":"604e0350-9459-494a-92e2-eda1eacc011b","resolution":{"observed_at":"2026-08-07T12:48:38.088696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:37.708278Z","title":null,"venue":null,"work_id":"519992a7-27f8-428d-91b2-7f4821e0a503","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.278339Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:97c8648a26264dca1544cdc65e7ab273dffbc72b28350b8ac1910d70e61ec9aa","observation_id":"2676b814-a22c-4953-9389-e0c63c9537f4","resolution":{"observed_at":"2026-08-07T12:48:37.855229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:37.386402Z","title":null,"venue":null,"work_id":"30d53d34-4b36-45da-9c42-ba22c74bb1cf","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.456483Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:0d2fc428b34405d935385392179b4bb0d1e3e752fb3226cfaa7490423035a021","observation_id":"ffc36118-95dd-49b1-b241-3d57952f7dfa","resolution":{"observed_at":"2026-08-07T12:48:37.500603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:37.082519Z","title":"Dabral, M","venue":null,"work_id":"da545fd2-92e6-413b-9810-1b79b4cfd4dd","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.611123Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:a1a452cec5f823c9693c36d032bcebf49ff5ca1c1554bc30a13f5a8fb44aef98","observation_id":"9ebbe528-828b-4028-b70f-ff871db71a68","resolution":{"observed_at":"2026-08-07T12:48:37.226424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.790974Z","title":null,"venue":null,"work_id":"34c81768-d6b6-499c-93c2-eb871e49fd09","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.684759Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:75c6fc14d4758378898ed1f048b06b47305544d38d14f0a4ca46d7c79ff96030","observation_id":"296db859-b2e7-49df-9a39-1b8b8f92e549","resolution":{"observed_at":"2026-08-07T12:48:36.932038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.540260Z","title":null,"venue":null,"work_id":"91f7fd41-a4e3-49a1-bd79-065afa11eedd","year":2021},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.786104Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:3afc13aea079e8ae9e24e38d44a91ce1be1ef947d5ae73cb914159821ca28722","observation_id":"a044f2f2-a95e-47aa-a8a6-957c1c9e9e49","resolution":{"observed_at":"2026-08-07T12:48:36.625489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.375387Z","title":"Zhang, T","venue":null,"work_id":"f5d18907-f001-457e-8280-90c69d9f3953","year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.870144Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:d06dfe12608ebf9e979d0ca5d2ed58c524ea6a203da730366e9accdb0db74ae7","observation_id":"07626d1b-0423-4bbc-9ab3-aabdb5e0afa8","resolution":{"observed_at":"2026-08-07T12:48:36.456265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T12:48:34.974938Z","title":"Devlin, Bert: Pre-training of deep bidirectional transformers for lan- guage understanding, arXiv preprint arXiv:1810.04805 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:34.974938Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:4233e025e804e44d40dfd6bd6cf9b1e220eb45d14414941877399d465733c15a","observation_id":"ab6206b1-2297-4c0a-b10d-8448da4298e8","resolution":{"observed_at":"2026-08-07T12:48:34.974938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T12:48:35.069080Z","title":"Chang, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.069080Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:34f8f958a178b96e0bd3a1482dde72c6fbd7ebf359558e9ed9b776c43ec20462","observation_id":"f51b3af5-c512-4de2-977c-a437fe25ccf4","resolution":{"observed_at":"2026-08-07T12:48:35.069080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:35.160866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.160866Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:520fee6548e2a30e2e0d4eb442e972d1e265520270a741e6949101d2adf6136e","observation_id":"32aeb13b-a4f7-4ef5-b82d-b793e9dca5e7","resolution":{"observed_at":"2026-08-07T12:48:35.160866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.178677Z","title":null,"venue":null,"work_id":"c898fcf2-1192-4147-b21d-add303c2415b","year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.228773Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:356862032c27a45c351915a6613c9c696e6bfbcd3562aab7fd02103e762efa68","observation_id":"e589bee9-b1e2-47af-93ce-f14663d2fff6","resolution":{"observed_at":"2026-08-07T12:48:36.274151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:36.008799Z","title":null,"venue":null,"work_id":"cc40cd8e-a3b2-42be-8f69-885c6954a210","year":2022},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.315875Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:9244974a89e763acaee207a843c13d2a3abbced2f82649b33fecab17cb45c0a7","observation_id":"6b04e5b3-6223-4ba1-bab1-cbec05d3fff3","resolution":{"observed_at":"2026-08-07T12:48:36.095689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:35.808401Z","title":null,"venue":null,"work_id":"eb737aa0-5df1-411d-b774-fb40c34e22d2","year":2024},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.417654Z"},"links":{"citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:809e941349ce4d3aac189ca2d930341aeedf83f670515bdbc9c4677686d270e4","observation_id":"eb6641f5-fd8b-49db-91b9-88f21d3b7ba4","resolution":{"observed_at":"2026-08-07T12:48:35.904153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2505.23465."}