{"as_of":"2026-08-09T19:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4447782c8c1672904cab64a4676a912cae7e49ae199a54b8c32841e80d39f4d","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:18:12.550250Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01392/citation-record","integrity":"/paper/2608.01392/integrity","json":"/paper/2608.01392/citation-record.json","paper":"/paper/2608.01392"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:09.624279Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.624279Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:ce8d952840632767207aa53d1b7d4e8a464606b6d1eb815fae49765fb67ebef0","observation_id":"1d8eb615-bb3a-4df3-ba8c-b07aaedb640b","resolution":{"observed_at":"2026-08-06T00:18:09.624279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:18.428490Z","title":"Seamless human motion composition with blended posi- tional encodings","venue":null,"work_id":"a57945eb-dc22-4efc-a5db-a8ce7e0c6658","year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.694111Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:bcb4b970ed61f09ed591863b25ba0f8d69ad459a6a613fde5c5d3580187b2878","observation_id":"1e3ab1af-bc8b-4f09-ae93-eefb8c2ba092","resolution":{"observed_at":"2026-08-06T00:18:18.524741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:18.216470Z","title":"A cross- dataset study for text-based 3d human motion retrieval","venue":null,"work_id":"fed85bf9-117f-4497-83ed-0133b15c16e1","year":1932},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.761688Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:dd978efbedc320089bca482af60a51e705684ce08b7c01d8cdd7621dec7c4895","observation_id":"729720f7-9dcb-4e37-bb4f-45cc441c4bbc","resolution":{"observed_at":"2026-08-06T00:18:18.350693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:09.806437Z","title":"Is space-time attention all you need for video understanding? InIcml, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.806437Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:cc3a435a77413df18734276c642d096926b9b1d2a8de60d72990ef87a6b4a262","observation_id":"3f7840b3-31ac-44ba-a1e3-a313f6891a9d","resolution":{"observed_at":"2026-08-06T00:18:09.806437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.973207Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport.Advances in neural information pro- cessing systems, 26, 2013","venue":null,"work_id":"76d8b339-3e9e-4b9e-9e2f-619160877127","year":2013},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:09.916222Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:300de2187e6cc9720fe1bdd449341082a96f1e0ef186222dd17a2472dc01b365","observation_id":"110b8fd9-c88c-4d7b-a86f-4d4abafa473c","resolution":{"observed_at":"2026-08-06T00:18:18.086343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.768914Z","title":"Segmo: Segment-aligned text to 3d human motion generation","venue":null,"work_id":"31a5dbd0-493a-498e-b4a4-3916b044afd6","year":2026},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.011811Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:325b421951ce38181a8d6a1e712f2fbfd4cf63d54265f52b6426eb0c81221296","observation_id":"e1df4d46-a53f-4f95-8e51-83ea6a6c04b6","resolution":{"observed_at":"2026-08-06T00:18:17.845673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:10.101270Z","title":"Masked autoencoders as spatiotemporal learners.Advances in neural information processing systems, 35:35946–35958,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.101270Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:56146fb7e27151e9fe62ed76bd99fb364165dac26a29026ea128c4deef5eea2b","observation_id":"2d8e775e-2337-449d-bacd-e94edbb17081","resolution":{"observed_at":"2026-08-06T00:18:10.101270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.569235Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"3f87b8fb-3c0f-4753-a25a-aeed0d8a2beb","year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.184506Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:991b974aa717f1434e5f19dd58207d8797c71329320b791e8e31510ea96e9abf","observation_id":"9396af1c-2063-4a0b-af53-c00773747281","resolution":{"observed_at":"2026-08-06T00:18:17.689155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.347769Z","title":"Momask: Generative masked model- ing of 3d human motions","venue":null,"work_id":"bfc507a0-80a6-4827-96fd-76801b8e354b","year":1900},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.252169Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:bc452701e02d8a65130a8e1bb218ff6b171bc6aa15dc7c43ab04de26c4d7f7d4","observation_id":"a814d231-cf1b-4a36-a09b-b2ee7c0b31b5","resolution":{"observed_at":"2026-08-06T00:18:17.448771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:10.316066Z","title":"Snapmogen: Human motion generation from expressive texts.arXiv preprint arXiv:2507.09122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.316066Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:34616e435f53e41895da21601bfb69d3033d43cc288068b432cc5c79ce02809f","observation_id":"92145b61-a539-4f5f-bc8d-c4f3fe4662e8","resolution":{"observed_at":"2026-08-06T00:18:10.316066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:17.113085Z","title":"Amd: Autoregressive motion diffusion","venue":null,"work_id":"ea070812-2cd6-4472-8ca0-40ede198abe2","year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.394699Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:117d22d6646e82287921815adb4564ec35531612213122bfdecf32bdaf23ba1d","observation_id":"dd972f82-f165-447b-93fd-bb7817a4e9fc","resolution":{"observed_at":"2026-08-06T00:18:17.223219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.932212Z","title":"Como: Controllable motion generation through language guided pose code edit- ing","venue":null,"work_id":"2dfb2bed-3f46-4eb2-860b-86efd6129704","year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.457611Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:e6a35f9a62d2d695472e30e0d1450e35d3ddd4b5801cf99d1bc258956c6c102d","observation_id":"da7653cb-97cf-45b6-9b9b-a0f7481e01ed","resolution":{"observed_at":"2026-08-06T00:18:17.019348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.712553Z","title":"Motiongpt: Human motion as a foreign lan- guage.Advances in Neural Information Processing Systems, 36:20067–20079, 2023","venue":null,"work_id":"24ae9341-5902-43f9-ab73-d855ac63011b","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.511210Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:07e41d6fa1b0f7a10c23db6976761132295db8b515df75e35e5cb0522a22dfd3","observation_id":"4fbfc23a-42ea-4035-9321-2186955508ae","resolution":{"observed_at":"2026-08-06T00:18:16.826747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.476431Z","title":"Unimotion: Unifying 3d human motion synthesis and understanding","venue":null,"work_id":"37c6638e-04cb-4620-8f00-b50e1c340fb5","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.609319Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:4e122071759cdc71f831f7968ef2675e8386c016d58f574b00efda413c9b5d02","observation_id":"e9676649-5f43-4969-8a10-99ff725ef267","resolution":{"observed_at":"2026-08-06T00:18:16.656878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:10.686875Z","title":"Frankenmotion: Part-level hu- man motion generation and composition.arXiv preprint arXiv:2601.10909, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.686875Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:8bce94c8b2b761d46837ef29bf08957de2af76b39224fc2a9f026eb7af6515d4","observation_id":"b6e88d32-1981-45cc-928b-82dd243fa9dd","resolution":{"observed_at":"2026-08-06T00:18:10.686875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.354077Z","title":"Motion-x: A large-scale 3d expressive whole-body human motion dataset","venue":null,"work_id":"f8ba6f9b-0b8b-4d60-85aa-200145740ca6","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.779221Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:0b8a542c2291a77905d0469a6936b57df006264f868c2d49fa0da63559b59583","observation_id":"0baaaaff-ba9b-4d34-9537-72e342d8d4a2","resolution":{"observed_at":"2026-08-06T00:18:16.419404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16702","last_updated":"2024-01-30T03:03:26Z","snapshot_observed_at":"2026-07-06T17:22:15.248410Z","submitted_at":"2024-01-30T03:03:26Z","title":"Multi-granularity Correspondence Learning from Long-term Noisy Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16702","snapshot_observed_at":"2026-08-06T00:18:10.857069Z","title":"Multi-granularity correspondence learning from long-term noisy videos.arXiv preprint arXiv:2401.16702,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.857069Z"},"links":{"cited_paper":"/paper/2401.16702","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:744f9c27884d3eb1e617efa97dd2b5c1733768738ef18334a60bc9e7ab3b50c5","observation_id":"cabcb29f-76bb-468c-98c7-20dadfc5b32b","resolution":{"observed_at":"2026-08-06T00:18:10.857069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:16.138068Z","title":"Rethinking diffusion for text-driven human motion generation: Redundant representations, evaluation, and masked autoregression","venue":null,"work_id":"8e90c3e0-0501-484c-9f0b-605e744fc1a0","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.885666Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:df9b9ff6d071d89c3cc80ad1f2afbd46a73f60feb450a155a530a2873bdc2bfc","observation_id":"fc20a501-8fd9-45ba-8940-7ee9aff243e5","resolution":{"observed_at":"2026-08-06T00:18:16.238937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:15.852198Z","title":"Proposal-free temporal action detection via global segmen- tation mask learning","venue":null,"work_id":"0b2bbf0b-3451-4541-abc8-9aec6a72001b","year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.925323Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:515b45ea7347035091bcba1a270e768faf6e054df293edf6b94c1e1d91fbcda6","observation_id":"424881ac-e4b6-4324-a00e-6e48c5cc6a0d","resolution":{"observed_at":"2026-08-06T00:18:16.000195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:15.581998Z","title":"Tmr: Text-to-motion retrieval using contrastive 3d human motion synthesis","venue":null,"work_id":"2e6dc4ee-b0c8-4440-8a38-4cff2836b758","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:10.986515Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:452029f0d770ea8a72ba4f97c9d4137a06f030a57820c8645a341c3d9c5daf85","observation_id":"ecee7a8d-abd9-4d16-b5e1-d65c7a3ea633","resolution":{"observed_at":"2026-08-06T00:18:15.705738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:15.306503Z","title":"Now Foun- dations and Trends, 2019","venue":null,"work_id":"c90a1f0f-3850-4b52-b851-d747c46a79b1","year":2019},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.034615Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:0d53ad6461ebdfb8542b960da13d8690155eed08852c56899ecb84b6e57cab18","observation_id":"7fbdb2c5-6e48-471e-97f2-46202e197982","resolution":{"observed_at":"2026-08-06T00:18:15.475588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:15.083834Z","title":"Mmm: Generative masked motion model","venue":null,"work_id":"f6b166cd-6c75-498f-b66e-ee2db474b944","year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.074653Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:ea1efcbd09aa2592657fb8a3147466b4ccff69932321382eb98997b2674a3297","observation_id":"9a584c9d-c0dd-48e8-a5ec-be2e508a0d10","resolution":{"observed_at":"2026-08-06T00:18:15.162114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:11.165073Z","title":"The kit motion-language dataset.Big data, 4(4):236–252,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.165073Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:571424d5b1a48f36f000e465a89bc5646f4160169f336758c2bdd1d14bd08ca4","observation_id":"b977c382-ccef-4a8b-8949-22bc2cc3fab5","resolution":{"observed_at":"2026-08-06T00:18:11.165073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.871114Z","title":"Babel: Bodies, action and behavior with english la- bels","venue":null,"work_id":"deaa1eb9-6ca1-48d0-bfe1-bb44de4a8416","year":2021},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.246845Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:ae4bbf7b50ca4a279c82db741e5551f5613c63ad6dc5434da583f522125ae842","observation_id":"5d8d8fc0-93e7-4e91-b1d5-9a10e7a9f51a","resolution":{"observed_at":"2026-08-06T00:18:14.986967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:11.279566Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.279566Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:c3fcad57c9b968d429e87c3dcdaa46015909560b7bfe14f7165135a42d852e39","observation_id":"89c6b694-6741-4344-9dcb-dafa476b1c7c","resolution":{"observed_at":"2026-08-06T00:18:11.279566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:11.365326Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.365326Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:7260f95d9c95e69c776a98526cc06c85f6e83afd6579a01b53349839ba65af2b","observation_id":"b11f5059-ada5-4929-8cb5-585a11dee210","resolution":{"observed_at":"2026-08-06T00:18:11.365326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.668588Z","title":"Ot-clip: Un- derstanding and generalizing clip via optimal transport","venue":null,"work_id":"b4901988-7f43-40a6-9a62-a0a8c959ce0d","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.436412Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:4bf3c386b1838dff70f44098d170a2c29980cfa583f3353ae7ab61bd109acfa8","observation_id":"232ce928-4530-4ff9-bb09-b7e511c4dfed","resolution":{"observed_at":"2026-08-06T00:18:14.742352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-06T00:18:11.477503Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.477503Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:c9fa5e6bee63f57b25619703d115b5807e4765a02dabb1db1605b7b1858c6d74","observation_id":"6b0e7d07-a54a-420e-9339-8cf55db0588d","resolution":{"observed_at":"2026-08-06T00:18:11.477503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.487678Z","title":"Optimal transport on discrete domains","venue":null,"work_id":"cf5c7b19-8326-4490-9968-4dbff076b48e","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.529984Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:1440650bfee5ae43f7f72dd824449b226275d17f2d7bb3f439a68bbc4ed1b04c","observation_id":"ee65441b-8813-4b88-8777-29ae06394ff9","resolution":{"observed_at":"2026-08-06T00:18:14.580551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07320","last_updated":"2025-01-07T23:10:25Z","snapshot_observed_at":"2026-08-06T20:29:18.862211Z","submitted_at":"2024-12-10T09:08:41Z","title":"CoMA: Compositional Human Motion Generation with Multi-modal Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07320","snapshot_observed_at":"2026-08-06T00:18:11.588885Z","title":"Coma: Compositional human motion generation with multi-modal agents.arXiv preprint arXiv:2412.07320, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.588885Z"},"links":{"cited_paper":"/paper/2412.07320","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:6a2ba078ba83c3e8b6c335559a0f71f3577d7825d41dd2cc77b51f915f8909fd","observation_id":"c6481434-0f9e-4afa-9cc2-cdf53114e0fb","resolution":{"observed_at":"2026-08-06T00:18:11.588885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.318738Z","title":"Motionclip: Exposing human motion generation to clip space","venue":null,"work_id":"7075f233-bad4-42ea-b232-7321c05a3bb8","year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.647315Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:22c90b7adf7ebc4df9d6cfb36a76c4a3b4a6bf6a623d91f8d9ccb4621b7f1446","observation_id":"3ca679e8-3bff-47bc-a24a-7f0a4d873767","resolution":{"observed_at":"2026-08-06T00:18:14.464800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-06T00:18:11.728862Z","title":"Human motion dif- fusion model.arXiv preprint arXiv:2209.14916, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.728862Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:d7b47313629a7e39f0a2989b83c1d4a3e5532826075a8d370ecb09092fcf7f60","observation_id":"fcaeb8bd-9c66-4074-ae86-5bc2543f89f5","resolution":{"observed_at":"2026-08-06T00:18:11.728862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03311","last_updated":"2025-05-30T12:53:31Z","snapshot_observed_at":"2026-08-06T03:48:31.684275Z","submitted_at":"2024-10-04T10:48:54Z","title":"Scaling Large Motion Models with Million-Level Human Motions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03311","snapshot_observed_at":"2026-08-06T00:18:11.792396Z","title":"Scaling large motion models with million-level human motions.arXiv preprint arXiv:2410.03311, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.792396Z"},"links":{"cited_paper":"/paper/2410.03311","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:d9f215b4f27dd6cdc437b151d9fdfccad6d454b6aff0cf5ed6692f31046fa84f","observation_id":"3f702020-fa09-4a3d-a137-91d7442beead","resolution":{"observed_at":"2026-08-06T00:18:11.792396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:14.102301Z","title":"Mg-motionllm: A unified framework for motion comprehension and gener- ation across multiple granularities","venue":null,"work_id":"7d6f7376-8a78-4454-8de5-acdc062477b5","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.853616Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:803811eae3e4cd4f23feffe1ed0f1e81fba3db36be637a4f4c5b78d1c7f1fd96","observation_id":"f40afea6-d756-4ab6-bf7a-4babacb90ddc","resolution":{"observed_at":"2026-08-06T00:18:14.206099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.951475Z","title":"Dense motion captioning","venue":null,"work_id":"7239e40a-b1f9-4de2-975b-449bd21e7066","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.903996Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:58c483fb5b9ca13fa01b10b4cc6969dccb46c82f383aba1ed19d25dceafeb6f1","observation_id":"65b39cf5-8667-4a57-afbd-b6db884a8c0c","resolution":{"observed_at":"2026-08-06T00:18:14.014695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T00:18:11.969697Z","title":"Filip: Fine-grained interactive language-image pre-training.arXiv preprint arXiv:2111.07783, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.969697Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:13148476af2de19bdfd1b52807c0c5473a0586509dba68d516179058177a779f","observation_id":"f8392932-71c2-4c4c-acea-841098fe600c","resolution":{"observed_at":"2026-08-06T00:18:11.969697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.829746Z","title":"Generating human motion from textual descrip- tions with discrete representations","venue":null,"work_id":"1674281f-6a06-4e7a-aaf1-e619b5462aff","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.034560Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:314472f7ae0a8fe2894b9cc39ee5662aec0e247adefb9d42c9123c31ad91d593","observation_id":"c779391c-f27a-4d81-80ab-4fbcf11f13e8","resolution":{"observed_at":"2026-08-06T00:18:13.891286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:12.118757Z","title":"Re- modiffuse: Retrieval-augmented motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.118757Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:e192f3c75a46551bd4ce95a70e135034f84a39f33db69c9e2158b27bde9b6db3","observation_id":"f3756519-1f9f-4f69-b1dc-2a1634116f49","resolution":{"observed_at":"2026-08-06T00:18:12.118757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.679212Z","title":"Finemogen: Fine-grained spatio- temporal motion generation and editing.Advances in Neural Information Processing Systems, 36:13981–13992, 2023","venue":null,"work_id":"f3c5d3ac-02e3-4a1f-afe5-56fd5c895a31","year":2023},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.173471Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:08ea168cfb358b05e84fde92ab5ab350d856287700965c7d94abc8c391db44b1","observation_id":"b402e152-3973-455d-932c-1835a5056a43","resolution":{"observed_at":"2026-08-06T00:18:13.726895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.582798Z","title":"Pre- training clip against data poisoning with optimal transport- based matching and alignment","venue":null,"work_id":"9e0a7374-3e82-4fe4-810a-fd4e11f39beb","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.264675Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:17b27a5f625889958e9c7370c5ad43d93469fc583b73923c5b7fcc130b5419ad","observation_id":"8c455f42-98d8-4d38-b96b-1abb68d58607","resolution":{"observed_at":"2026-08-06T00:18:13.640874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.399308Z","title":"DartControl: A diffusion-based autoregressive motion model for real-time text-driven motion control","venue":null,"work_id":"6a28bec1-fe09-4314-8fa8-940105909618","year":2025},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.328454Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:a31d159813abcff59cd124c0537da4973f3b0d5192e27864269de4ccc64fb0a7","observation_id":"0973253c-3618-4620-86b4-6fcc9b32012d","resolution":{"observed_at":"2026-08-06T00:18:13.488133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.279190Z","title":null,"venue":null,"work_id":"1d9e28ff-804b-41b0-be3e-8a21c1d95b99","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.375527Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:5929d07a7c5ece8c53eaddda946ccdb8d84d5fa0c1f3edfbf2f1ea971c9656aa","observation_id":"79f73070-d566-43e8-923e-878b1e21a7e2","resolution":{"observed_at":"2026-08-06T00:18:13.339249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:13.124352Z","title":null,"venue":null,"work_id":"f3a6443b-9487-4690-8112-c0b4a15420d5","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.439527Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:f2f8e887a70e167469e3eb90a27da033a379fb2980f6b1fe326c84b8ce145e93","observation_id":"a6f6d641-ed17-44c8-8ab9-3f0f10634fdb","resolution":{"observed_at":"2026-08-06T00:18:13.215087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:12.997366Z","title":"The annotation process involves man- ual segment-level boundary identification: for each action segmentj, human annotators specify the temporal interval [tstart, tend]in seconds","venue":null,"work_id":"14b06c1b-2187-4a6c-bf2a-79098291ff4b","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.510219Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:98472a938ebd93c3f62a2060dc38fd1ca498447231e97a4cefc2e38aca1e7e9c","observation_id":"1845dedb-1e0b-4bd6-b0ef-58b78ec6c43d","resolution":{"observed_at":"2026-08-06T00:18:13.060514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:18:12.859717Z","title":"specialized human motion analyst","venue":null,"work_id":"afecc11b-5cb3-409d-9e9a-055603e974a3","year":null},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:12.550250Z"},"links":{"citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:13e40be7f4ae9f30994f803d15f9f8b35b100b59f07c3eac5cce30f85885b162","observation_id":"db1aac17-a015-43c4-a123-5f27eda79b80","resolution":{"observed_at":"2026-08-06T00:18:12.924197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.01392."}