{"as_of":"2026-08-10T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f10434575fdfbdf04cb1072a03eb59c43c7f81a27ae0f3343e811ee963851ce","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:07:20.190660Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.23188/citation-record","integrity":"/paper/2507.23188/integrity","json":"/paper/2507.23188/citation-record.json","paper":"/paper/2507.23188"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.064139Z","title":"Dual stream relation learning network for image-text retrieval,","venue":null,"work_id":"e48a0388-bb2a-438e-b20c-98295d41c3b3","year":2025},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.917710Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:ba1c73a614d37f4ebca81d69984007a055789d496fedc6a9f6950271b8dddcf7","observation_id":"c3d0d4c0-abe6-40c1-825e-40047a55204f","resolution":{"observed_at":"2026-08-06T11:07:21.068747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.048528Z","title":"One-shot human motion transfer via occlusion-robust flow prediction and neural texturing,","venue":null,"work_id":"198eaf62-39ad-442f-a2fe-cd1f77242c12","year":2025},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.922972Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:aae082c143200f9494b5b9b846314f282558f0d5b8cc00f3f2b8fb075eb22db3","observation_id":"6d2d2a13-d0a9-4b2e-b8d1-c2da8f8b414c","resolution":{"observed_at":"2026-08-06T11:07:21.053234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.033175Z","title":"Ta2v: Text-audio guided video generation,","venue":null,"work_id":"96319e8c-3e14-4e28-a7d6-4867c17a447c","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.927797Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:2790e89e3875e6d13daef84ce73652de6f69eff5627bcfe78a5dadc0ca53db72","observation_id":"7ceb4654-f82d-4be2-9590-087d0ae274dc","resolution":{"observed_at":"2026-08-06T11:07:21.037886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.017945Z","title":"Cross-modal quantization for co-speech gesture generation,","venue":null,"work_id":"83746d8d-1bf7-47b5-86cf-d3fb53b4b10e","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.932734Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:ff6aa1d3dfba15723f2d0d9da811d13901c2cb9e9e14ba17f8b4b9fbb5fde589","observation_id":"ac0208f8-bb09-4692-a9a2-d32d9ba81178","resolution":{"observed_at":"2026-08-06T11:07:21.022470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:21.003098Z","title":"Generative adversarial graph convolutional networks for human action synthesis,","venue":null,"work_id":"38e33300-b292-445d-8669-35fc82676abd","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.937380Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:5ff4fe9ef23c5698406ef8e7b5f9de87d3f5c565e99599ca25c0b0fbb1d6cedc","observation_id":"d7739b76-5e27-4f66-bc15-a47e715def06","resolution":{"observed_at":"2026-08-06T11:07:21.007627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.988501Z","title":"Action-conditioned 3d human motion synthesis with transformer vae,","venue":null,"work_id":"f29172cf-7180-4633-9e32-a749a709239b","year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.942055Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:5caf6423e86fa6d8a46dafabb4a790bc04563c8156a54110c373b2f289b27755","observation_id":"522a19a5-af03-4a68-9383-3fd6bc0db884","resolution":{"observed_at":"2026-08-06T11:07:20.992982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.973345Z","title":"Multiact: Long-term 3d human motion generation from multiple action labels,","venue":null,"work_id":"f33217de-88da-466c-9ef9-046731b31780","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.947230Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:80ab9c2f24a12328c2514cdaf2d4854381271cd73c3a900609c59224c80c9ec4","observation_id":"a865e48a-ab43-4969-8c7d-b0be2125ced4","resolution":{"observed_at":"2026-08-06T11:07:20.977904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.958449Z","title":"Executing your commands via motion diffusion in latent space,","venue":null,"work_id":"31f096a2-e150-4435-87ef-e05154219b4c","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.951851Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:8168adedadfe82810797465eac4b6b232e5982ee77a1e86817e314a57e957a49","observation_id":"49b08ef6-91b7-48c6-ad88-c94983e8c4f1","resolution":{"observed_at":"2026-08-06T11:07:20.963097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.943221Z","title":"The kit motion-language dataset,","venue":null,"work_id":"8ca0c840-67f0-4084-929c-681d7dff3e9c","year":2016},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.956741Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:6aa369552e179de0d009d12b43d34bf6ccec300428cda8d5d0d046099936f3f1","observation_id":"01d81e7a-032c-4844-8915-e6e7ae299068","resolution":{"observed_at":"2026-08-06T11:07:20.947896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.928281Z","title":"Generating diverse and natural 3d human motions from text,","venue":null,"work_id":"0f7668ea-d265-40a1-945c-cc1fddc72f4c","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.961155Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:95b40b3569f531b3616ddf53df73652444b8fad45d2beffcd4af88625ad610a2","observation_id":"095dfe23-4e48-47f8-9e90-2b6f8acdda8e","resolution":{"observed_at":"2026-08-06T11:07:20.932758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.913717Z","title":"Human motion diffusion model,","venue":null,"work_id":"69c39c66-7a24-46f2-92d2-65f9f2ab6a6e","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.965631Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:f13571adc5ec0f5342b05306fc9e1d948acf68b9ad2e4b4d6566e63711016cb4","observation_id":"227eaee2-97e9-449c-a7c2-4ab8269e7e2f","resolution":{"observed_at":"2026-08-06T11:07:20.918269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.897988Z","title":"Generating human motion from textual descriptions with discrete representations,","venue":null,"work_id":"b8e2f771-a232-45f9-9576-ba4af75191d2","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.970336Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:159fd7ed4098c50a5a6f41cc424740e75d34fff17f4d5a0ab711b0da12342af5","observation_id":"e0e44298-732d-4cc5-b0ba-bed362a7e0a1","resolution":{"observed_at":"2026-08-06T11:07:20.902943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.882733Z","title":"Groupdancer: Music to multi-people dance synthesis with style collaboration,","venue":null,"work_id":"07dd0bc5-3f09-4b5d-b623-dbd27a8601a5","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.974905Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:fd94b596126c30bd66c82942fa4fda08de4f92c1e46a1c74e0263c9069b03855","observation_id":"36c58672-c52c-481e-a62c-dc7cb2ad78ac","resolution":{"observed_at":"2026-08-06T11:07:20.887444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.867571Z","title":"Music- driven group choreography,","venue":null,"work_id":"2928cf3c-c4d1-4bfe-a9a2-5bcefa92b806","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.979443Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:d365e6404ecd41c503c9044d4e264c40d321912946b2a0b24a8cce808ddb3fb2","observation_id":"743646df-9965-40b7-9484-63b14329913c","resolution":{"observed_at":"2026-08-06T11:07:20.872221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.851907Z","title":"Edge: Editable dance generation from music,","venue":null,"work_id":"e8ef5fca-656a-4614-8edb-0822c9375a62","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.984111Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:bc66ef8d729826d676eaeac61e5a43b0e5baf62025302fc4e714f52435dae897","observation_id":"c150045f-27fa-4875-a74a-f66c9598bc86","resolution":{"observed_at":"2026-08-06T11:07:20.856766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.836777Z","title":"Pc-dance: Posture- controllable music-driven dance synthesis,","venue":null,"work_id":"d9d756f6-5f05-4181-85e5-4eea1707fb89","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.988790Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:1e9047ed1f06639246d6914acfdb7e401a0f546ac378906233b29d07afcc71bc","observation_id":"d56ec5b9-7cc4-4c18-b93d-4e9ab369e531","resolution":{"observed_at":"2026-08-06T11:07:20.841247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.820400Z","title":"Couch: Towards controllable human-chair interactions,","venue":null,"work_id":"841e56c7-dffe-4480-a618-77f4ec2d5af1","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.993269Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:48d21beb4b0adae39678d825d937cd378652d93c31e7d76927d9efa05f4c10b4","observation_id":"0abead2e-3c61-4f25-aff1-009e29565489","resolution":{"observed_at":"2026-08-06T11:07:20.825215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.805054Z","title":"Goal: Generating 4d whole-body motion for hand-object grasping,","venue":null,"work_id":"ef17972b-ecb9-48c1-b829-19da516e10fd","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:19.997850Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:7467ffd10cf2a44772ffeec5fdc135b3741ee10d45adec32e25bf682224c7689","observation_id":"a509508f-d436-49c5-983f-9de104d75d41","resolution":{"observed_at":"2026-08-06T11:07:20.809687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.790702Z","title":"Human motion generation: A survey,","venue":null,"work_id":"ec03ea3e-7b8d-4798-903a-502b23e3e957","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.003279Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:8105b357ac8cfabfef1d4b25f899d53fc196df831f31df32fc4f3d284b240fc9","observation_id":"86592244-b176-4903-be80-4943ac117cde","resolution":{"observed_at":"2026-08-06T11:07:20.795219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.775947Z","title":"Phase-functioned neural networks for character control,","venue":null,"work_id":"72ba2f3a-8f9f-4614-a405-3dfe4c69d57d","year":2017},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.009756Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:259b58e344eaf63c4797afe69ae61c4225eac327e89e7a80c2341845b9018737","observation_id":"6e0bc659-6b8e-48e9-878f-c6b549566402","resolution":{"observed_at":"2026-08-06T11:07:20.780450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.760635Z","title":"Learned motion matching,","venue":null,"work_id":"435dcfb4-b080-4dfa-8a50-a1a7c9d68273","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.014500Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:85d3cdc367961def951dcf7e5bef65401b20147d40dd5b7d355ddcaad9c408ae","observation_id":"0b5a84df-0c83-4c98-bc86-5774b7ba02bb","resolution":{"observed_at":"2026-08-06T11:07:20.765128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.745942Z","title":"Tmr: Text-to-motion retrieval using contrastive 3d human motion synthesis,","venue":null,"work_id":"5d341c73-e1f7-4092-9f25-083431f6a93f","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.023014Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:4e3554646426a31cb4177cc8e765f9f9410ddb6b1f042f219429e7ac2c7e3440","observation_id":"d0429251-a731-407a-bc5d-e9b12eb55dce","resolution":{"observed_at":"2026-08-06T11:07:20.750358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.729609Z","title":"Tri-modal motion retrieval by learning a joint embedding space,","venue":null,"work_id":"0c3cd754-4c21-4df4-b66c-741a53d14103","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.028116Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:160eb8715731a02b4bfc8e22e5fc1800f185a5e78031d932d2cb0b615369d29f","observation_id":"46e64a69-2467-4b76-8040-8d643eca10fd","resolution":{"observed_at":"2026-08-06T11:07:20.734968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T11:07:20.032813Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.032813Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:930a29be73a5b7c51a4974ff741caa8fad764a31d6ea2fe24cce5557937190f1","observation_id":"af304b00-2e5b-41c4-a3b6-7ff024a44696","resolution":{"observed_at":"2026-08-06T11:07:20.032813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.711540Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":"44539034-6091-424d-a6f4-47646a490681","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.039109Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:ecd4e6691bc4e086431ae197cfb705b999bafda2b518ae02b4dcede1af3d5b24","observation_id":"cbaf0f20-03b5-457b-ac6b-7415c8d21989","resolution":{"observed_at":"2026-08-06T11:07:20.716915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-08-10T19:02:23.351550Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T11:07:20.044506Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.044506Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:f1fd3aeb3e6e0ac21c4326d8fc0d458e89a84be19804b5ac80c882f88a728fa4","observation_id":"980f1468-0f6e-48d7-bd95-59f812a4ea20","resolution":{"observed_at":"2026-08-06T11:07:20.044506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.695116Z","title":"Motionclip: Exposing human motion generation to clip space,","venue":null,"work_id":"91f08dc5-edbd-47b6-99cf-579b6bcd3747","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.051712Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:299c190a4c652c68f069c4f007962c305a9c3973dd90a96093504c624ff2fd38","observation_id":"0e4cc8ae-f314-40d2-8d38-0f7fa9a0b957","resolution":{"observed_at":"2026-08-06T11:07:20.699757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.679890Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":"c8b010e3-f80b-4692-91a9-6af0693b4e20","year":2014},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.059703Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:db595cf55e5fab1d32b003059d08999e3f4573bead7e1eb0853e7c12cf6369d4","observation_id":"5d148ccc-0ace-447d-a638-ecab485f4080","resolution":{"observed_at":"2026-08-06T11:07:20.684212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.665298Z","title":"Temos: Generating diverse human motions from textual descriptions,","venue":null,"work_id":"d60364cd-9b61-43a6-bc8b-b00fd9d8536f","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.064485Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:5a57584bfe3ca7e5526315887f986a3f2bd2f00df18dd5e282ab34382f86841b","observation_id":"9f74b422-15a8-4075-b93f-212138c3eea6","resolution":{"observed_at":"2026-08-06T11:07:20.669620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.650605Z","title":"Tm2t: Stochastic and tokenized modeling for the reciprocal generation of 3d human motions and texts,","venue":null,"work_id":"ab5654d1-03bb-43d7-800a-c364644c1be8","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.069062Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:df12da80287a01a1058f6a8fb82bb5a5bb3ad4cf4f05e2c14d97c9cf0d8f694a","observation_id":"a1d28c1c-9ff6-4dae-8c36-96221fdfd196","resolution":{"observed_at":"2026-08-06T11:07:20.655016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.635571Z","title":"Neural discrete representation learning,","venue":null,"work_id":"ad7390bc-9ada-412b-9405-433f07dc1b1b","year":2017},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.073904Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:a66e4c2d8f0b88702ba69b925d800c8d1c30406cbf4289166ecd56fd2b3a0c68","observation_id":"cc001b1f-5078-4bf3-8b27-61411de93679","resolution":{"observed_at":"2026-08-06T11:07:20.639950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.079034Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.079034Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:1c33f6f7e332eeed9cb2a335963394835f6869ca9ff21e7981c6e3db19d74d41","observation_id":"7d1a1a47-e705-484a-aa53-034314937976","resolution":{"observed_at":"2026-08-06T11:07:20.079034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.610456Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":"0351a7c0-c956-44aa-b241-962259cba2ad","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.084405Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:0055bfec6a8413db65dc07b767b0ff47e4c4ee07b97b956ee9380d194aa558db","observation_id":"6f22fbf2-7921-43ad-98df-5f01da09ceb6","resolution":{"observed_at":"2026-08-06T11:07:20.615160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.595672Z","title":"Global meets local: Dual activation hashing network for large-scale fine-grained image retrieval,","venue":null,"work_id":"c56342ad-9a2b-4e9a-9d85-1ffe13e559f3","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.089655Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:0fd27da4da7246dad3288702e1e9dfc6eff63a39b3189bcf9bb7fb5540834681","observation_id":"801e400f-3c78-4cc2-8d11-48671b98f329","resolution":{"observed_at":"2026-08-06T11:07:20.600313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.581385Z","title":"Dvf: Advancing robust and accurate fine-grained image retrieval with retrieval guidelines,","venue":null,"work_id":"8558cba9-0b2f-45ed-be4d-3d821be652ff","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.094537Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:4e160a824f5d6b5698f00de85703fef2d072a5194343afcecd11db154df4a032","observation_id":"085ce84c-cda7-4bf3-a71f-3ed7e673b97b","resolution":{"observed_at":"2026-08-06T11:07:20.585697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.565527Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"7ba6f9dc-0661-4b0f-b74e-ec30f978db8c","year":2019},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.099676Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:a189cff285c74378ba762aa0d5e3cf7317b9c6f7863bbb8db6f267f218bfa7e9","observation_id":"3ecb2ba1-991b-4672-ae3d-88e04a36b54b","resolution":{"observed_at":"2026-08-06T11:07:20.570573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.549742Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":"d4ea25c9-ccee-47ee-899d-63e5d910b76c","year":2019},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.103973Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:edde112dba66a26cc0941ca578b3a8deb8a85a8c89d00de9f73024b2ec75e2f0","observation_id":"6d3d0b5d-d03c-4756-a1dc-c42c77076b7a","resolution":{"observed_at":"2026-08-06T11:07:20.554167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.534903Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"fc0b7e15-987b-4c93-967c-e24b2f6dc0d8","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.108193Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:8bb77c87bfe40d061c01c071c81c13bf13158fdc063b0b3b90c47833f9373572","observation_id":"982ee88c-1a82-46ff-b814-f8c92ab31047","resolution":{"observed_at":"2026-08-06T11:07:20.539447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T11:07:20.113044Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.113044Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:a6eeb682c6b52f48ac020a5566cf65b2689a2dd6133e3bf99e992722fe012539","observation_id":"c0871aeb-5f63-4cab-af47-1f51f2579950","resolution":{"observed_at":"2026-08-06T11:07:20.113044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.519162Z","title":"Audiolm: a language modeling approach to audio generation,","venue":null,"work_id":"bad02df0-6dbe-43ca-a9c5-efb6293d57ba","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.117704Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:9c6ce8b28a9e8334a6324555779ab45764012979170dff0473d05f50986cffa0","observation_id":"b59dbc53-86c7-4293-8276-ac490fdaf30c","resolution":{"observed_at":"2026-08-06T11:07:20.524041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.504546Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":"02d525ad-8cae-40de-be16-cdcf5c2f33b9","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.122266Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:21b5d9f944a9ed5bdd4fd4b08cde02719f11b26db6413e56e88ffd05cafc4b8e","observation_id":"4f80dfef-9939-46f6-9a24-a32d0ec6e2e1","resolution":{"observed_at":"2026-08-06T11:07:20.508969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T11:07:20.126818Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.126818Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:b7ba2ec7f5f772bf280f3ca238f22ac80db56e2d73952168751c2a5197edc87d","observation_id":"4660fb3d-fdf7-40e6-89ae-fe74d8854c43","resolution":{"observed_at":"2026-08-06T11:07:20.126818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.489064Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"24a7acf2-ddda-42ab-89bd-0c1b57c059ff","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.131594Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:e069fe7b3868839e836d2074902fe39319fc78335e7fba36bb65b8b4c3efe035","observation_id":"dc30a259-434d-4211-a537-8b4b5270b804","resolution":{"observed_at":"2026-08-06T11:07:20.494265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.136841Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.136841Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:06ecbbf8984bcae5b5e8b7f3dd13009b83009d5e7fca6c71622598eedb255a26","observation_id":"d449bd73-c834-4a0d-80f1-de423635cec1","resolution":{"observed_at":"2026-08-06T11:07:20.136841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.463846Z","title":"Videopoet: A large language model for zero-shot video generation,","venue":null,"work_id":"05fabcff-cc80-452f-999f-191e3145ccd0","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.141428Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:5ad072ce9166c31406edda842aaba324c3aa67a8351dcc6c9ca2fb9538014c8a","observation_id":"ae742115-187d-4977-aa0a-de9c99ed3517","resolution":{"observed_at":"2026-08-06T11:07:20.468393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.448567Z","title":"Label independent memory for semi-supervised few-shot video classification,","venue":null,"work_id":"03a9734f-0997-45ea-b70f-24104fcbbb03","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.146030Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:f97b9ca50aac950d6a04fda39d5eb1a83c8125f2ba2893cc58e1f8c2a4635aea","observation_id":"1b317a51-829d-4de2-b82a-963fb5ab2e10","resolution":{"observed_at":"2026-08-06T11:07:20.453186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.434064Z","title":"Memory-enhanced transformer for representation learning on temporal heterogeneous graphs,","venue":null,"work_id":"c69c58da-9ede-4dbe-8ae2-e94d139cb888","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.150446Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:40570faa22790a4f3ccfb0bb8c5f356c93ec6e8eba7ff97a339129e4e53035e9","observation_id":"801c818e-be16-4958-8cb8-7cc96a45afc4","resolution":{"observed_at":"2026-08-06T11:07:20.438474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.419833Z","title":"An efficient memory module for graph few-shot class-incremental learning,","venue":null,"work_id":"737dedf9-2696-4b0e-a7b2-0738c6e7b4a4","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.155284Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:62e9cc81c83e92863e07c4822421662b02cfb47c9df3369a1db0c4172ccdbfb3","observation_id":"392e1a5d-4b2b-4ed8-b666-15d909101a2c","resolution":{"observed_at":"2026-08-06T11:07:20.424127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.403758Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"2a51d0ff-a74d-4a84-98f9-468974f0288d","year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.159521Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:0e3cf1fb51c491b74f0948fb6e39c93c70d45b27c4b0ad6ea6728fe57fa4580c","observation_id":"5b0982a6-d2e9-414b-bb65-99388e515b22","resolution":{"observed_at":"2026-08-06T11:07:20.408819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.387889Z","title":"Grounded language-image pre- training,","venue":null,"work_id":"d9c53368-0451-4fe7-ad60-db963da4c79c","year":2022},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.163885Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:8d77158925c314dd5c919a60316cbef7e6d6a1d23a41c03a4a00009c13d0b66b","observation_id":"a4b8a03c-d931-481a-88e3-c217fb40e66d","resolution":{"observed_at":"2026-08-06T11:07:20.392196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T11:07:20.168158Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.168158Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:28b839cff71a4ece753a0047a2179615c7b295c79e4374e3515c667d78154efc","observation_id":"0e899e0e-25bf-4e3e-ab1b-d6b312477551","resolution":{"observed_at":"2026-08-06T11:07:20.168158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.372825Z","title":"Delving into multimodal prompting for fine-grained visual classifica- tion,","venue":null,"work_id":"3603466d-e27b-4b7d-bcb5-f36dfff3f2d1","year":2024},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.173210Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:cb6cfd790f090153909513ae83c4e650356e752d484637b3667f5b6ef7fde43e","observation_id":"026a9884-f216-416a-b701-5d015e57fc77","resolution":{"observed_at":"2026-08-06T11:07:20.377514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.357434Z","title":"Amass: Archive of motion capture as surface shapes,","venue":null,"work_id":"1bd044f0-d630-474c-a460-85eb919be7e2","year":2019},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.177499Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:6d34b86467615d72d12627a284759ccf2933d4e886a6367d7cf3a2b65e8463fc","observation_id":"426b2e26-f8d3-4a76-b4a3-3f56eee89156","resolution":{"observed_at":"2026-08-06T11:07:20.361998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.342536Z","title":"Action2motion: Conditioned generation of 3d human motions,","venue":null,"work_id":"fdb71d56-023d-4f42-929b-093dd7ec34f6","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.181731Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:d0388a788d3ab758a4f2627c0780add8bbbcedbfda20048b411f77fd6cee215e","observation_id":"7ef95020-8e13-4f9c-9011-b7434957e4bd","resolution":{"observed_at":"2026-08-06T11:07:20.347117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T11:07:20.186032Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.186032Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:4dbc6a4bf0f8cbbc6a0f66a559598d155ff659496ea716125fb4ec40a52f6f97","observation_id":"0f038371-bae1-4e37-9541-80b9b3c4ff3d","resolution":{"observed_at":"2026-08-06T11:07:20.186032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:07:20.325187Z","title":"Randaugment: Practical automated data augmentation with a reduced search space,","venue":null,"work_id":"4f4074ef-6121-4db1-9772-ae1ac8696a3c","year":2020},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.190660Z"},"links":{"citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:ad6763722d9badfcd66e7590e0d4a58bd0db954e778975b1c44e1d218cff9829","observation_id":"b1a739eb-9df3-4685-bf1f-f5100fa96c4b","resolution":{"observed_at":"2026-08-06T11:07:20.331762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2507.23188."}